Nr.jina.ai и s.jina.ai - инструменты для получения чистого текста/Markdown с веб-страниц без написания парсеров - 2026

Материал из Wiki - Iphoster - the best ever hosting and support. 2005 - 2026
Перейти к:навигация, поиск

Published: 2026-07-21


r.jina.ai и s.jina.ai — это бесплатные сервисы компании Jina AI, предназначенные для преобразования веб-страниц в чистый текст и Markdown-разметку, удобные для consumption языковыми моделями (LLM), RAG-системами, поисковыми индексаторами и скриптами. Оба сервиса не требуют установки и работают через простую префиксную адресацию URL.

r.jina.ai — Reader

Reader (https://r.jina.ai/) — это API для извлечения читаемого содержимого с веб-страниц. Достаточно добавить префикс https://r.jina.ai/ перед любым URL, чтобы получить очищенную версию страницы в формате Markdown.

Как работает

# Простейший запрос
curl https://r.jina.ai/https://example.com

# С заголовком для управления форматом вывода
curl -H "x-respond-with: markdown" https://r.jina.ai/https://example.com

# Получение текста без Markdown-разметки
curl -H "x-respond-with: text" https://r.jina.ai/https://example.com

Поддерживаемые форматы

Reader работает не только с HTML-страницами, но и со многими другими форматами:

  • HTML-страницы (с рендерингом JavaScript при необходимости)
  • PDF-документы
  • Microsoft Word (.docx)
  • Microsoft Excel (.xlsx)
  • Microsoft PowerPoint (.pptx)
  • Изображения (с автоматической генерацией текстового описания)

Управление через HTTP-заголовки

Reader поддерживает ряд заголовков для тонкой настройки:

Заголовок Описание Допустимые значения
x-respond-with Формат ответа markdown, html, text, screenshot, pageshot
x-enginge Движок рендеринга readability (по умолчанию), chrome (для JavaScript-сайтов)
x-return-charset Кодировка utf-8 (по умолчанию)
x-timeout Таймаут запроса (в секундах) Число (по умолчанию 30)
x-no-cache Отключение кэширования true / false
x-with-generated-alt Включать AI-описания для изображений true / false
x-with-llmstxt Включать llms.txt если доступен true / false

Пример на Python

import requests

url = "https://r.jina.ai/https://en.wikipedia.org/wiki/Linux"
headers = {"x-respond-with": "markdown"}
response = requests.get(url, headers=headers)
print(response.text)

s.jina.ai — Search

Search (https://s.jina.ai/) — это поисковый сервис, который сначала выполняет веб-поиск по заданному запросу, а затем автоматически извлекает содержимое топ-5 результатов поиска через тот же движок Reader.

Как работает

# Поиск и получение содержимого результатов
curl "https://s.jina.ai/Когда+была+основана+Jina+AI"

# Поиск с ограничением по сайту
curl "https://s.jina.ai/When+was+Jina+AI+founded?site=jina.ai&site=github.com"

Пример на Python

import requests

query = "Linux kernel version history"
url = f"https://s.jina.ai/{query}"
response = requests.get(url)
print(response.text)

Преимущества

  • Бесплатность — сервисы бесплатны для продакшн-использования (существуют rate limits)
  • Простота — не требуется установка парсеров, Selenium, Playwright
  • Markdown на выходе — чистый формат, удобный для LLM
  • Поддержка многих форматов — HTML, PDF, DOCX, XLSX, PPTX, изображения
  • JavaScript-рендеринг — опциональный рендеринг через Chrome для SPA-сайтов
  • Масштабируемость — Jina AI поддерживает сервис как один из core-продуктов

Недостатки и ограничения

  • Зависимость от внешнего сервиса (при недоступности — работа парсинга встаёт)
  • Rate limits для бесплатного тарифа
  • Не все сайты корректно обрабатываются (особенно сложные SPA)
  • Потенциальные задержки при рендеринге через Chrome

Варианты использования

  • RAG-системы — получение чистого текста документов для векторной индексации
  • LLM-агенты — чтение веб-страниц в реальном времени
  • Веб-скрапинг — извлечение данных без написания парсеров
  • Поисковые индексаторы — преобразование HTML в текст для индексации
  • Подготовка данных — конвертация PDF/DOCX в Markdown для дальнейшей обработки
  • AI-автоматизация — интеграция в пайплайны обработки информации

Альтернативы

  • Firecrawl — аналогичный сервис с открытым исходным кодом
  • Browserless/Jina AI On-Prem — self-hosted решения для корпоративного использования
  • Trafilatura — библиотека Python для извлечения текста
  • BeautifulSoup + readability-lxml — классический подход

CLI-инструмент

Jina AI также предоставляет официальный CLI-инструмент (jina-cli), объединяющий все API (search, read, embed, rerank) через Unix pipes:

# Установка
pip install jina-cli

# Использование
jina read https://example.com
jina search "query text"

Ссылки

×
Реклама
ИКС