Nr.jina.ai и s.jina.ai - инструменты для получения чистого текста/Markdown с веб-страниц без написания парсеров - 2026
Published: 2026-07-21
r.jina.ai и s.jina.ai — это бесплатные сервисы компании Jina AI, предназначенные для преобразования веб-страниц в чистый текст и Markdown-разметку, удобные для consumption языковыми моделями (LLM), RAG-системами, поисковыми индексаторами и скриптами. Оба сервиса не требуют установки и работают через простую префиксную адресацию URL.
r.jina.ai — Reader
Reader (https://r.jina.ai/) — это API для извлечения читаемого содержимого с веб-страниц. Достаточно добавить префикс https://r.jina.ai/ перед любым URL, чтобы получить очищенную версию страницы в формате Markdown.
Как работает
# Простейший запрос curl https://r.jina.ai/https://example.com # С заголовком для управления форматом вывода curl -H "x-respond-with: markdown" https://r.jina.ai/https://example.com # Получение текста без Markdown-разметки curl -H "x-respond-with: text" https://r.jina.ai/https://example.com
Поддерживаемые форматы
Reader работает не только с HTML-страницами, но и со многими другими форматами:
- HTML-страницы (с рендерингом JavaScript при необходимости)
- PDF-документы
- Microsoft Word (.docx)
- Microsoft Excel (.xlsx)
- Microsoft PowerPoint (.pptx)
- Изображения (с автоматической генерацией текстового описания)
Управление через HTTP-заголовки
Reader поддерживает ряд заголовков для тонкой настройки:
| Заголовок | Описание | Допустимые значения |
|---|---|---|
x-respond-with |
Формат ответа | markdown, html, text, screenshot, pageshot
|
x-enginge |
Движок рендеринга | readability (по умолчанию), chrome (для JavaScript-сайтов)
|
x-return-charset |
Кодировка | utf-8 (по умолчанию)
|
x-timeout |
Таймаут запроса (в секундах) | Число (по умолчанию 30) |
x-no-cache |
Отключение кэширования | true / false
|
x-with-generated-alt |
Включать AI-описания для изображений | true / false
|
x-with-llmstxt |
Включать llms.txt если доступен | true / false
|
Пример на Python
import requests
url = "https://r.jina.ai/https://en.wikipedia.org/wiki/Linux"
headers = {"x-respond-with": "markdown"}
response = requests.get(url, headers=headers)
print(response.text)
s.jina.ai — Search
Search (https://s.jina.ai/) — это поисковый сервис, который сначала выполняет веб-поиск по заданному запросу, а затем автоматически извлекает содержимое топ-5 результатов поиска через тот же движок Reader.
Как работает
# Поиск и получение содержимого результатов curl "https://s.jina.ai/Когда+была+основана+Jina+AI" # Поиск с ограничением по сайту curl "https://s.jina.ai/When+was+Jina+AI+founded?site=jina.ai&site=github.com"
Пример на Python
import requests
query = "Linux kernel version history"
url = f"https://s.jina.ai/{query}"
response = requests.get(url)
print(response.text)
Преимущества
- Бесплатность — сервисы бесплатны для продакшн-использования (существуют rate limits)
- Простота — не требуется установка парсеров, Selenium, Playwright
- Markdown на выходе — чистый формат, удобный для LLM
- Поддержка многих форматов — HTML, PDF, DOCX, XLSX, PPTX, изображения
- JavaScript-рендеринг — опциональный рендеринг через Chrome для SPA-сайтов
- Масштабируемость — Jina AI поддерживает сервис как один из core-продуктов
Недостатки и ограничения
- Зависимость от внешнего сервиса (при недоступности — работа парсинга встаёт)
- Rate limits для бесплатного тарифа
- Не все сайты корректно обрабатываются (особенно сложные SPA)
- Потенциальные задержки при рендеринге через Chrome
Варианты использования
- RAG-системы — получение чистого текста документов для векторной индексации
- LLM-агенты — чтение веб-страниц в реальном времени
- Веб-скрапинг — извлечение данных без написания парсеров
- Поисковые индексаторы — преобразование HTML в текст для индексации
- Подготовка данных — конвертация PDF/DOCX в Markdown для дальнейшей обработки
- AI-автоматизация — интеграция в пайплайны обработки информации
Альтернативы
- Firecrawl — аналогичный сервис с открытым исходным кодом
- Browserless/Jina AI On-Prem — self-hosted решения для корпоративного использования
- Trafilatura — библиотека Python для извлечения текста
- BeautifulSoup + readability-lxml — классический подход
CLI-инструмент
Jina AI также предоставляет официальный CLI-инструмент (jina-cli), объединяющий все API (search, read, embed, rerank) через Unix pipes:
# Установка pip install jina-cli # Использование jina read https://example.com jina search "query text"
