🚀 Jina-OCR-v1 разбирает целые страницы в Markdown со скоростью 2,57 страницы/с
Jina AI представила Jina-OCR-v1 - OCR-модель для преобразования документов в структурированный Markdown.
Главное:
- 91,14 на OmniDocBench v1.6;
- 83,4 на olmOCR-Bench;
- на 7,4 пункта выше DeepSeek-OCR на olmOCR-Bench;
- до 2,57 страницы/с;
- лучший throughput среди 14 протестированных систем при concurrency 32;
- сохраняет текст, формулы, таблицы и порядок чтения за один проход.
Архитектура тоже интересная: модель на 3,4B параметров использует MoE и активирует около 570M параметров на токен. Для ускорения декодирования применяется FastMTP.
Подойдёт для PDF, научных статей, отчётов, таблиц и других сложных документов, где обычного OCR уже недостаточно.
Лицензия: CC BY-NC 4.0. Для коммерческого использования нужно отдельное разрешение.
ModelScope:
https://modelscope.ai/models/jinaai/
Paper: https://modelscope.ai/papers/2609.03
Jina AI представила Jina-OCR-v1 - OCR-модель для преобразования документов в структурированный Markdown.
Главное:
- 91,14 на OmniDocBench v1.6;
- 83,4 на olmOCR-Bench;
- на 7,4 пункта выше DeepSeek-OCR на olmOCR-Bench;
- до 2,57 страницы/с;
- лучший throughput среди 14 протестированных систем при concurrency 32;
- сохраняет текст, формулы, таблицы и порядок чтения за один проход.
Архитектура тоже интересная: модель на 3,4B параметров использует MoE и активирует около 570M параметров на токен. Для ускорения декодирования применяется FastMTP.
Подойдёт для PDF, научных статей, отчётов, таблиц и других сложных документов, где обычного OCR уже недостаточно.
Лицензия: CC BY-NC 4.0. Для коммерческого использования нужно отдельное разрешение.
ModelScope:
https://modelscope.ai/models/jinaai/
Paper: https://modelscope.ai/papers/2609.03
👍9❤6🔥4