Документы и OCR
Surya OCR
Компактный набор OCR от авторов Marker и Chandra: распознавание текста, макет страницы, порядок чтения и таблицы. Surya OCR 2 (650M) работает и на процессоре, русский в замерах 88,8%.
- Разработчик
- Datalab, США
- Первый выпуск
- фев 2024
- Последний выпуск
- июл 2026
- Размеры
- до 650M
- Лицензия
- Коммерция с условиямиКод Apache 2.0; веса — модифицированная AI Pubs OpenRAIL-M: бесплатно для исследований, личного использования и компаний с выручкой и инвестициями до 5 млн долларов, остальным — платная лицензия. Ранние веса 2024 года — CC BY-NC-SA
- Русский язык
- Есть
- Запуск
- Через свой серверРаботает и без видеокарты
- Сферы
- Документы и бухгалтерия, Финансы, Юристы
Какие задачи решает
- Распознавание сканов и PDF, в том числе на русском
- Разметка страницы: заголовки, таблицы, картинки, порядок чтения
- Распознавание таблиц по строкам и столбцам
- Потоковая обработка больших архивов на своём сервере
Где применяется
ДокументооборотБухгалтерияАрхивы и библиотекиЮридические отделы
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версийКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- Surya Layout 2
- Surya OCR 2 (650M, одна модель на всё)
- Распознавание v2 и таблицы
- Макет и порядок чтения
- Surya (детекция и распознавание)
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Документы и OCRChandra OCRDatalab · СШАКоммерция с условиями
Сильная OCR-модель от авторов Marker и Surya: рукописный текст, формы, таблицы. По карточке поддерживает 90+ языков, русский есть среди примеров.
ПодробнееДокументы и OCRPP-OCR и PP-DocLayout (классический PaddleOCR)Baidu (PaddlePaddle) · КитайМожно в коммерциюКлассические лёгкие модели PaddleOCR: поиск и распознавание строк текста плюс разметка страницы. Работают на процессоре и телефонах; есть отдельная модель для восточнославянских языков, включая русский.
ПодробнееДокументы и OCRSmolDocling и Granite-DoclingIBM и Hugging Face · СШАМожно в коммерциюКрошечные модели для открытого конвертера документов Docling: переводят страницу в разметку с таблицами, формулами и кодом. Работают на обычном ноутбуке.
Подробнее

