Документы и OCR
olmOCR
Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.
- Разработчик
- Ai2 (Allen Institute for AI), США
- Первый выпуск
- фев 2025
- Последний выпуск
- окт 2025
- Размеры
- 7B
- Лицензия
- Можно в коммерциюApache 2.0
Какие задачи решает
- Массовая оцифровка архива PDF
- Распознавание договоров и отчётов в текст
- Подготовка документов для поиска и RAG
- Распознавание таблиц
Где применяется
ДокументооборотЮридические отделыАрхивы и библиотеки
Требования к железу
НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
нет версий1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
подходитКластерСервер с несколькими видеокартами — флагманские версии
нет версийВерсии
- olmOCR-2-7B-1025
- olmOCR-7B-0825
- olmOCR-7B-0725
- olmOCR-7B-0225-preview
Как внедряю у заказчика
- ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
- УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
- ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
- ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.
Похожие модели
Документы и OCRMinerUShanghai AI Laboratory (OpenDataLab) · КитайМожно в коммерцию
Популярный открытый инструмент перевода PDF в Markdown со своей небольшой моделью. MinerU2.5-Pro улучшили только за счёт данных, без роста размера. Языки в карточке — китайский и английский.
ПодробнееДокументы и OCRChandra OCRDatalab · СШАКоммерция с условиямиСильная OCR-модель от авторов Marker и Surya: рукописный текст, формы, таблицы. По карточке поддерживает 90+ языков, русский есть среди примеров.
ПодробнееДокументы и OCRdots.ocrrednote hilab (Xiaohongshu) · КитайМожно в коммерциюМногоязычная модель для разбора документов: текст, таблицы, формулы и порядок чтения за один проход. dots.mocr ещё переводит графики и схемы в векторный SVG.
Подробнее

