Стек под юридический отдел: договор, свод, обезличивание
Договоры это тот случай, когда цена ошибки известна заранее, поэтому связку собирают так, чтобы каждый шаг можно было проверить. Сначала документ надо надёжно прочитать вместе со сложной вёрсткой, потом найти в своде похожие пункты и вашу утверждённую редакцию, потом сравнить и объяснить расхождения, и отдельно закрыть вопрос персональных данных до того, как что-то уйдёт наружу. Модель здесь помощник юриста, а не его замена.
Договоры приходят сканами и PDF, где половина смысла в нумерации пунктов, сносках, приложениях и таблицах. Модели распознавания документов вытаскивают не просто текст, а структуру: пункт, подпункт, ссылку на приложение. Если выкинуть этот шаг, разбор поедет на уровне нумерации, и ссылка на пункт о неустойке уедет к другому разделу, чего в правовой работе быть не должно.
Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.
Популярный открытый инструмент перевода PDF в Markdown со своей небольшой моделью. MinerU2.5-Pro улучшили только за счёт данных, без роста размера. Языки в карточке — китайский и английский.
Перевод PDF-отчётов и договоров в Markdown
Распознавание таблиц и формул
Подготовка документов для RAG и поиска
Размеры
0.9B – 1.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Шаг 2. Найти похожее в своём своде
Поиск по смыслу поднимает из вашего архива утверждённые формулировки, прошлые редакции и договоры с тем же контрагентом. Часть моделей ищет прямо по странице документа, вместе с её вёрсткой, что удобно для сканов. Без этого шага юрист вычитывает каждый договор с нуля, а компания снова и снова обсуждает то, о чём уже договаривалась два года назад.
Поиск по PDF и сканам как по картинкам: страницу не нужно распознавать, модель сразу находит нужную по вопросу, включая таблицы и схемы. Обучены на английском.
Сильные многоязычные реранкеры; m0 сортирует и страницы-картинки (сканы, слайды). Свежие версии открыты только для некоммерческого использования.
Уточнение выдачи перед ответом чат-бота
Сортировка найденных страниц PDF и слайдов
Поиск по каталогу и базе знаний
Размеры
33M – 2.4B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Шаг 3. Сравнить и объяснить расхождения
Языковая модель сопоставляет присланный текст с вашей редакцией и выписывает отличия обычным языком: срок оплаты, ответственность, порядок расторжения, подсудность. Она отмечает подозрительное, а решение принимает юрист, поэтому каждое замечание должно указывать на пункт. Без этого звена черновая вычитка занимает часы, а мелкие правки контрагента замечают уже после подписания.
Флагманская линия DeepSeek: от первых 7B/67B до V4-Pro на 1,6 трлн параметров. Уровень закрытых моделей при открытой MIT-лицензии; картинки понимают V4-Flash-Vision-Exp и V4.1-Flash, контекст до 1 млн токенов.
Ассистент для сотрудников на своём сервере
Разбор длинных договоров и отчётов
Агенты, которые работают с инструментами и API
Размеры
7B – 1.6T-A49B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Шаг 4. Обезличить перед отправкой
Отдельная модель находит в тексте персональные данные и реквизиты и заменяет их метками, прежде чем документ уйдёт во внешний сервис или в общую базу. Работает она узко и быстро, ничего не переписывая по смыслу. Без этого звена любая обработка договоров снаружи превращается в передачу данных людей, которую придётся объяснять, и это уже не техническая задача.
Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США
Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.
Маскирование персональных данных перед облачным ИИ
Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.
Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.
Очистка текста от персональных данных перед отправкой в облачный ИИ
Поиск паролей и ключей в текстах
Обезличивание переписки для аналитики
Размеры
1.5B (50M активных)
Железо
от: Ноутбук
Можно в коммерциюПодробнее
На что смотреть до внедрения
Здесь важнее обычного помнить, что модель ошибается уверенно: пропущенный пункт выглядит так же спокойно, как и найденный. Поэтому связку ставят как черновую вычитку и подсветку рисков, а не как согласование, и каждое замечание проверяется юристом по тексту договора. Полезно вести журнал, кто и что принял, иначе не разобрать, откуда в подписанной редакции взялась формулировка. Правовые вопросы, персональные данные и допустимость обработки описаны здесь в общих чертах, конкретный случай смотрит юрист.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
ПодберуМодель и размер под задачу и бюджет на железо
ПоставлюНа ваш сервер или в закрытый контур, с API