Стек под юридический отдел: договор, свод, обезличивание

Договоры это тот случай, когда цена ошибки известна заранее, поэтому связку собирают так, чтобы каждый шаг можно было проверить. Сначала документ надо надёжно прочитать вместе со сложной вёрсткой, потом найти в своде похожие пункты и вашу утверждённую редакцию, потом сравнить и объяснить расхождения, и отдельно закрыть вопрос персональных данных до того, как что-то уйдёт наружу. Модель здесь помощник юриста, а не его замена.

Шаг 1. Прочитать документ вместе с вёрсткой

Договоры приходят сканами и PDF, где половина смысла в нумерации пунктов, сносках, приложениях и таблицах. Модели распознавания документов вытаскивают не просто текст, а структуру: пункт, подпункт, ссылку на приложение. Если выкинуть этот шаг, разбор поедет на уровне нумерации, и ссылка на пункт о неустойке уедет к другому разделу, чего в правовой работе быть не должно.

Чем это делается

Документы и OCRНе развивается2023

Nougat

Meta · США

Ранняя модель, переводящая научные PDF в текст с формулами. Сегодня устарела, её обходят почти все современные OCR-модели.

  • Перевод научных статей из PDF в текст с формулами
  • Оцифровка технической документации
Размеры
250M – 350M
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Документы и OCRGGUF2025

olmOCR

Ai2 (Allen Institute for AI) · США

Модель и набор инструментов для массового перевода PDF в чистый текст с сохранением порядка чтения, таблиц и формул. Рассчитана на обработку миллионов страниц.

  • Массовая оцифровка архива PDF
  • Распознавание договоров и отчётов в текст
  • Подготовка документов для поиска и RAG
Размеры
7B
Железо
от: 1 видеокарта
Можно в коммерциюПодробнее
Документы и OCRGGUF2025–2026

MinerU

Shanghai AI Laboratory (OpenDataLab) · Китай

Популярный открытый инструмент перевода PDF в Markdown со своей небольшой моделью. MinerU2.5-Pro улучшили только за счёт данных, без роста размера. Языки в карточке — китайский и английский.

  • Перевод PDF-отчётов и договоров в Markdown
  • Распознавание таблиц и формул
  • Подготовка документов для RAG и поиска
Размеры
0.9B – 1.2B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 2. Найти похожее в своём своде

Поиск по смыслу поднимает из вашего архива утверждённые формулировки, прошлые редакции и договоры с тем же контрагентом. Часть моделей ищет прямо по странице документа, вместе с её вёрсткой, что удобно для сканов. Без этого шага юрист вычитывает каждый договор с нуля, а компания снова и снова обсуждает то, о чём уже договаривалась два года назад.

Чем это делается

Поиск по сканам документов2024–2025

ColPali / ColQwen

Illuin Technology (команда ViDoRe) · Франция

Поиск по PDF и сканам как по картинкам: страницу не нужно распознавать, модель сразу находит нужную по вопросу, включая таблицы и схемы. Обучены на английском.

  • Поиск по сканам, презентациям и PDF
  • RAG по документам с таблицами и графиками
  • Поиск по технической документации
Размеры
256M – 3B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
Поиск и RAGRUOllamaНе развивается2024

BGE-M3

BAAI · Китай

Модель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.

  • Поиск по базе документов
  • RAG для чат-бота
  • Поиск похожих обращений и дублей
Размеры
568M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
РеранкерыGGUF2024–2026

Jina Reranker

Jina AI · Германия

Сильные многоязычные реранкеры; m0 сортирует и страницы-картинки (сканы, слайды). Свежие версии открыты только для некоммерческого использования.

  • Уточнение выдачи перед ответом чат-бота
  • Сортировка найденных страниц PDF и слайдов
  • Поиск по каталогу и базе знаний
Размеры
33M – 2.4B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее

Шаг 3. Сравнить и объяснить расхождения

Языковая модель сопоставляет присланный текст с вашей редакцией и выписывает отличия обычным языком: срок оплаты, ответственность, порядок расторжения, подсудность. Она отмечает подозрительное, а решение принимает юрист, поэтому каждое замечание должно указывать на пункт. Без этого звена черновая вычитка занимает часы, а мелкие правки контрагента замечают уже после подписания.

Чем это делается

ТекстНе развивается2024

SaulLM

Equall · Франция

Языковые модели для юридических текстов, дообученные на базах права США и Европы (основа Mistral и Mixtral). Только английский.

  • Разбор договоров на английском
  • Поиск рисков и нестандартных условий
  • Черновики юридических справок
Размеры
7B – 141B
Железо
от: Ноутбук
Можно в коммерциюПодробнее
ТекстRUOllama2023–2026

Qwen

Alibaba · Китай

Семейство языковых моделей с сильным русским языком: от маленьких версий для ноутбука до флагмана уровня коммерческих API.

  • Чат-бот и ассистент по базе знаний
  • Ответы на письма и обращения
  • Разбор и классификация документов
Размеры
0,6B – 2,4T-A95B
Железо
от: Ноутбук
Коммерция с условиямиПодробнее
ТекстOllama2023–2026

DeepSeek

DeepSeek · Китай

Флагманская линия DeepSeek: от первых 7B/67B до V4-Pro на 1,6 трлн параметров. Уровень закрытых моделей при открытой MIT-лицензии; картинки понимают V4-Flash-Vision-Exp и V4.1-Flash, контекст до 1 млн токенов.

  • Ассистент для сотрудников на своём сервере
  • Разбор длинных договоров и отчётов
  • Агенты, которые работают с инструментами и API
Размеры
7B – 1.6T-A49B
Железо
от: Ноутбук
Можно в коммерциюПодробнее

Шаг 4. Обезличить перед отправкой

Отдельная модель находит в тексте персональные данные и реквизиты и заменяет их метками, прежде чем документ уйдёт во внешний сервис или в общую базу. Работает она узко и быстро, ничего не переписывая по смыслу. Без этого звена любая обработка договоров снаружи превращается в передачу данных людей, которую придётся объяснять, и это уже не техническая задача.

Чем это делается

Модерация и безопасность2024–2026

GLiNER-PII

Сообщество GLiNER (Fastino, Knowledgator, NVIDIA и др.) · США

Маленькие модели на основе GLiNER для поиска персональных данных: паспортов, телефонов, счетов, адресов. Типы данных задаются словами. Русский официально не заявлен.

  • Маскирование персональных данных перед облачным ИИ
  • Поиск паспортных данных и реквизитов в документах
  • Проверка выгрузок на утечки
Размеры
около 200M – 500M
Железо
от: Ноутбук
Можно в коммерциюПодробнее
Модерация и безопасность2024

Piiranha

iiiorg · не указана

Популярный детектор 17 типов персональных данных на шести европейских языках. Русского нет, лицензия некоммерческая — подходит для проб и исследований.

  • Поиск персональных данных в текстах
  • Сравнение качества детекторов PII
Размеры
278M
Железо
от: Ноутбук
Только некоммерческоеПодробнее
Модерация и безопасность2026

OpenAI Privacy Filter

OpenAI · США

Находит и скрывает персональные данные: имена, адреса, телефоны, почту, номера счетов, пароли. Работает даже в браузере. Обучена в основном на английском.

  • Очистка текста от персональных данных перед отправкой в облачный ИИ
  • Поиск паролей и ключей в текстах
  • Обезличивание переписки для аналитики
Размеры
1.5B (50M активных)
Железо
от: Ноутбук
Можно в коммерциюПодробнее

На что смотреть до внедрения

Здесь важнее обычного помнить, что модель ошибается уверенно: пропущенный пункт выглядит так же спокойно, как и найденный. Поэтому связку ставят как черновую вычитку и подсветку рисков, а не как согласование, и каждое замечание проверяется юристом по тексту договора. Полезно вести журнал, кто и что принял, иначе не разобрать, откуда в подписанной редакции взялась формулировка. Правовые вопросы, персональные данные и допустимость обработки описаны здесь в общих чертах, конкретный случай смотрит юрист.

Другие стеки

Нужна модель под вашу задачу?

Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.

  1. ПодберуМодель и размер под задачу и бюджет на железо
  2. ПоставлюНа ваш сервер или в закрытый контур, с API
  3. ДообучуНа ваших данных или подключу базу знаний
  4. ВстроюВ CRM, 1С, бота, сайт или рабочий чат
Обсудить внедрение