Кейсы 6 мин чтения

Распознавание и перевод старомонгольского текста по фото

Китайские сервисы оказались недоступны, поэтому текст на старописьменной монгольской вязи распознал открытой моделью image2bichig и сверил с опубликованной версией легенды. Три слоя результата, отчёт на 5 страниц и чёткая граница между надёжным и черновым.

кейсOCRпереводнейросети

Коротко (TL;DR)

  • Задача: распознать по фотографии текст на старописьменной монгольской вязи и перевести его. Мини-программы WeChat и китайские сервисы распознавания оказались недоступны.
  • Использовал открытую модель image2bichig из проекта tugstugi/mongolian-nlp, а сырой результат сверил с опубликованной версией той же легенды.
  • На выходе три слоя: транслитерация, современный монгольский на кириллице и русский перевод, плюс список мест, которые требуют сверки. Всё собрано в PDF на 5 страниц.
  • Верхний ярус текста надёжен по смыслу, нижний начиная с 16-й колонки — черновик. Для публикации нужна сверка носителем языка.

Когда нейросеть выдаёт перевод, он всегда выглядит одинаково уверенно — и там, где модель действительно поняла текст, и там, где она угадывала. Для делового письма это терпимо. Для старого текста, который потом могут напечатать или повесить на стену с подписью, — нет. Этот кейс про то, как я распознал и перевёл надпись на старописьменной монгольской вязи и почему главным результатом считаю не сам перевод, а честную границу между надёжным и черновым.

Задача

На входе была фотография текста на старописьменном монгольском. Это вертикальное письмо: строки идут сверху вниз колонками, буквы внутри слова связаны вязью, и одна и та же буква выглядит по-разному в начале, середине и конце слова. Обычные сервисы распознавания текста такое письмо не читают вообще.

Нужно было получить из фото читаемый текст и понять, о чём он, — то есть распознать, привести к современной записи и перевести на русский.

Что я сделал

Сначала пошёл по очевидному пути. Инструменты для такого письма есть в китайской экосистеме — мини-программы внутри WeChat и китайские сервисы распознавания. Но они оказались недоступны, и на этом варианте пришлось поставить крест.

Тогда я взял открытую модель image2bichig из проекта tugstugi/mongolian-nlp. Это открытый набор инструментов для монгольского языка, и image2bichig в нём отвечает именно за распознавание старописьменного текста с изображения. Преимущество открытой модели в том, что она не зависит от доступа к чужому сервису: её код и веса открыты, и никто не может закрыть к ней доступ посреди работы.

Модель выдала сырой распознанный текст. На этом останавливаться было нельзя: сырое распознавание вязи почти всегда содержит ошибки, и по нему одному не понять, где модель права, а где нет.

Сверка с опубликованной версией

Ключевой шаг — сверка. Текст на фото оказался легендой, у которой есть опубликованная версия. Я сопоставил сырой результат распознавания с этой публикацией.

Сверка решает сразу две задачи. Во-первых, она исправляет ошибки распознавания там, где текст совпадает с известным. Во-вторых — и это важнее — она показывает, где совпадения нет. Такие места либо ошибка модели, либо отличие именно этого экземпляра текста от опубликованного. Угадывать, какой из двух случаев перед нами, я не стал: эти места ушли в отдельный список.

Три слоя результата

Результат я разложил на три слоя, потому что разным читателям нужно разное.

Первый слой — транслитерация. Это побуквенная запись исходного текста привычным алфавитом. Она нужна специалисту: по ней можно проверить распознавание, не разбирая вязь на фотографии.

Второй слой — современный монгольский на кириллице. Старописьменная и современная запись заметно расходятся, поэтому это не просто смена алфавита, а приведение к тому, как текст прочитает сегодняшний носитель языка.

Третий слой — русский перевод. Это то, ради чего всё затевалось, но он стоит последним сознательно: перевод настолько надёжен, насколько надёжны два слоя под ним.

К трём слоям добавлен четвёртый блок — список мест, требующих сверки. Там собраны все участки, где распознавание сомнительно или расходится с опубликованной версией.

Что было сложно

Первое — доступ к инструментам. Путь через китайские сервисы закрылся сразу, и пришлось искать открытую модель. Хорошо, что такая нашлась, но это не гарантированный вариант для любого редкого письма.

Второе — неоднородность самого текста. Надпись на фото делится на ярусы, и качество распознавания по ним оказалось разным. Верхний ярус удалось прочитать надёжно по смыслу. Нижний ярус начиная с 16-й колонки — нет: там результат остаётся черновиком.

Третье, и самое тонкое, — удержаться от гладкого текста. Проще всего было бы выдать красивый связный перевод целиком, заполнив сомнительные места правдоподобными словами. Читатель бы ничего не заметил. Но тогда в отчёте надёжная часть и догадка выглядели бы одинаково, и никто не смог бы их разделить.

Что получилось

Итог — отчёт в PDF на 5 страниц.

Часть текстаСтатусЧто с ней делать
Верхний ярусНадёжен по смыслуМожно опираться на перевод
Нижний ярус, с 16-й колонкиЧерновикСверять с носителем языка
Места из списка сверкиПод вопросомПроверить по оригиналу

Главная мысль кейса — честно разделять надёжное и черновое. Верхний ярус можно использовать, чтобы понять содержание. Нижний и места из списка — нельзя выдавать за готовый перевод. Для публикации весь текст нужно сверить с носителем языка, и в отчёте это написано прямо.

Что дальше

Следующий шаг за заказчиком: показать отчёт носителю языка, который читает старописьменную вязь. Ему не придётся начинать с нуля — у него будет транслитерация, современная запись, перевод и готовый список мест, куда смотреть в первую очередь. Это экономит время специалиста, которое обычно и есть самая дорогая часть такой работы.

Частые вопросы

Может ли нейросеть прочитать старомонгольскую вязь?

Может, но не идеально. Открытая модель image2bichig из проекта tugstugi/mongolian-nlp распознаёт такой текст с изображения, но результат нужно сверять — с опубликованной версией, если она есть, и с носителем языка.

Почему не использовали китайские сервисы?

Мини-программы WeChat и китайские сервисы распознавания оказались недоступны. Открытая модель от чужого сервиса не зависит, поэтому выбор пал на неё.

Зачем три слоя, а не просто перевод?

Транслитерация позволяет проверить распознавание, современная кириллица — прочитать текст носителю, перевод — понять смысл остальным. Если что-то не так в переводе, по нижним слоям видно, на каком шаге возникла ошибка.

Можно ли публиковать такой перевод?

В этом виде — нет. Верхний ярус надёжен по смыслу, но нижний начиная с 16-й колонки остаётся черновиком. Перед публикацией нужна сверка носителем языка.

Подойдёт ли такой подход для других старых текстов?

Сам принцип — да: распознать открытой моделью, сверить с известными источниками и честно пометить сомнительные места. Но наличие рабочей модели для конкретного письма нужно проверять каждый раз.

Коротко о главном

Текст на старописьменной монгольской вязи удалось распознать по фото открытой моделью image2bichig, сверить с опубликованной версией легенды и разложить на транслитерацию, современную кириллицу и русский перевод. Отчёт занял 5 страниц.

Ценность результата не только в переводе, а в том, что в нём видно, чему можно верить. Верхний ярус надёжен, нижний с 16-й колонки — черновик, сомнительные места собраны в список. Гладкий перевод без таких пометок выглядел бы солиднее, но опираться на него было бы нельзя.

Если у вас есть документ, надпись или архив на редком языке или старом письме и нужно понять, что там написано и насколько этому можно доверять, — я подберу инструмент, распознаю и честно отмечу границы надёжного. Напишите в Telegram, MAX или VK.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх