NLLB: переводчик на 200 языков, но бизнесу лицензия запрещает
В ленте появился локальный переводчик NLLB 3.3B на 200 языков. Я проверил карточку модели: русский, китайский и монгольский есть, бурятского нет, а лицензия CC-BY-NC не разрешает коммерческое использование. Разбираю, чем заменить для бизнеса.
Сделаю под ключ: разберу задачу, назову срок и цену. Чтобы начать, напишите в Telegram одной фразой.
IT для работы с КитаемЧто за переводчик на 200 языков попал в ленту
9 октября 2026 года в канале «GitHub Community» вышел пост про «локальную версию NLLB 3.3B»: около 200 языков, работает даже на слабых устройствах, дообучена и учитывает контекст всей фразы. Ссылку из поста мне открыть не удалось, поэтому назвать ту самую дообученную версию я не могу. Производных от 3.3B на Hugging Face много, но «ту самую» среди них я не подтвердил.
Первоисточник один. Это модель facebook/nllb-200-3.3B из проекта No Language Left Behind, код и описание лежат в ветке nllb репозитория fairseq. Про «контекст всей фразы» в карточке оригинала ничего нет. Там сказано, что модель переводит отдельные предложения.
Главный вопрос: можно ли это в бизнесе
Нет. В карточке стоит «License: CC-BY-NC», в метаданных cc-by-nc-4.0. В репозитории Meta отдельно записано, что все модели NLLB-200 выпущены под CC-BY-NC 4.0, а MIT покрывает только код. По тексту лицензии «некоммерческое» значит использование, которое не направлено в первую очередь на коммерческую выгоду или денежное вознаграждение. Перевод переписки с поставщиком, описаний товаров для продажи и клиентских документов под это не подходит.
Есть и второй запрет. В разделе out-of-scope карточка называет NLLB-200 исследовательской моделью, которая не выпущена для продакшена. Я не юрист, окончательный ответ даст юрист или Meta. Но внедрять клиенту рабочий перевод на этих весах я не буду.
С дообученными копиями история та же. У многих в метаданных тоже cc-by-nc-4.0, у некоторых другая метка, например cc-by-4.0. Метка на копии не снимает вопрос про исходные веса, без юриста такие версии я бы не брал.
Какие языки есть, а каких нет
Список языков из карточки (коды FLORES-200) я проверил. Есть русский (rus_Cyrl), китайский упрощённый и традиционный (zho_Hans, zho_Hant), монгольский халха (khk_Cyrl), казахский, киргизский, северный узбекский, таджикский, туркменский, уйгурский, татарский. Есть английский, японский, корейский, вьетнамский, турецкий.
Бурятского в списке нет. Якутского, калмыцкого и тувинского тоже. Монгольский есть только халха в кириллице. Для заказчика из Бурятии или Забайкалья это важно: среди «200 языков» вашего может не оказаться.
Железо и как запускается
Оригинальные веса 3.3B лежат в трёх файлах .bin общим размером около 17,6 ГБ (в конфиге указан float32). Карточка показывает загрузку через transformers: AutoModelForSeq2SeqLM и device_map="auto". Там же предупреждение, что готовый «translation» pipeline в transformers 5 не поддерживается.
Для сервера удобнее CTranslate2 (лицензия MIT). Он поддерживает NLLB и умеет сжимать веса до int8 или fp16. Готовая конвертация 3.3B в int8 весит около 3,4 ГБ, но это копия тех же весов с той же некоммерческой лицензией.
Сколько памяти модель занимает в работе, в карточке не написано, и я не замерял. По размеру файла int8 можно предположить, что сервер с 8 ГБ памяти потянет, но это моя прикидка. «Слабые устройства» из поста выглядят сомнительно: 3,3 млрд параметров это сервер, телефон такое не потянет.
Модель без сервиса: NLLB и LibreTranslate
LibreTranslate, о котором я писал в статье про свой переводчик на своём сервере, это готовое приложение: страница, API, ключи, лимиты. У NLLB есть только веса. Обёртку с API, очередь, нарезку текста на предложения, глоссарий и журнал ошибок собирают вокруг неё отдельно.
Лицензии альтернатив я проверил по карточкам:
- M2M100 1.2B (facebook/m2m100_1.2B): MIT, 100 языков, среди них русский, китайский и монгольский. Бурятского нет.
- MADLAD-400 3B (google/madlad400-3b-mt): Apache 2.0, больше 400 языков. В списке языков карточки есть ru, zh, mn и bua (бурятский). Авторы оговаривают, что для продакшена модели не оценивались. Веса весят 11,8 ГБ, квантованная версия 1,65 ГБ.
- Index-Translate от Bilibili: Apache 2.0, 150 языков. Подробно писал в статье про открытые модели перевода для китайских поставщиков.
Качество этих моделей на ваших текстах я не измерял, цифр не дам.
Где это не сработает
Ограничения перечислены в карточке. Модель рассчитана на перевод одного предложения, а не документа. Обучали её на входах до 512 токенов, на длинных текстах качество может падать. Она обучена на общих текстах и не предназначена для медицинских и юридических. Её перевод нельзя выдавать за заверенный. Проверяли в основном на материалах Википедии.
Механизма глоссария в карточке нет, значит названия ваших товаров и артикулы подменяет обвязка. Модель получает строку текста: таблицу, PDF или накладную сначала надо разобрать и разбить на части. Про качество карточка называет метрики BLEU, spBLEU, chrF++ на FLORES-200 и человеческую оценку XSTS. Своих оценок я не заявляю.
Что можно сделать уже сейчас
Шаг 1. Выпишите, что и сколько вы переводите: переписка с поставщиком, карточки товаров, договоры. Договоры и всё про оплату читает человек при любой модели.
Шаг 2. Соберите 30-50 реальных текстов своей пары, например русский и китайский, и эталонный перевод к ним. Считайте ошибки в числах, названиях и терминах.
Шаг 3. Прогоните тексты через модель с разрешающей лицензией, MADLAD или M2M100, и сравните с тем, чем переводите сейчас. Коммерческие данные клиента в модель с лицензией NC не загружайте.
Шаг 4. Если нужен готовый сервис без возни, начните с LibreTranslate и подключите его к боту, 1С, складу или сайту. Как это делается для работы с Китаем, описано на странице IT для работы с Китаем, стоимость на странице цен. Переписку с поставщиком я разбирал в статье про ИИ-переводчика, документы и переговоры в статье про AI-перевод и Китай.
Частые вопросы
Можно ли использовать NLLB-200 в коммерческом проекте?
По карточке и по репозиторию Meta веса выпущены под CC-BY-NC 4.0, то есть для некоммерческого использования, и названы исследовательской моделью без выпуска в продакшен. Для платного перевода клиента я её не использую. Уточнить стоит у юриста или Meta.
Есть ли бурятский?
В NLLB-200 нет. В списке языков карточки MADLAD-400 бурятский заявлен, но качество перевода на нём надо проверять на ваших текстах.
Нужна ли видеокарта?
В карточке NLLB требований к железу нет. CTranslate2 работает и на процессоре, и на видеокарте. Скорость я замеряю на вашем сервере до запуска.
Коротко о главном
NLLB-200 3.3B покрывает 200 языков, включая русский, китайский и монгольский, но веса под CC-BY-NC 4.0 и названы исследовательскими. Для платного перевода переписки, товаров и документов она не подходит, а в посте не нашлось подтверждения ни дообучению, ни контексту всей фразы. Для бизнеса беру модели с Apache 2.0 или MIT и проверяю лицензию в карточке до начала работ.
Хотите перевод переписки, карточек или складских документов на своём сервере и без облака? Напишите мне в Telegram слово «ЛИНГВО». Подберу модель с нормальной лицензией и проверю её на ваших текстах.
Что я делаю для бизнеса
Напишите одной фразой, что нужно. Отвечу, что подойдёт, сколько займёт и сколько стоит. Сообщение уже подготовлено.
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


