Словарь терминов про ИИ-модели
Термины, которые встречаются в каталоге и в разговоре с подрядчиком. Коротко и без формул: что это такое и зачем вам это знать.
- Апскейл
- Увеличение разрешения картинки или видео с дорисовкой деталей. Помогает вытянуть мелкие фотографии товара до требований площадки или поднять старую съёмку до приличного вида. Важно помнить, что модель дорисовывает правдоподобное, а не восстанавливает утраченное: мелкий текст на этикетке после увеличения может оказаться выдуманным.
- Батч
- Пачка запросов, которые обрабатываются вместе, а не по одному. Так железо используется намного эффективнее, и обработка тысячи документов за ночь обходится дешевле, чем та же тысяча по одному в течение дня. Обратная сторона в том, что отдельный ответ ждёт своей пачки, поэтому для живого разговора батчи держат маленькими.
- Бенчмарк
- Стандартный набор заданий, на котором сравнивают модели между собой. Полезен для отсева заведомо слабых вариантов и бесполезен как обещание результата у вас: ваши документы, язык и задачи в него не входили. Решение принимают по своему замеру на своих примерах, а таблицы из интернета используют только для первичного отбора.
- Векторная база
- Хранилище тех самых числовых отпечатков вместе со ссылками на исходные документы. Обычная база ищет по точному совпадению, а эта по близости смысла. Для бизнеса это техническая деталь с одним практическим следствием: при изменении регламента нужно не только заменить файл, но и пересчитать его отпечатки, иначе поиск будет выдавать старую редакцию.
- Веса
- Числа внутри модели, которые и есть всё, чему она научилась. Модель без весов это пустая коробка: архитектура известна, но отвечать ей нечем. Веса занимают от сотен мегабайт до сотен гигабайт, и именно их скачивают, хранят и обновляют, когда говорят, что модель поставили на свой сервер.
- Видеопамять
- Память на видеокарте, в которую модель должна поместиться целиком, чтобы работать быстро. Это главный ограничитель при выборе: не скорость процессора и не объём диска, а сколько гигабайт на карте. Если модель не влезает, она либо не запустится, либо будет отвечать в разы медленнее, что убивает сценарии с живым разговором и поддержкой.
- Водяной знак
- Скрытая или видимая пометка, по которой можно понять, что материал сгенерирован. Часть моделей ставит её автоматически, часть нет, и снять её нетрудно, поэтому полагаться на неё как на защиту не стоит. Для компании полезнее собственное правило: помечать синтетический контент в своих материалах и хранить исходники.
- Галлюцинация
- Уверенно сказанная неправда: модель придумывает пункт договора, ссылку или цифру, которых не было. Это не поломка, а свойство: модель подбирает правдоподобное продолжение текста, а не проверяет факты. Лечится не уговорами в инструкции, а тем, что ответ строится на найденных документах и проверяется отдельным звеном до показа человеку.
- Датасет
- Набор данных, на котором модель учили или на котором вы её проверяете. У вас это обычно выгрузка переписки, архив документов или папка снимков с камеры. Собрать честный проверочный набор из реальных, в том числе неудобных случаев, обычно дольше, чем настроить саму модель, но именно он определяет, можно ли верить результату.
- Детекция
- Поиск объектов на изображении с указанием, где именно они находятся. На этом держатся счётчики на складе, контроль зон и проверка средств защиты. Работает быстро и прямо на площадке, без отправки видео наружу. Качество решают не столько модели, сколько камеры, свет и чистый объектив.
- Диаризация
- Разделение записи по говорящим: кто из участников произнёс каждую фразу. Без неё расшифровка звонка это сплошной текст, по которому нельзя ни оценить работу оператора, ни проверить, прозвучал ли обязательный скрипт. Для встреч на несколько человек это же звено даёт протокол, в котором видно, кто что предложил.
- Дипфейк
- Видео или аудио, где лицо или голос человека подменены синтетическими. В бизнесе встречается с двух сторон: как соблазн сделать ролик с известным лицом и как способ обмана, когда мошенники голосом руководителя просят перевести деньги. Первое недопустимо без разрешения человека, второе требует правила подтверждать платежи вторым каналом.
- Дистилляция
- Обучение маленькой модели на ответах большой, чтобы получить почти то же качество дешевле. Маленькая перенимает поведение старшей на конкретном круге задач, но не её широту. Для бизнеса это способ снять нагрузку с дорогого железа: массовый поток обрабатывает младшая модель, а сложные случаи уходят старшей.
- Дообучение
- Доучивание готовой модели на ваших примерах, чтобы она усвоила формат ответов, терминологию или стиль. Требует собранного набора примеров и повторяется при каждом существенном изменении. Знания о ценах и сроках так не вкладывают: их держат в документах и подтягивают поиском, иначе любое изменение прайса означает новое обучение.
- Инференс
- Работа готовой модели на обычных запросах: вы дали вопрос или картинку, получили ответ. Обучение делают один раз и дорого, а инференс происходит каждый день и составляет почти всю стоимость эксплуатации. Когда подрядчик говорит про стоимость инференса, речь о том, сколько стоит обслужить поток обращений клиентов, а не о разовой разработке.
- Квантование
- Сжатие модели: числа внутри неё огрубляют, чтобы она занимала меньше памяти и работала быстрее. Качество при этом немного падает, обычно незаметно в переписке и заметнее в точных расчётах. На практике это разница между моделью, которой нужна серверная видеокарта за большие деньги, и той же моделью на обычном игровом компьютере в офисе.
- Контекст
- Сколько текста модель удерживает перед глазами за один раз: ваш вопрос, приложенные документы и предыдущие реплики. Всё, что вышло за пределы контекста, модель просто не видит, как будто этого не было. Поэтому договор на триста страниц не отдают целиком, а сначала находят нужные пункты и передают только их.
- Лицензия на веса
- Документ, который говорит, что вам разрешено делать со скачанной моделью: можно ли использовать её в коммерческом продукте, есть ли ограничения по числу пользователей или отраслям. Условия у разных семейств отличаются сильно, и открытость файлов не равна разрешению на любое применение. Это в общих чертах, конкретный случай смотрит юрист.
- Лицензия на данные
- Отдельный от весов вопрос: на чём модель училась и какие права это накладывает на то, что она производит. Состав обучающих данных часто не раскрывают, а споры вокруг них продолжаются. Для бизнеса практический вывод один: чем заметнее и публичнее материал, тем внимательнее стоит отнестись к происхождению, и это в общих чертах, конкретный случай смотрит юрист.
- Мультимодальность
- Способность одной модели работать не только с текстом, но и с картинками, звуком или видео. Это удобно, когда в одном обращении клиент присылает и фото, и подпись к нему. При этом узкая модель под свой тип данных обычно точнее универсальной, поэтому в рабочих контурах их часто ставят рядом, а не выбирают одну.
- Оверфиттинг
- Модель выучила ваши учебные примеры наизусть и отлично работает на них, но теряется на новых случаях. Со стороны это выглядит как блестящая демонстрация и слабый результат в реальной работе. Защита простая: часть примеров откладывают заранее, на обучении их не показывают и проверяют результат только на них.
- Открытые веса
- Файлы готовой модели, которые разработчик выложил в свободный доступ, и их можно скачать и запустить у себя. Это не то же самое, что открытый исходный код всего проекта: данные, на которых модель учили, обычно не публикуют. Для бизнеса открытые веса означают, что данные не уходят в чужое облако и работа не остановится, если поставщик поднимет цены или закроет доступ.
- Пайплайн
- Цепочка шагов, через которую проходит запрос: распознали, нашли, ответили, проверили. Почти все рабочие внедрения устроены именно так, а не одной моделью на всё. Практический смысл в том, что каждое звено можно измерить и заменить отдельно, а когда качество падает, видно, какой именно шаг сломался.
- Параметры (B)
- Размер модели, измеренный в миллиардах внутренних чисел: 7B это семь миллиардов, 70B это семьдесят. Чем больше, тем обычно умнее ответы и тем дороже железо и медленнее работа. Для узкой задачи вроде сортировки обращений маленькая модель часто справляется не хуже большой, а стоит в разы дешевле в эксплуатации.
- Промпт
- Текст, который вы даёте модели: вопрос, задание, приложенные данные и пример нужного ответа. Качество промпта влияет на результат сильнее, чем выбор между двумя близкими моделями. На практике половина неудачных внедрений лечится не заменой модели, а внятно написанным заданием с примерами того, как должен выглядеть правильный ответ.
- Промпт-инъекция
- Приём, когда во входящем письме, документе или на странице сайта спрятана инструкция для модели, и она выполняет её вместо вашей. Опасность появляется там, где помощник читает чужие тексты и имеет доступ к данным или действиям. Защита это фильтр на входе, ограничение прав и правило, что найденный текст считается данными, а не командой.
- Разметка
- Ручная работа, при которой люди отмечают в данных правильные ответы: где на снимке дефект, к какой теме относится обращение, какая сумма в счёте. Без разметки нечем ни учить узкую модель, ни честно проверить готовую. Это самая недооценённая статья бюджета: она требует времени сотрудников, которые знают предмет.
- Реранкер
- Модель, которая пересортировывает найденные фрагменты, вчитываясь в вопрос целиком. Быстрый поиск даёт десяток похожих кусков, но нужный часто оказывается не первым. Реранкер стоит копейки по сравнению с большой моделью и заметно поднимает качество ответов поддержки, потому что модель получает правильный абзац, а не соседний.
- Сегментация
- Выделение объекта по контуру, а не прямоугольной рамкой. Это принципиально там, где нужно померить, а не просто заметить: площадь скола, ширина зазора, форма пятна. В магазинах та же техника убирает фон с фотографии товара, чтобы карточки в каталоге выглядели одинаково аккуратно.
- Системный промпт
- Постоянная инструкция, которая подставляется к каждому обращению и задаёт рамки: кто вы, как отвечать, чего не делать, когда передавать диалог человеку. Клиент её не видит, но именно она определяет тон и границы. Изменение одной строки в ней меняет поведение всего бота, поэтому её версии стоит хранить так же, как код.
- Судья (LLM-as-judge)
- Модель, которую ставят оценивать ответы другой модели по вашим критериям: точно, вежливо, не выдумано. Так можно проверять тысячи ответов вместо выборочного чтения руками. Судью обязательно сверяют с оценками людей на небольшой выборке, иначе вы получаете автоматический контроль качества, который сам ошибается незаметно для вас.
- Температура
- Настройка разнообразия ответов. Низкая температура даёт предсказуемый и сухой текст, высокая делает его живее, но повышает риск выдумок. Для извлечения данных из счетов её ставят почти в ноль, для черновиков рекламных текстов поднимают. Это самая дешёвая ручка, которой можно подкрутить поведение без смены модели.
- Токен
- Кусочек текста, которым модель считает: примерно слово или часть слова. В токенах меряют и объём запроса, и объём ответа, и по ним же считают стоимость в облачных сервисах. Практический смысл простой: длинная инструкция, которую вы приклеиваете к каждому обращению, оплачивается каждый раз заново и замедляет ответ.
- Файн-тюн против промпта
- Развилка, которая встаёт почти в каждом проекте: доучить модель на своих примерах или просто хорошо написать задание и подложить документы. Начинать почти всегда стоит со второго: это дешевле, быстрее и правится за минуты. Дообучение оправдано, когда нужен устойчивый формат и стиль, а не когда не хватает фактов.
- Чекпойнт
- Сохранённое состояние модели на определённый момент: конкретная версия файлов, которую можно запустить. Разные чекпойнты одной модели ведут себя по-разному, поэтому в договоре фиксируют не название семейства, а конкретную версию. Иначе через полгода обновление на первый взгляд той же модели тихо поменяет поведение работающего сервиса.
- Эмбеддинг
- Числовой отпечаток смысла текста или картинки. Тексты с близким смыслом получают близкие отпечатки, поэтому поиск начинает находить по сути, а не по совпадению слов. Клиент пишет про сломанный замок, находится инструкция про ремонт фурнитуры, хотя общих слов в них почти нет.
- ANN-поиск
- Быстрый приблизительный поиск среди миллионов числовых отпечатков. Точный перебор был бы слишком медленным, поэтому система сознательно жертвует долей точности ради скорости ответа. На практике это значит, что изредка нужный документ может не попасть в выдачу, и качество поиска настраивают, а не считают заданным раз и навсегда.
- ASR
- Распознавание речи, то есть перевод звука в текст. С него начинается любая работа со звонками, встречами и голосовыми сообщениями. Смотреть стоит на своё качество связи и свою лексику: студийная запись распознаётся заметно лучше телефонной линии, а названия товаров и фамилии модели путают чаще всего.
- GGUF
- Популярный формат файла, в котором распространяют сжатые модели для запуска на обычном железе. Один файл содержит и саму модель, и служебные сведения о ней, поэтому его удобно скачать и сразу запустить. Если подрядчик говорит, что возьмёт модель в GGUF, обычно это значит запуск на вашем компьютере или недорогом сервере, без аренды дорогой видеокарты.
- Guard-модель
- Маленькая быстрая модель, которая ничего не пишет, а только проверяет: входящее сообщение на попытку выманить лишнее и готовый ответ на недопустимое содержание. Ставится рядом с основной моделью как фильтр на входе и выходе. Для публичных каналов это обязательное звено, потому что один неудачный ответ обходится дороже всей экономии.
- Latency
- Задержка: сколько проходит от запроса до ответа, особенно до первых слов. Это то, что чувствует человек. В переписке терпимы секунды, в телефонном разговоре пауза в пару секунд уже читается как обрыв. Часто именно задержка, а не качество текста, решает, будет ли сервис вообще пригоден в вашем канале.
- LoRA
- Дешёвый способ дообучения: вместо переделки всей модели поверх неё обучают небольшую надстройку. Файл получается маленьким, обучение быстрым, а надстройку можно включать и выключать. Так удобно делать несколько вариантов поведения на одной базовой модели, например отдельный стиль ответов для разных брендов внутри одной компании.
- MoE
- Устройство модели, при котором она состоит из множества частей, а на каждый запрос включается лишь небольшая их доля. Получается большая по знаниям модель, которая считает почти как маленькая. Минус в том, что в памяти всё равно нужно держать целиком, поэтому экономия получается на скорости ответа, а не на требованиях к видеокарте.
- OCR
- Распознавание текста на изображении: скан, фотография документа, кадр с камеры. Современные модели этого класса возвращают не просто буквы, а структуру страницы: таблицы, колонки, сноски. Это первое звено любого документооборота, и его качество задаёт потолок для всего остального: из плохо распознанного счёта верных данных не извлечь.
- Ollama
- Простая программа, которая ставит и запускает модели на обычном компьютере: скачала файл, подняла локальный сервис, дальше с ним общаются приложения. Подходит для проб, демонстраций и работы небольшой команды. Для потока обращений от клиентов её обычно меняют на промышленный вариант запуска, рассчитанный на многих пользователей сразу.
- RAG
- Подход, при котором модель сначала ищет нужные куски в ваших документах, а потом отвечает, опираясь на них. Так ответы держатся ваших регламентов, цен и сроков, а не общих знаний из интернета. Это основной способ сделать корпоративного помощника, не переучивая модель, и обновляется он просто заменой документа в базе.
- Throughput
- Пропускная способность: сколько запросов система переваривает в единицу времени. Это то, что чувствует бюджет. Задержка и пропускная способность тянут в разные стороны: настройки, ускоряющие отдельный ответ, обычно снижают общее число обслуженных обращений, и выбор делается под конкретный сценарий, а не вообще.
- TTS
- Синтез речи: превращение текста в звучащий голос. Используется в телефонии, озвучке роликов и голосовых уведомлениях. Кроме чистоты голоса важна задержка перед началом речи: в разговоре пауза дольше пары секунд воспринимается как обрыв связи. Клонирование голоса конкретного человека требует его разрешения.
- vLLM
- Промышленный способ запуска моделей на сервере: держит много одновременных запросов, экономно расходует память видеокарты и отдаёт ответы потоком. Если планируется поток обращений, а не эксперимент одного сотрудника, подрядчик обычно предложит именно такой вариант. Разница с настольной программой видна не в качестве ответов, а в том, сколько людей обслуживается на одном железе.
- VLM
- Модель, которая одновременно видит картинку и понимает текст: можно показать ей фотографию и задать о ней вопрос. На этом строят описание товара по снимку, разбор чека и объяснение того, что заметила камера. От распознавания текста отличается тем, что понимает содержание сцены, а не только буквы на изображении.
Под эти условия моделей нет. Сбросьте фильтр или опишите задачу — подберу сам.
Нужна модель под вашу задачу?
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.
- ПодберуМодель и размер под задачу и бюджет на железо
- ПоставлюНа ваш сервер или в закрытый контур, с API
- ДообучуНа ваших данных или подключу базу знаний
- ВстроюВ CRM, 1С, бота, сайт или рабочий чат


