BGE-M3
Модель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.
- Поиск по базе документов
- RAG для чат-бота
- Поиск похожих обращений и дублей
- Размеры
- 568M
- Железо
- от: Ноутбук
Поддержка ломается на одном и том же: языковая модель отвечает уверенно, но не вашими правилами. Она не знает ваших тарифов, сроков и исключений, а придумывать умеет отлично. Лечится это не выбором модели побольше, а связкой, где сначала находят нужный кусок вашей базы знаний, потом отдают его модели как источник, и только потом ответ проходит проверку. Каждое звено закрывает свой риск, и заменить их друг другом нельзя.
Модель эмбеддингов переводит вопрос клиента и все ваши инструкции в числовые отпечатки смысла, и система достаёт те фрагменты, которые ближе всего по сути. Клиент пишет своими словами, а в регламенте написано канцелярским, и поиск по ключевым словам тут промахивается. Без этого звена модель отвечает по памяти, то есть по интернету годичной давности, а не по вашему прайсу.
Модель для поиска по смыслу на сотне языков. Основа RAG: бот находит нужный кусок документа перед ответом.
Эмбеддинги и реранкеры на базе Qwen3, в числе лучших открытых для многоязычного поиска, включая русский. VL-версии ищут по картинкам, скриншотам и видео.
Проверенные модели для смыслового поиска. Многоязычные версии хорошо работают с русским и до сих пор служат надёжной основой для RAG.
Реранкер берёт десяток найденных фрагментов и пересортировывает их, уже вчитываясь в вопрос целиком. Это дешёвая страховка: поиск по смыслу быстрый, но грубоватый, и нужный абзац часто оказывается не первым. Если звена нет, в ответ уходит первый попавшийся похожий текст, и клиент получает правило из соседнего тарифа, которое к нему не относится.
Реранкеры: берут найденные поиском фрагменты и переставляют их по реальной близости к вопросу. Версия v2-m3 многоязычная и лёгкая, её часто ставят в пару к bge-m3.
Сильные многоязычные реранкеры; m0 сортирует и страницы-картинки (сканы, слайды). Свежие версии открыты только для некоммерческого использования.
Языковая модель получает вопрос вместе с найденными фрагментами и пишет ответ человеческим языком, ссылаясь на источник. Ей же поручают распознать, что вопрос выходит за рамки базы, и честно передать диалог оператору. Чем лучше подобраны фрагменты на предыдущих шагах, тем проще модели и тем меньше нужна самая дорогая из доступных. Без этого звена клиент читает выдержку из регламента.
Модели, с которых начался массовый open source в ИИ. Огромная экосистема дообученных версий и инструментов.
Первые открытые модели OpenAI со времён GPT-2. Рассуждения, вызов инструментов, младшая версия помещается на одну видеокарту.
Одна из старейших китайских открытых линий: от ChatGLM-6B до GLM-5.3. Сильна в агентных задачах и программировании; GLM-5.3-Flash понимает картинки и выходит под MIT.
Отдельная модель-фильтр смотрит и на входящее сообщение, и на готовый ответ: нет ли попытки вытянуть лишнее, не утекают ли данные другого клиента, не обещает ли бот того, чего компания не делает. Такой фильтр специально маленький и быстрый, он не пишет тексты, а ставит отметку. Без него один неудачный ответ в публичном канале обходится дороже всей экономии на поддержке.
Модели-фильтры, которые проверяют запросы к чат-боту и его ответы на опасные темы по списку категорий. Версия 4 проверяет и картинки. Русский официально не заявлен.
Фильтры на базе Gemma: проверяют текст на опасный и оскорбительный контент, а ShieldGemma 2 проверяет картинки. Ориентированы на английский.
Фильтры безопасности на 119 языков, русский в их числе. Версия Stream проверяет ответ бота прямо во время его генерации и может оборвать его на лету.
Узкое место почти всегда база знаний, а не модель. Если инструкции противоречат друг другу и последний раз обновлялись давно, связка честно воспроизведёт этот бардак, только быстрее. До запуска соберите полсотни реальных вопросов из переписки, прогоните их и прочитайте ответы глазами. И заранее решите, на каких темах бот обязан молча передавать диалог человеку: деньги, возвраты, претензии, всё, что касается персональных данных, здесь в общих чертах, конкретный случай смотрит юрист.
Открытую модель можно поставить на свой сервер: данные не уходят в чужое облако, нет оплаты за каждый запрос, модель можно дообучить на ваших документах.