AI для разработчиков 4 мин чтения

GraphRAG: граф знаний вместо базы знаний, когда окупается

Канал GitHub Community показал Graphrag-workbench, 3D-визуализацию графов Microsoft GraphRAG. Разбираю по первоисточникам, чем граф знаний отличается от обычного RAG, когда он нужен базе договоров, переписки и отзывов, чем это грозит по стоимости и 152-ФЗ и с чего я предлагаю начинать.

GraphRAGRAGбаза знанийИИ для бизнеса
Коротко. GraphRAG от Microsoft достаёт из документов сущности и связи, собирает из них граф, делит его на сообщества и заранее пишет краткие отчёты по каждому. Это нужно для вопросов ко всему массиву: какие темы, что общего, кто с кем связан. На вопрос про конкретный факт хватает обычного RAG. Индексация графа дороже, а сам проект по его README находится в режиме поддержки. Я советую начинать с обычной базы знаний и добавлять граф, только если ваши вопросы этого требуют.

Что случилось и что подтверждено

4 октября 2026 года канал GitHub Community рассказал про Graphrag-workbench: это интерактивная 3D-визуализация графов, которые строит Microsoft GraphRAG. Саму публикацию канала я не открывал, ориентируюсь на репозиторий. Он называется lyon-industries/graphrag-workbench, автор Christopher Lyon, лицензия MIT, последний коммит 18 июля 2026 года. Внутри GraphRAG 3.1.0, а модели можно подключить локально через Ollama или облачные через OpenAI.

Первоисточник самого метода: репозиторий microsoft/graphrag, лицензия MIT. На PyPI последняя версия 3.2.0, загружена 23 сентября 2026 года, в тот же день был последний коммит. Научная часть: статья From Local to Global: A Graph RAG Approach to Query-Focused Summarization от 24 апреля 2024 года (правка от 19 февраля 2025).

Чем GraphRAG отличается от обычного RAG

Обычный RAG режет документы на фрагменты, ищет похожие на вопрос по векторам и отдаёт найденное модели. Подробнее я разбирал это в статье про RAG-системы для бизнеса. Работает отлично, пока ответ лежит в одном-двух фрагментах.

Авторы GraphRAG показывают слабое место: вопрос вроде «каковы главные темы во всём наборе данных» сводится не к поиску фрагмента, а к сводке по всему корпусу. Их схема из статьи: модель извлекает из текста сущности и связи, из них строится граф, близкие сущности объединяются в сообщества, для сообществ заранее пишутся сводки. На вопрос каждая сводка даёт частичный ответ, потом частичные ответы собираются в итоговый. По их тестам на наборах порядка миллиона токенов ответы получались полнее и разнообразнее, чем у обычного RAG.

В документации режимов поиска четыре: local (вопросы про конкретные сущности), global (разбор всех отчётов по сообществам, документация называет его ресурсоёмким), DRIFT (local с подмешиванием информации о сообществах) и basic (обычный векторный поиск для сравнения).

Когда хватает обычного RAG, а когда нужен граф

Обычного RAG достаточно, если спрашивают о факте: «какой срок поставки по договору с этим поставщиком», «что в регламенте про возврат», «какая гарантия на модель». Ответ лежит в конкретном месте, его найдёт векторный поиск. Такой бот описан в материале про бота с базой знаний.

Граф нужен для вопросов к массиву целиком:

  • какие темы чаще всего встречаются в жалобах за год;
  • что общего у договоров, по которым были споры;
  • кто из контрагентов связан с какими проектами и людьми;
  • как менялись претензии клиентов от квартала к кварталу.

Если таких вопросов у вас нет, граф лишняя работа. Если они есть, часто хватает и более дешёвых путей: выгрузить отзывы в таблицу, разметить темы и посчитать. Это быстрее и проверяется глазами.

Сколько это стоит

Здесь цифр без источника не будет. Подтверждено следующее. README проекта предупреждает, что индексация GraphRAG может быть дорогой операцией, и советует начинать с малого. В документации быстрого старта сказано, что система может потреблять много ресурсов LLM. Конкретных чисел вызовов или цены в документации и в статье Microsoft Research я не нашёл.

Причина видна из этапов. Модель извлекает из текста сущности, связи и утверждения, потом пишутся отчёты по сообществам на нескольких уровнях. Обычный RAG на индексации обращается к модели эмбеддингов, а здесь добавляются генеративные вызовы.

Условный пример без выдуманных чисел: у вас архив договоров и переписки за несколько лет. Для обычного RAG вы платите за эмбеддинги один раз. Для графа вы платите за прогон каждого фрагмента через языковую модель, и повторяете это при заметном обновлении архива. Перед запуском на всём объёме берут небольшую выборку, смотрят расход и качество, потом умножают. Это оценка устройства метода, прайса тут нет.

Что важно учесть

Проект в режиме поддержки. В README сказано, что он largely in maintenance mode, новые функции и PR не принимаются, исправления и обновления зависимостей делаются по мере необходимости. Там же: код служит демонстрацией и не является официально поддерживаемым продуктом Microsoft. Для коммерческого проекта это повод закладывать запас на самостоятельное сопровождение.

Качество на русском. Документация по настройке промптов не говорит ничего о нерусских текстах. Работает ли извлечение сущностей на ваших договорах и переписке так же хорошо, как на английских примерах, я не проверял. Проверяйте на своих документах.

Персональные данные. Workbench предупреждает: при индексации через OpenAI содержимое документов уходит провайдеру. Договоры и переписка содержат персональные данные, поэтому для передачи во внешнюю модель нужны основания по 152-ФЗ, об этом есть материал про приватный ассистент на своих данных. Локальный вариант через Ollama оставляет обработку на вашем компьютере, но качество извлечения на слабой модели тоже проверяйте.

Сам workbench только показывает граф. Чат в версии 2.0 убран намеренно, сканы без текста не читаются, так как OCR нет. Это инструмент, чтобы посмотреть, что получилось.

Что можно сделать уже сейчас

Шаг 1. Выпишите 20 реальных вопросов, которые задают по вашим документам. Разделите на фактические и «по всему массиву». Тест на 20 вопросах я описывал в статье про тест на 30 вопросах, схема та же.

Шаг 2. Запустите обычный RAG и прогоните вопросы. Если большинство фактических ответов верны, а «общих» вопросов мало, граф не нужен. Про выбор между RAG и дообучением есть отдельный разбор.

Шаг 3. Если «общих» вопросов много, соберите маленький обезличенный набор и постройте граф. Посмотрите его в workbench, сравните ответы global и basic.

Шаг 4. Только после этого считайте расход на полный объём и решайте, где крутить модель.

Частые вопросы

GraphRAG заменяет обычную базу знаний?

В документации сам режим basic оставлен для сравнения, а local и global закрывают разные типы вопросов. Заменой я бы его не называл: на фактических вопросах сравнивайте на своих данных.

Можно ли запустить GraphRAG целиком на своём сервере?

Workbench умеет работать с локальными моделями через Ollama, по его README. Качество такой связки на русском языке не подтверждено, проверяйте на своих документах.

Нужен ли граф, чтобы узнать темы жалоб в отзывах?

Иногда хватает разметки отзывов по темам и подсчёта. Граф имеет смысл, когда важны связи между сущностями: кто, с чем и с кем связан.

Коротко о главном

GraphRAG отвечает на вопросы ко всему массиву документов, но индексация обходится дороже, проект в режиме поддержки, а качество на русском не подтверждено. Сначала обычный RAG и тест на 20 вопросах, граф только по результату.

Если хотите понять, нужен ли граф вашей базе документов, посмотрите базы знаний и RAG-системы под ключ. Напишите мне в Telegram кодовое слово «ГРАФ», разберём ваши вопросы и посчитаем, что нужно.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх