Open-source и свой сервер 4 мин чтения

ИИ-учёный, который сам ставит эксперименты: разбор OpenScience

Synthetic Sciences из Y Combinator выложила OpenScience: агента, который читает литературу, пишет код, ставит эксперименты и оформляет результат. Сверил новость с репозиторием и документацией: что подтвердилось, что нет и как развернуть такую среду у себя на локальных моделях.

OpenScienceИИ-агентыOpen-sourceЛокальные модели
Коротко. Стартап Synthetic Sciences из Y Combinator выложил в открытый доступ OpenScience: агента и рабочую среду, которым дают цель, а он читает литературу, пишет код, запускает эксперименты и оформляет результат. Лицензия Apache 2.0, проект свежий, но живой: за три месяца 3,9 тысячи звёзд на GitHub и новый релиз почти каждый день. Работает на своих ключах и на локальных моделях. Есть оговорка, о которой в новостях молчат: в первой настройке нужен аккаунт, а передача логов сессий включена по умолчанию, даже с локальной моделью. Для компании это решается настройкой, но проверять надо.

ИИ-учёный, который ставит эксперименты, пока вы спите

Новость пришла из Telegram-канала Machinelearning 29 сентября. Я не стал верить пересказу и сверил всё с репозиторием и документацией проекта. Исходники лежат на GitHub, описание функций и настроек есть в документации.

Суть простая. Вы описываете задачу обычным языком, например «найди работы по теме, воспроизведи расчёт из статьи, прогони вариации параметра и напиши раздел методов». Агент составляет план, ищет источники, запускает код в Python и R, пишет файлы и показывает каждый шаг. Решает и проверяет человек. Идея и вывод остаются за вами, агент берёт на себя рутину.

Репозиторий создан 3 июля 2026 года, по данным GitHub у него около 3,9 тысячи звёзд, 516 форков и 1136 коммитов. Последний релиз v2.0.147 вышел 30 сентября. Статус «вышел из беты» медиа датируют 27 сентября.

Что он умеет на самом деле

Из README и документации подтвердилось следующее. Обзор литературы с сохранением источников. Анализ данных с кодом, графиками и отчётом. Воспроизведение чужих экспериментов: сначала согласуется утверждение, бюджет и условия, потом сравниваются измеренные результаты. Генерация гипотез и написание текста статьи есть среди базовых навыков агента, там же рецензирование и цитирование.

Отдельная вкладка Autoresearch запускает цикл экспериментов. Задаётся одна метрика, базовый прогон и очередь идей. Агент пробует идею, сравнивает с базой, записывает «оставили» или «откатили» и берётся за следующую. У исследования есть бюджет: число прогонов или часы, при превышении оно ставится на паузу. В рабочую папку пишутся обычные файлы study.md, results.tsv и lessons.md, так что журнал читается и без приложения.

На каких моделях и где считает

Модель подключается тремя способами: ваши API-ключи, локальная модель через Ollama, LM Studio или любой совместимый эндпоинт, либо платный сервис Ace от самих авторов с оплатой по факту. Для компании, которой важно держать данные у себя, интересен второй вариант.

Эксперименты запускаются локально, на SSH-сервере, в кластерах Slurm и PBS или в облаке Modal. Каждый запуск на удалённой мощности требует подтверждения. Если на машине есть видеокарта NVIDIA, прогоны раскладываются по одной на карту. Про железо для локальных моделей я писал отдельно: какая видеокарта нужна для локальных LLM.

Что из новости не подтвердилось

295 навыков. Такой цифры в источниках нет. Документация говорит примерно о 340 навыках в библиотеке плюс базовые, а в самом репозитории я насчитал 372 файла SKILL.md. Откуда взялась цифра, не знаю. Для вас важно другое: это сотни готовых процедур по биологии, химии, физике, машинному обучению и работе с данными.

Около 40 научных баз. Единого числа не нашёл. В репозитории есть 39 навыков-подключений к базам, среди них PubMed, arXiv, ChEMBL, UniProt, bioRxiv. Порядок цифры совпадает, но это мой подсчёт папок, а не заявление авторов.

Бенчмарк 75,7% на Terminal-Bench Science. Такая цифра в README есть: 53 задачи из 70. Это заявление авторов, сделанное на моделях GPT-6 Astra и GPT-6 Sol, трассы прогонов они выложили в отдельный репозиторий. Сравнение «лучше Codex, 68,1%» пришло из новостных пересказов, которые ссылаются на внутренние тесты компании. Независимой проверки я не нашёл.

Чего нельзя ждать

Автономность здесь ограниченная. Агент ошибается: может выбрать неверный метод, неправильно прочитать статью или красиво описать результат, который получился случайно. Сами авторы просят проверять источники, допущения, код и выводы перед тем, как на них опираться. Поэтому в нашем проекте всё, что агент выдал, проверяет сотрудник, начиная с согласования плана.

Ночные эксперименты требуют вычислений. Прогоны по ночам нужно на чём-то считать: своя видеокарта, арендованный сервер или облако. И даже когда модель локальная, это ещё не гарантия закрытого контура. По документации локальной остаётся только работа самой модели. Онлайн-поиск, удалённые вычисления и отправка логов сессий остаются отдельными каналами. Логи сессий по умолчанию отправляются разработчикам, пока вы в аккаунте, и включают запросы и вывод инструментов. Это отключается в настройках, там же есть режим без отправки на уровне аккаунта, а запуск через командную строку без интерфейса аккаунта не требует. Но проверить и зафиксировать это нужно до того, как в среду попадут рабочие данные.

Что можно сделать уже сейчас

R&D и производство. Подбор режимов, рецептур и параметров, когда есть метрика и скрипт или модель, которые её считают. Autoresearch перебирает варианты ночью, утром у инженера журнал: что пробовали, что сработало, что откатили.

Фармацевтика, биотех, лаборатории вузов. Обзор литературы по теме, выгрузка и очистка данных из открытых баз, воспроизведение расчёта из статьи перед тем, как закладывать его в план. Для закрытых данных среду разворачиваем внутри контура, а свои документы подключаем так, как это делается в системах с базой знаний.

Аналитики. Проверка гипотезы на данных компании, отчёт с кодом и графиками, который можно перезапустить. Результат можно перезапустить и перепроверить.

Маркетинг. Разбор итогов А/Б-тестов и подбор следующих гипотез. Это моя адаптация, проект про такое не заявляет: инструмент заточен под науку, и под маркетинг его придётся настраивать и проверять на ваших данных.

Что мы делаем. Разворачиваем OpenScience на сервере компании, подключаем локальные модели, настраиваем доступы и отправку логов, подключаем корпоративные источники и пишем навыки под ваши задачи. Это проект с ИИ-агентами, цены и состав работ смотрите в прайсе. Про то, где агенту можно доверять, а где нет, есть отдельный разбор: граница автономности ИИ-агента.

Частые вопросы

Это бесплатно?

Сама среда бесплатна и открыта по лицензии Apache 2.0. Платить придётся за модели, если берёте внешние, за вычисления и за облачные сервисы. С локальной моделью платите только за железо.

Нужна ли для локальных моделей видеокарта?

Маленькая модель на 8 миллиардов параметров запускается на обычном современном компьютере, но на ней агент работает заметно слабее. Для серьёзных задач с инструментами нужна карта с большим объёмом памяти или арендованный сервер. Инструмент вызывает функции, и от качества этого зависит результат.

Можно ли доверять результатам?

Как черновику, да. Как готовому выводу нет. Агент показывает шаги, код и источники, чтобы специалист мог их проверить. Мы закладываем эту проверку в процесс.

Коротко о главном

OpenScience даёт то, чего раньше не хватало открытым агентам: готовую среду, где исследовательский цикл от поиска литературы до отчёта идёт в одном окне, с понятными журналами и подтверждением каждого тяжёлого запуска. Часть цифр из новости не подтвердилась, а бенчмарк пока слова авторов. Зато лицензия, подключение локальных моделей и вычисления на своём сервере проверены по репозиторию.

Есть R&D-отдел, лаборатория или аналитики, и хочется такую среду на своём сервере, чтобы данные никуда не уходили? Напишите мне в Telegram слово «УЧЁНЫЙ». Расскажите задачу и какие данные есть, я отвечу, что из этого реально автоматизируется и что понадобится по железу.

Ещё open-source для бизнеса

Эта статья — часть каталога бесплатных решений, которые я разворачиваю на вашем сервере под ключ: CRM, аналитика, документы, почта, безопасность, магазины, AI.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 451 готовых IT-решений для бизнеса451 ready-made IT solutions for business451 soluciones IT listas para empresas451 个面向企业的现成 IT 解决方案Бизнест зориулсан 451 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх