Агенты для компьютераКомпьютерное зрение

OmniParser

Разбирает скриншот на кнопки, поля и иконки с подписями, чтобы обычная языковая модель понимала экран и могла им управлять. Сам не кликает, а служит «глазами» агента.

Разработчик
Microsoft, США
Первый выпуск
окт 2024
Последний выпуск
фев 2025
Размеры
менее 1B (детектор + подписи)
Лицензия
Коммерция с условиямиДетектор иконок — AGPL-3.0, модель подписей — MIT

Какие задачи решает

  • Разметка экранов старых программ для автоматизации
  • Подготовка агента к работе в интерфейсе
  • Проверка, что на экране есть нужные элементы

Где применяется

IT и тестированиеБэк-офисАвтоматизация процессов (RPA)

Требования к железу

НоутбукНоутбук или обычный ПК, до 8 ГБ видеопамяти — младшие версии
подходит
1 видеокартаОдна видеокарта на 16–80 ГБ — средние версии
нет версий
КластерСервер с несколькими видеокартами — флагманские версии
нет версий

Версии

  1. OmniParser v2
  2. OmniParser v1

Как внедряю у заказчика

  1. ПодборВыбираю размер модели под задачу и ваше железо, проверяю на ваших примерах.
  2. УстановкаРазворачиваю на вашем сервере или в закрытом контуре, отдаю API.
  3. ДообучениеДообучаю на ваших данных (LoRA) или подключаю базу знаний — что дешевле для задачи.
  4. ВстраиваниеПодключаю к CRM, 1С, боту, сайту или рабочему чату, настраиваю мониторинг.

Похожие модели