Табличные данные2025–2026
Stable AI (Пекин, с Университетом Цинхуа) · Китай
Модель для таблиц, которая одна умеет классифицировать, прогнозировать числа и заполнять пропуски в данных. Лёгкая LimiX-2M работает на обычном компьютере.
- Заполнение пропусков в выгрузках из 1С и CRM
- Прогноз оттока и скоринг
- Классификация клиентов и товаров
- Размеры
- 2M – 16M и LimiX-2
- Железо
- от: Ноутбук
Автономное вождение2020–2026
comma.ai · США
Открытая система помощи водителю: нейросеть по камере держит полосу и управляет скоростью, плюс модель контроля внимания водителя. Модели лежат прямо в репозитории и обновляются постоянно.
- Исследовательский стенд систем помощи водителю
- Изучение контроля внимания водителя по камере в салоне
- Сравнение со своими алгоритмами удержания полосы
- Размеры
- компактная, рассчитана на бортовое устройство
- Железо
- от: Ноутбук
Голосовые ассистенты2026
Samsung · Южная Корея
Крошечные модели понимания звука для смартфона: слушают речь, музыку и звуки вокруг и отвечают текстом — описывают запись и отвечают на вопросы о ней. Работают прямо на устройстве, вопросы и ответы — на английском: других языков в обучающих данных нет.
- Описание аудиозаписи словами
- Ответы на вопросы о звуке
- Определение типа звука и обстановки
- Размеры
- 99M – 356M
- Железо
- от: Ноутбук
Компьютерное зрение2024–2026
Microsoft Research · США
Восстанавливает 3D-геометрию сцены по одной фотографии: глубину в метрах, облако точек и нормали поверхностей.
- Замеры помещений и объектов по фото
- 3D-облако точек из снимка
- Подготовка данных для роботов и AR
- Размеры
- ViT-S – ViT-G
- Железо
- от: Ноутбук
Прогнозы2024–2026
Google · США
Готовая модель прогнозов Google: строит прогноз по любому временному ряду без обучения на ваших данных.
- Прогноз продаж и спроса
- Планирование закупок и запасов
- Прогноз нагрузки и трафика
- Размеры
- 200M – 500M
- Железо
- от: Ноутбук
Роботы2025–2026
GigaAI · Китай
Модель управления роботами, обученная в основном на синтетических данных из модели мира. Позволяет меньше тратить на сбор данных с реальных роботов.
- Управление манипулятором
- Дообучение на малом объёме своих данных
- Пилоты сортировки и сборки
- Размеры
- 3.5B
- Железо
- от: 1 видеокарта
ТекстOllama2024–2026
NVIDIA · США
Модели NVIDIA для агентов и рассуждений, заточенные под быстрый запуск на её видеокартах. Nemotron 3 это гибрид Mamba и MoE от 4B до 550B; Nano Omni разбирает видео, аудио и картинки (только английский).
- Агенты с вызовом инструментов
- Задачи с рассуждением и расчётами
- Ответы по длинным документам
- Размеры
- 4B – 550B-A55B
- Железо
- от: Ноутбук
Погода и климат2023–2026
Google DeepMind · Великобритания
Семейство глобальных погодных моделей Google DeepMind: GraphCast (прогноз на 10 дней), GenCast (ансамбль вероятностей) и WeatherNext 2 с прогнозом циклонов. С августа 2026 веса разрешены для коммерции.
- Среднесрочный прогноз погоды для планирования смен, рейсов и поставок
- Вероятностная оценка экстремальной погоды для страховых портфелей
- Прогноз траекторий тропических циклонов для морских и портовых операций
- Размеры
- от облегчённых версий 1° до полных 0,25°
- Железо
- от: 1 видеокарта
Автономное вождение2025–2026
NVIDIA · США
Модели «зрение–язык–действие» для беспилотников: по видео с камер строят траекторию и объясняют решение текстом. Используются для разработки и проверки систем автопилота, а не как готовый автопилот.
- Авторазметка записей с камер для обучения своих систем помощи водителю
- Разбор сложных дорожных сцен с текстовым объяснением
- Проверка систем автопилота в симуляторе на редких сценариях
- Размеры
- 10B – 34B
- Железо
- от: 1 видеокарта
Автономное вождение2026
Alibaba (команда Qwen) · Китай
Модель для автономного вождения на базе Qwen3.5-4B: 3D-распознавание объектов вокруг машины, ответы на вопросы о дорожной сцене и планирование траектории в одной модели.
- Прототип восприятия и планирования для беспилотной техники на закрытой территории
- Ответы на вопросы о записях с камер при разборе инцидентов
- Разметка дорожных сцен для обучения своих моделей
- Размеры
- 4B
- Железо
- от: 1 видеокарта
Роботы2025–2026
NVIDIA · США
Модели «мира» для роботов и беспилотников: генерируют реалистичное видео физических сцен и предсказывают действия. Cosmos 3 объединяет понимание, генерацию и управление.
- Синтетические видео для обучения роботов и беспилотников
- Проверка сценариев в симуляции
- Управление роботом (Policy-версии)
- Размеры
- 2B – 65B
- Железо
- от: 1 видеокарта
Роботы2026
Ant Group (Robbyant) · Китай
Модель управления роботами от Ant Group, обученная на большом объёме данных с реальных роботов. Версия 2.0 работает с разными типами манипуляторов.
- Управление двуруким манипулятором
- Дообучение под свою операцию
- Пилоты сборки и сортировки
- Размеры
- 4B – 6B
- Железо
- от: 1 видеокарта
Роботы2026
Xiaomi · Китай
Открытые модели управления роботами от Xiaomi. Robotics-1 рассчитана на бытовые и кухонные задачи, U0 объединяет понимание сцены и действия.
- Управление манипулятором по команде
- Бытовые и сервисные сценарии
- Основа для дообучения
- Размеры
- 4B – 5B
- Железо
- от: 1 видеокарта
ТекстGGUF2025–2026
Meituan · Китай
Модели Meituan (крупнейший сервис доставки Китая). LongCat-Flash динамически меняет объём вычислений под сложность запроса; LongCat-2.0 — 1,6 трлн параметров под MIT. Есть омни-модели (Flash-Omni, Next) и синтез речи AudioDiT.
- Агенты для заказов и сервисных процессов
- Корпоративный ассистент
- Разбор длинных документов
- Размеры
- 1B – 1.6T-A48B
- Железо
- от: Ноутбук
ТекстOllama2024–2026
LG AI Research · Южная Корея
Корейско-английские модели LG. Большая часть линии некоммерческая, но флагман K-EXAONE 2.0 на 750 млрд параметров вышел под Apache 2.0.
- Корпоративный ассистент
- Работа с корейскими и английскими текстами
- Разбор документов и картинок (4.5)
- Размеры
- 1.2B – 750B-A37B
- Железо
- от: Ноутбук
Табличные данные2026
LG AI Research · Южная Корея
Маленькая табличная модель LG: при 21M параметров почти догоняет лидеров по точности классификации и регрессии. Веса только для некоммерческого использования.
- Пилотные прогнозы оттока
- Проверка гипотез по скорингу
- Исследование клиентских данных
- Размеры
- около 21M
- Железо
- от: Ноутбук
Погода и климат2024–2026
Microsoft Research · США
Базовая модель атмосферы Земли: глобальный прогноз погоды, отдельные версии для качества воздуха и морских волн. Считает прогноз за секунды вместо часов на суперкомпьютере.
- Собственный прогноз температуры, ветра и осадков по точкам присутствия компании
- Оценка волнения моря для планирования рейсов и портовых работ
- Прогноз загрязнения воздуха для промышленных площадок
- Размеры
- около 1,3B (есть малая версия для тестов)
- Железо
- от: 1 видеокарта
Погода и климат2022–2026
NVIDIA · США
Набор погодных и климатических моделей NVIDIA: глобальный прогноз FourCastNet, детализация до километров (CorrDiff), прогноз гроз по региону (StormCast), генерация климата (cBottle, Atlas). Запускаются через Earth2Studio.
- Глобальный прогноз с последующей детализацией на нужный регион
- Краткосрочный прогноз гроз и сильных осадков для диспетчерских служб
- Генерация множества погодных сценариев для стресс-тестов
- Размеры
- 98M – 2,5B (FourCastNet 3 — около 711M)
- Железо
- от: 1 видеокарта
Компьютерное зрение2025–2026
Roboflow · США
Детектор объектов в реальном времени, открытая замена YOLO без AGPL. Умеет сегментацию (контуры объектов), с 2026 года — ключевые точки.
- Детекция объектов на видео и фото
- Точные контуры деталей и дефектов
- Дообучение под свои классы объектов
- Размеры
- Nano – 2XL
- Железо
- от: Ноутбук
Прогнозы2025–2026
NXAI · Австрия
Компактная модель прогнозов на архитектуре xLSTM, лидер открытых тестов при малом размере. Быстро работает на обычном процессоре.
- Прогноз спроса и продаж
- Прогноз потребления энергии
- Прогнозы на слабом железе и на месте
- Размеры
- около 35M – 82M
- Железо
- от: Ноутбук
Картинка + текстOllama2024–2026
Moondream (M87 Labs) · США
Небольшая и быстрая модель зрения для продуктовых задач: ответы на вопросы, поиск и указание объектов, подписи. Moondream 3.1 — MoE на 9B с 2B активных.
- Поиск объектов и подсчёт на фото
- Проверка фото из полевых отчётов
- Подписи и теги для каталога
- Размеры
- 2B – 9B-A2B
- Железо
- от: Ноутбук
Документы и OCRRU2022–2026
Baidu (PaddlePaddle) · Китай
Классические лёгкие модели PaddleOCR: поиск и распознавание строк текста плюс разметка страницы. Работают на процессоре и телефонах; есть отдельная модель для восточнославянских языков, включая русский.
- Распознавание текста на сканах, фото и экранах
- Чтение этикеток, табло, маркировки на производстве и складе
- Разметка страниц: таблицы, формулы, печати, заголовки
- Размеры
- от 1.5M до десятков миллионов параметров
- Железо
- от: Ноутбук
Спутниковые снимки и гео2025–2026
Allen Institute for AI (Ai2) · США
Семейство моделей для снимков Sentinel-1, Sentinel-2 и Landsat от Ai2, с готовыми дообучениями под мангры, вырубки и типы экосистем. Лицензия исключает добывающую отрасль.
- Мониторинг вырубок и состояния лесов в цепочке поставок
- Классификация угодий и культур по серии снимков
- Эмбеддинги снимков для поиска похожих участков
- Размеры
- Nano – Large (Base около 114M)
- Железо
- от: Ноутбук
3D2024–2026
VAST (TripoSR — вместе со Stability AI) · Китай
Семейство VAST: 3D-модель по одной фотографии. TripoSR работает меньше секунды, TripoSG даёт более чистую геометрию, TripoSplat строит сцену из гауссовых точек.
- 3D-модель товара по фото
- Заготовки объектов для игр и AR
- Быстрый 3D-прототип для печати
- Размеры
- до 1.5B
- Железо
- от: Ноутбук
Роботы2025–2026
Ai2 (Allen Institute for AI) · США
Полностью открытая модель управления роботом, которая сначала «рассуждает» о пространстве и траектории, а потом действует. Ход рассуждений можно проверить.
- Управление манипулятором с объяснимыми шагами
- Дообучение под свой робот
- Исследовательские пилоты
- Размеры
- 5B – 8B
- Железо
- от: 1 видеокарта
3D2025–2026
Meta и Оксфордский университет (VGG) · США / Великобритания
Восстанавливает 3D-сцену по одной, нескольким или сотням фотографий за секунды: положение камер, глубину и облако точек. Лучшая статья CVPR 2025.
- 3D-модель помещения или объекта по серии фото
- Определение положения камер для фотограмметрии
- Облако точек для обмеров и сравнения с планом
- Размеры
- около 1.2B
- Железо
- от: 1 видеокарта
Реранкеры2025–2026
NVIDIA · США
Небольшой реранкер NVIDIA на 1B. У версии vl на вход идут и страницы документов картинками, а не только текст. В карточке заявлена многоязычность без списка языков.
- Переупорядочивание фрагментов перед ответом ИИ-помощника
- Сортировка найденных страниц сканов и PDF
- Поиск по внутренним регламентам и инструкциям
- Размеры
- 1B
- Железо
- от: Ноутбук
Прогнозы2024–2026
THUML, Университет Цинхуа · Китай
Компактная базовая модель прогнозов от лаборатории Цинхуа: обучена на большом наборе разнородных рядов и дообучается под свои данные.
- Прогноз спроса и нагрузки
- Прогноз показаний датчиков на производстве
- Дообучение прогноза под свою историю
- Размеры
- 84M (timer-base)
- Железо
- от: Ноутбук
Компьютерное зрение2023–2026
Meta · США
Выделяет любой объект на фото и видео по клику или рамке. Основа для удаления фона и подсчёта объектов.
- Удаление фона с фото товара
- Подсчёт объектов на фото
- Разметка данных для обучения
- Размеры
- 91M – ~0,85B
- Железо
- от: Ноутбук
Роботы2025–2026
NVIDIA · США
Базовая модель NVIDIA для человекоподобных роботов и манипуляторов: видит, понимает команду и выдаёт движения. Встроена в экосистему Isaac.
- Управление человекоподобными роботами
- Дообучение под свою роботизированную ячейку
- Обучение в симуляции с переносом на реального робота
- Размеры
- 2B – 3B
- Железо
- от: 1 видеокарта
Текст2025–2026
Reka AI · США
Компактные модели Reka: Flash 3 на 21B для рассуждений и Reka Edge на 7B, которая быстро разбирает изображения и видео на устройстве.
- Разбор фото и видео (Edge)
- Поиск объектов на изображениях
- Задачи с рассуждением (Flash)
- Размеры
- 7B – 21B
- Железо
- от: Ноутбук
Картинка + текстGGUF2023–2026
Shanghai AI Laboratory (OpenGVLab) · Китай
Большая линейка китайских моделей зрения с размерами от 1B до 241B. InternVL-U (4B) объединяет понимание картинок, их генерацию и редактирование.
- Понимание документов, схем и графиков
- Ответы на вопросы по фото
- Разбор видео
- Размеры
- 1B – 241B-A28B
- Железо
- от: Ноутбук
Картинка + текст2024–2026
Ai2 (Allen Institute for AI) · США
Полностью открытые модели зрения Ai2 (веса и данные). Умеют указывать точку на картинке и считать предметы; Molmo2 понимает видео, MolmoWeb управляет браузером.
- Подсчёт товаров и объектов на фото
- Указание, где на снимке нужный предмет
- Разбор видео
- Размеры
- 1B-A7B – 72B
- Железо
- от: Ноутбук
Табличные данные2025–2026
Lexsi Labs · Индия
Свежие открытые модели для табличных данных: предсказывают по нескольким примерам прямо в запросе, без обучения под конкретную задачу.
- Классификация и прогноз по таблицам без отдельного обучения
- Быстрая проверка моделей на новых наборах данных
- Оценка признаков в больших таблицах
- Размеры
- размер не указан в карточке
- Железо
- от: Ноутбук
Голосовые ассистентыGGUF2025–2026
OpenBMB (ModelBest, Университет Цинхуа) · Китай
Небольшая модель, которая видит, слышит и отвечает голосом в реальном времени, может клонировать голос. Голосовой диалог на английском и китайском, текст — на 30+ языках.
- Голосовой ассистент на своём сервере
- Разбор видео и документов
- Ответы голосом по картинке с камеры
- Размеры
- 8B – 9B
- Железо
- от: Ноутбук
Табличные данные2025–2026
Inria (команда Soda) · Франция
Открытая табличная модель от создателей scikit-learn: без обучения классифицирует и прогнозирует по примерам, тянет таблицы до сотен тысяч строк. Лицензия разрешает бизнес.
- Прогноз оттока клиентов
- Скоринг заявок и сделок
- Классификация клиентов по данным из 1С и CRM
- Размеры
- около 25–30M
- Железо
- от: Ноутбук
Компьютерное зрение2023–2026
Ultralytics · США
Самый распространённый детектор объектов в реальном времени: находит и выделяет предметы на видео даже на слабом железе. YOLOv5 вышел ещё в 2020, в каталоге отсчёт от YOLOv8.
- Подсчёт людей, машин, товаров на видео
- Контроль касок и спецодежды
- Поиск брака на конвейере
- Размеры
- 2.4M – 68M
- Железо
- от: Ноутбук
ТекстRUOllama2023–2026
Technology Innovation Institute (TII) · ОАЭ
Семейство из Абу-Даби: от ранних Falcon 40B и 180B до гибридных Falcon-H1 и сверхмалых Falcon-H1-Tiny на 90–600M параметров для устройств.
- Ассистент и ответы по документам
- Работа на слабом железе и в устройствах
- Вызов инструментов в простых агентах
- Размеры
- 90M – 180B
- Железо
- от: Ноутбук
Погода и климат2024–2026
Европейский центр среднесрочных прогнозов погоды (ECMWF) · Европа (межправительственная организация)
Погодная нейросеть ECMWF, которая работает в оперативном режиме: прогноз на 15 дней четыре раза в сутки, ансамблевая версия на 51 сценарий, с версии 2 — волнение моря.
- Собственный запуск прогноза от открытых начальных данных
- Ансамблевые прогнозы для оценки вероятности заморозков, ливней, штормов
- Прогноз волнения для морских операций
- Размеры
- чекпоинт около 1 ГБ
- Железо
- от: 1 видеокарта
3DGGUF2024–2025
Microsoft · США
Одна из сильнейших открытых 3D-моделей: по картинке или тексту выдаёт сетку с текстурой или гауссову сцену. TRELLIS.2 заметно детальнее первой версии.
- 3D-модели товаров и интерьера по фото
- Ассеты для игр и AR/VR
- Прототипы для 3D-печати
- Размеры
- до 4B (TRELLIS.2)
- Железо
- от: 1 видеокарта
Компьютерное зрениеGGUF2024–2025
ByteDance и Гонконгский университет · Китай
Определяет глубину — расстояние до каждой точки — по одной обычной фотографии или видео. DA3 восстанавливает геометрию сцены с нескольких кадров.
- Оценка расстояний и объёмов по камере
- Эффекты глубины для фото и видео
- Навигация роботов и дронов
- Размеры
- 25M – 1.4B
- Железо
- от: Ноутбук
3D2025
Meta и Университет Карнеги — Меллон · США
Одна модель собирает метрическую 3D-реконструкцию из фото, а если есть данные о камерах, глубине или позах — учитывает и их. Есть версия весов под Apache 2.0.
- 3D-реконструкция объекта или помещения по фото
- Экспорт сцены в формат COLMAP для дальнейшей обработки
- Оценка глубины и положения камер
- Размеры
- около 1.2B
- Железо
- от: 1 видеокарта
Компьютерное зрение2025
Meta · США
Семейство энкодеров Meta для картинок и видео, а с версией PE-AV — и для звука. PE-Core ищет по тексту точнее SigLIP 2 (по данным Meta), есть малые версии.
- Поиск фото и видео по описанию
- Разметка и теги каталога
- Поиск по звуку и видео (PE-AV)
- Размеры
- размер на карточке не указан
- Железо
- от: Ноутбук
Табличные данныеGGUF2024–2025
Чжэцзянский университет · Китай
Семейство для работы с таблицами и базами: понимает структуру данных, пишет код разбора и отвечает на вопросы по выгрузкам.
- Ответы на вопросы по таблицам и выгрузкам
- Автоматический разбор данных с написанием кода
- Помощник в BI и внутренней отчётности
- Размеры
- 7B – 72B
- Железо
- от: 1 видеокарта
Спутниковые снимки и гео2025
IBM и Европейское космическое агентство (ESA) · США / Европа
Мультимодальная модель Земли: понимает оптические и радарные снимки, рельеф, индекс растительности и карты землепользования, умеет достраивать недостающий тип данных (например, «снимок сквозь облака» по радару).
- Анализ полей и лесов даже в облачную погоду по радарным снимкам
- Карты землепользования для оценки участков
- Оценка паводков и пожаров (есть готовые дообучения)
- Размеры
- tiny – large (чекпоинты от ~200 МБ до ~3,8 ГБ)
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
IDEA Research · Китай
Находит на картинке любые объекты по текстовому описанию, без обучения на своих данных: «красная коробка», «человек без каски». Rex-Omni — новое поколение на базе VLM.
- Поиск объектов по описанию без разметки
- Автоматическая разметка данных для обучения
- Проверка фото на соответствие требованиям
- Размеры
- 172M – 3B
- Железо
- от: Ноутбук
ПрогнозыGGUF2024–2025
Amazon · США
Модели прогнозов Amazon, одни из самых скачиваемых. Chronos-2 учитывает внешние факторы: цены, акции, погоду.
- Прогноз спроса с учётом акций и цен
- Планирование запасов
- Прогноз выручки и потоков клиентов
- Размеры
- 8M – 710M
- Железо
- от: Ноутбук
Картинка + текстOllama2023–2025
Alibaba (команда Qwen) · Китай
Одна из сильнейших открытых моделей зрения: читает документы, таблицы, графики, видео, работает с интерфейсами. С Qwen3.5 зрение встроено прямо в основную модель Qwen.
- Извлечение данных из сканов счетов и накладных
- Разбор фотографий товаров и витрин
- Анализ видео и записей с камер
- Размеры
- 2B – 235B-A22B
- Железо
- от: Ноутбук
Роботы2025
Physical Intelligence · США
Модели управления роботами от Physical Intelligence: складывание белья, уборка, работа с предметами. π0.5 лучше справляется в незнакомой обстановке.
- Управление манипуляторами и двуруким роботом
- Дообучение под свои операции
- Пилоты по автоматизации ручного труда
- Размеры
- около 3B
- Железо
- от: 1 видеокарта
Спутниковые снимки и гео2023–2025
IBM и NASA · США
Базовые модели для спутниковых снимков Landsat и Sentinel-2 с учётом серии снимков во времени. Есть готовые дообучения под наводнения, гари и типы культур, плюс отдельная погодная модель WxC.
- Карта посевов и состояния полей по сезону
- Оценка зон затопления и гарей после стихийных событий
- Мониторинг изменений застройки и землепользования
- Размеры
- tiny – 600M (снимки), 2,3B (погода Prithvi WxC)
- Железо
- от: Ноутбук
Компьютерное зрение2023–2025
Meta · США
Базовые модели, которые превращают картинку в числовой «отпечаток». На них строят поиск похожих изображений, классификацию и сегментацию без большой разметки.
- Поиск похожих товаров и фото
- Классификация изображений на малых данных
- Основа для своих моделей контроля качества
- Размеры
- 21M – 7B
- Железо
- от: Ноутбук
ПрогнозыGGUF2024–2025
Salesforce · США
Универсальная модель прогнозов Salesforce для рядов с разной частотой и многими переменными. Веса открыты только для исследований.
- Исследовательские пилоты прогнозов
- Сравнение с другими моделями прогнозов
- Прогнозы по многим связанным рядам
- Размеры
- 11M – 311M
- Железо
- от: Ноутбук
Роботы2025
Hugging Face · США
Маленькая модель управления роботом, которая работает на обычном ноутбуке. Обучена на открытых данных сообщества LeRobot, подходит для недорогих манипуляторов.
- Управление недорогим манипулятором
- Быстрые пилоты и демо роботизации
- Обучение персонала и студентов
- Размеры
- 450M
- Железо
- от: Ноутбук
Спутниковые снимки и гео2025
MBZUAI · ОАЭ
Компактная исследовательская модель для спутниковых снимков: обучена сразу на оптических (Sentinel-2) и радарных (Sentinel-1) данных. Меньше по охвату и сообществу, чем Prithvi и TerraMind.
- Классификация и сегментация спутниковых снимков после дообучения
- Основа для прототипа мониторинга территорий
- Размеры
- TerraFM-B (ViT-Base)
- Железо
- от: Ноутбук
Прогнозы2025
THUML, Университет Цинхуа · Китай
Модель прогнозов, которая выдаёт не одну линию, а набор возможных сценариев — удобно, когда нужен коридор спроса или нагрузки, а не одно число.
- Прогноз спроса с коридором значений
- Планирование запасов с учётом разброса
- Прогноз нагрузки на сервисы и персонал
- Размеры
- 128M (sundial-base)
- Железо
- от: Ноутбук
Роботы2024–2025
Стэнфорд, Беркли и партнёры · США
Первая крупная открытая модель «зрение-язык-действие»: робот-манипулятор выполняет команды вроде «положи яблоко в миску». OFT ускоряет её в разы.
- Управление манипулятором по текстовой команде
- Пилоты по роботизации простых операций
- Основа для дообучения под свой робот
- Размеры
- 7B
- Железо
- от: 1 видеокарта
Агенты для компьютераGGUF2025
Microsoft Research · США
Модель-агент, которая одинаково планирует действия и в интерфейсе (кнопки на экране), и для робота (движения манипулятора). Пока скорее исследовательская база, чем готовый продукт.
- Пилоты по управлению интерфейсом
- Исследовательские проекты на стыке экрана и робототехники
- Разбор скриншотов с планом действий
- Размеры
- 8B
- Железо
- от: 1 видеокарта
Компьютерное зрение2022–2025
Сиднейский университет и JD Explore Academy · Австралия / Китай
Простая и точная модель определения позы человека по ключевым точкам. Версия ViTPose++ умеет позы людей, животных и всего тела; встроена в библиотеку Transformers.
- Ключевые точки тела на фото и видео
- Анализ движений в спорте и реабилитации
- Контроль рабочих поз и техники безопасности
- Размеры
- 33M – около 1B
- Железо
- от: Ноутбук
Картинка + текстGGUF2024
Google · США
Модель зрения Google на базе Gemma, задуманная как основа для дообучения под узкую задачу: подписи, поиск объектов, чтение текста.
- Дообучение под свою задачу распознавания
- Поиск объектов на фото
- Чтение текста на изображениях
- Размеры
- 3B – 28B
- Железо
- от: Ноутбук
Прогнозы2024
Auton Lab, Университет Карнеги — Меллона · США
Базовая модель для рядов чисел: один движок используют и для прогноза, и для поиска аномалий, и для заполнения пропусков, и для классификации.
- Прогноз спроса и загрузки
- Поиск аномалий в показаниях датчиков и метриках
- Заполнение пропусков в исторических данных
- Размеры
- около 40M – 385M
- Железо
- от: Ноутбук
Прогнозы2024
IBM Research · США
Крошечные модели прогнозов от IBM: считаются на обычном процессоре, их ставят рядом с бизнес-системой без отдельного сервера с видеокартой.
- Прогноз продаж и остатков на складе
- Прогноз энергопотребления и нагрузки оборудования
- Быстрые прогнозы прямо на сервере компании
- Размеры
- очень маленькие: у TinyTimeMixers около 1M параметров
- Железо
- от: Ноутбук
Табличные данныеGGUF2024
RUCKBReasoning, Китайский народный университет · Китай
Модель под офисную работу с таблицами: по вопросу выдаёт либо готовый ответ, либо код для обработки данных в таблице или документе.
- Обработка таблиц из Excel и документов по текстовому заданию
- Генерация кода для пересчётов и выборок
- Ответы на вопросы по данным в отчётах
- Размеры
- 7B и 13B
- Железо
- от: Ноутбук
Прогнозы2024
Команда Time-MoE · не раскрыта
Модель прогнозов с разреженной архитектурой: на каждом шаге работает лишь часть сети, поэтому она остаётся быстрой при небольшом размере.
- Прогноз продаж и остатков
- Прогноз нагрузки на сервисы и персонал
- Планирование закупок по истории
- Размеры
- 50M и 200M
- Железо
- от: Ноутбук
Табличные данныеНе развивается2024
ML Foundations · США
Базовая модель для предсказаний по таблицам: делает классификацию и прогноз по нескольким примерам, без отдельного обучения под задачу.
- Классификация записей в таблице по нескольким примерам
- Прогноз значения по строке данных
- Быстрая проверка гипотез на новых наборах данных
- Размеры
- 8B
- Железо
- от: 1 видеокарта
Картинка + текстНе развивается2024
Microsoft · США
Очень маленькая модель зрения: подписи, поиск объектов, сегментация и чтение текста по одной команде. Работает даже на процессоре.
- Чтение текста на фото
- Поиск и выделение объектов
- Автоматические подписи к фото
- Размеры
- 0.23B – 0.77B
- Железо
- от: Ноутбук
Спутниковые снимки и геоНе развивается2023–2024
Allen Institute for AI (Ai2) · США
Предобученные модели проекта Satlas для снимков Sentinel-2, Landsat и аэрофото высокого разрешения. Предшественник OlmoEarth, до сих пор используется в TorchGeo.
- Поиск объектов на снимках: солнечные станции, ветряки, суда
- Разметка дорог и застройки по аэрофото
- Стартовая точка для дообучения своей геомодели
- Размеры
- Swin-v2 и ResNet бэкбоны (Base)
- Железо
- от: Ноутбук
Музыка и звукНе развивается2022
MIT · США
Классическая модель 2021 года для распознавания звуков: определяет 527 классов событий AudioSet (сирена, лай, стекло, музыка). Лёгкая, работает без видеокарты, с 2022 года в Transformers.
- Распознавание звуковых событий
- Разметка аудиоархива
- Детекция тревожных звуков
- Размеры
- около 87M
- Железо
- от: Ноутбук