AI для разработчиков 5 мин чтения

Mac Studio для локального ИИ: почему Apple Silicon обходит стойку из видеокарт

Единая память Apple Silicon позволяет держать модель на сотни гигабайт в одной тихой коробке вместо стойки видеокарт. Разбираю, как это устроено, кому подходит и как я подбираю конфигурацию под задачу.

локальный ИИMac Studioжелезо для LLMприватный контурApple Silicon

Коротко (TL;DR)

  • Преимущество Apple Silicon для ИИ — единая память: процессор и графика делят один пул, модель не режут между видеокартами.
  • По опубликованным данным, Mac Studio M5 Ultra с 512 ГБ памяти и полосой 1,2 ТБ/с держит модель на 320 млрд параметров в FP8 (около 306 ГБ весов) и выдаёт порядка 60 токенов в секунду.
  • Тот же объём на картах с 32 ГБ — минимум десять штук только под веса: свыше 20 000 долларов и порядка 5000 Вт.
  • Решение для приватных документов и небольшой команды. Для сотен одновременных пользователей и для обучения моделей нужен сервер с видеокартами.

Mac Studio для локального ИИ — это компьютер с единой архитектурой памяти, где процессор и графическое ядро делят один пул объёмом до 512 ГБ, поэтому большая языковая модель помещается целиком, без разделения между видеокартами. Фокус не в частотах, а в том, что модель на сотни гигабайт перестаёт быть проблемой сборки. Разбираю, чем это отличается от стойки видеокарт и облака и по какой методике я подбираю конфигурацию.

В чём фокус единой памяти

В обычном ПК память разделена: у процессора своя оперативная, у видеокарты своя видеопамять, между ними шина PCIe. Модель должна лежать в видеопамяти, и как только она туда не влезает, начинается либо выгрузка слоёв в оперативную память с падением скорости в разы, либо разделение модели между несколькими картами.

Разделение работает, но платит задержками: на каждом шаге генерации промежуточные состояния переезжают между картами. И чем больше карт, тем сложнее сборка — плата, корпус, питание, охлаждение.

Единая память убирает этот слой проблем целиком: один пул, одна адресация, никаких копирований между устройствами. По опубликованным данным, Mac Studio M5 Ultra на 512 ГБ с пропускной способностью 1,2 ТБ/с вмещает модель GLM-5.3-Flash на 320 млрд параметров в FP8 — около 306 ГБ весов — и выдаёт примерно 60 токенов в секунду. У RTX 5090 видеопамяти 32 ГБ, поэтому под те же веса нужно минимум десять карт: 10 x 32 = 320 ГБ, более 20 000 долларов и порядка 5000 Вт.

Оговорюсь честно: это цифры из публикации от 31 августа 2026 года, а не мои замеры — сам подход я считаю архитектурно верным, но результаты на конкретной задаче проверяю отдельно.

Три подхода: Mac, стойка видеокарт, облако

ПараметрЕдиная памятьСборка на видеокартахОблачный API
Цена входаОдна покупкаКарты, платформа, питаниеОплата по факту
Потолок моделиДо 512 ГБ пулаСумма памяти картНе ограничен
СкоростьКомфортна для чатаВыше на пакетахЗависит от лимитов
ЭнергияСотни ваттКиловатты, отдельная линияНе ваша забота
Шум и местоТихо, на столеШумно, нужна сервернаяОтсутствует
ОбслуживаниеМинимальноеДрайверы, охлаждениеТолько интеграция
ДанныеНе покидают устройствоНе покидают контурУходят провайдеру

Вывод, к которому я прихожу на разборах: Mac выигрывает там, где нужен большой объём памяти при скромном бюджете на инфраструктуру и отсутствии серверной. Стойка — там, где нужна пропускная способность на много запросов. Облако — на старте и там, где данные не чувствительны. Про выбор конкретной карты я писал в материале какую видеокарту брать под локальные LLM, требования к железу — в статье сколько железа нужно локальному ИИ. Эта статья — про выбор между тремя подходами.

Кому это подходит, а кому нет

Подходит, если данные чувствительные, а нагрузка умеренная:

  • Юристы, медицина, бухгалтерия. Договоры, карты пациентов, первичка — материал, который в чужое облако не отправляют.
  • Студии и подрядчики под NDA. Материалы заказчика не выходят за пределы офиса, и это фиксируется в договоре.
  • Компании под 152-ФЗ. Персональные данные обрабатываются внутри периметра; аргументы разбирал в статье локальный ИИ — не паранойя, а расчёт.
  • Разработка на своём коде. Репозиторий не уезжает наружу, а модель на сотни гигабайт даёт качество, недостижимое для лёгких моделей.

Не подходит в двух случаях. Первый — высокая нагрузка: сотни одновременных пользователей, тысячи документов за ночь; здесь нужен сервер с видеокартами. Второй — обучение моделей, а не инференс.

Методика: как я подбираю конфигурацию

Первым делом я считаю память, а не смотрю на цену. Правило: размер модели в гигабайтах примерно равен числу параметров, умноженному на байты на параметр — 2 байта в FP16, 1 байт в FP8, около 0,5 байта в 4-битном квантовании. Модель на 70 млрд параметров займёт порядка 140, 70 и 35 ГБ соответственно. Квантование — огрубление весов ради экономии памяти: до 8 бит потери обычно незаметны, ниже 4 бит качество на русском заметно проседает.

Дальше — запас. К весам добавляются контекст и KV-кэш: чем длиннее диалог и чем больше документов в запросе, тем больше памяти уходит сверх модели. Без запаса всё упрётся в память ровно тогда, когда система понадобится.

Потом четыре проверки на арендованном или демонстрационном железе, до покупки:

  1. Скорость на своих текстах — на реальных договорах и письмах компании, а не на синтетическом тесте.
  2. Русский язык — падежи, числительные, названия организаций, документы с опечатками.
  3. Вызов инструментов — если агент должен ходить в CRM и базу, это проверяется заранее.
  4. Поведение при нехватке данных — модель должна говорить «в документах этого нет», а не выдумывать.

Честная оговорка про скорость: около 60 токенов в секунду комфортны для чата и документов — текст идёт быстрее, чем человек читает. Для потоковой обработки тысяч запросов этого мало, и единая память тут не спасёт. Если не хотите проверять это на своих деньгах, я подбираю конфигурацию под сценарий: считаю память под модель, замеряю скорость на ваших документах и честно говорю, если нужен другой класс железа.

Как встроить это в работу компании

Купить коробку — самая простая часть. Дальше начинается то, на чём чаще всего спотыкаются.

  • Кто администрирует. У машины должен быть владелец: обновления моделей, мониторинг, реакция на сбой.
  • Доступ для команды. Одна машина обслуживает отдел по сети: интерфейс в локальной сети, учётные записи, разграничение прав.
  • Бэкапы. Резервируются не веса, а нажитое: база знаний, история, настройки, промпты.
  • Непрерывность. Если единственный знающий человек уходит в отпуск, система не должна вставать: инструкция, доступы у двоих, порядок восстановления.

Поэтому локальный ИИ — не «поставил и забыл», а маленькая, но настоящая ИТ-система. Развернуть её под ключ — моя работа: собираю контур, настраиваю доступы, подключаю базу знаний и мессенджеры, оставляю инструкцию и сопровождение. Формат — на странице приватного ИИ-облака, сеть и резервное копирование — в разделе ИТ-инфраструктура.

Частые вопросы

Почему Mac Studio подходит для больших языковых моделей?

Из-за единой памяти: процессор и графика делят один пул до 512 ГБ. Модель на сотни гигабайт помещается целиком, её не нужно резать между картами и гонять данные по PCIe.

Сколько видеокарт заменяет Mac Studio с 512 ГБ памяти?

По опубликованным расчётам, для модели на 320 млрд параметров в FP8 (около 306 ГБ весов) на картах с 32 ГБ нужно минимум десять штук только под веса — более 20 000 долларов и порядка 5000 Вт.

Сколько памяти нужно под конкретную модель?

Считайте число параметров, умноженное на байты на параметр: 1 байт в FP8, около 0,5 в 4 битах, 2 в FP16. Добавьте запас под контекст и KV-кэш, иначе длинные документы упрутся в память.

Хватит ли 60 токенов в секунду для работы?

Для чата и ассистента по базе знаний — да, текст идёт быстрее, чем читает человек. Для сотен одновременных пользователей или ночной обработки тысяч файлов нужен сервер с видеокартами.

Что выгоднее: локальная машина или облачный API?

Если данные попадают под 152-ФЗ или NDA, вопрос решается в пользу локального контура; если нет, а объём непредсказуем, разумнее начать с облака. Сравнение — в статье локальный LLM против облака.

Коротко о главном

Единая память меняет правила: модель на сотни гигабайт помещается в тихую коробку на столе, а не в шумную стойку на киловатты. Mac не отменяет серверы с видеокартами — он закрывает другую нишу: приватные документы, небольшая команда, отсутствие серверной. Решение принимается счётом памяти и проверкой скорости на ваших текстах, а не по обзорам.

С чего начнём: вы описываете задачу и тип документов, я считаю нужный объём памяти, подбираю модель и конфигурацию, проверяю скорость и русский язык на ваших материалах. Дальше разворачиваю контур под ключ — доступ для команды, база знаний, бэкапы, инструкция. Начать можно со страницы приватного ИИ-облака.

Услуги по теме

Что я делаю для бизнеса

  • Боты в Telegram, MAX, VK
  • Автоматизация процессов и CRM
  • Аналитика и дашборды
  • Сайты и лендинги под ключ

Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»

12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.

Готовы обсудить вашу задачу?

Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.

Пишу о разработке, ИИ и законах для бизнеса

Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.

Готовые решения под ключTurnkey solutionsSoluciones llave en mano交钥匙解决方案Түлхүүр гардуулах шийдэл 449 готовых IT-решений для бизнеса449 ready-made IT solutions for business449 soluciones IT listas para empresas449 个面向企业的现成 IT 解决方案Бизнест зориулсан 449 бэлэн IT шийдэл Автоматизация, боты, AI, 152-ФЗ и платформы · бесплатная консультацияAutomation, bots, AI, data privacy and platforms · free consultationAutomatización, bots, IA, privacidad de datos y plataformas · consulta gratis自动化、机器人、AI、数据合规与平台 · 免费咨询Автоматжуулалт, бот, AI, өгөгдлийн хамгаалалт ба платформ · үнэгүй зөвлөгөө Смотреть каталогView catalogVer catálogo查看目录Каталог үзэх