Mac Studio для локального ИИ: почему Apple Silicon обходит стойку из видеокарт
Единая память Apple Silicon позволяет держать модель на сотни гигабайт в одной тихой коробке вместо стойки видеокарт. Разбираю, как это устроено, кому подходит и как я подбираю конфигурацию под задачу.
Коротко (TL;DR)
- Преимущество Apple Silicon для ИИ — единая память: процессор и графика делят один пул, модель не режут между видеокартами.
- По опубликованным данным, Mac Studio M5 Ultra с 512 ГБ памяти и полосой 1,2 ТБ/с держит модель на 320 млрд параметров в FP8 (около 306 ГБ весов) и выдаёт порядка 60 токенов в секунду.
- Тот же объём на картах с 32 ГБ — минимум десять штук только под веса: свыше 20 000 долларов и порядка 5000 Вт.
- Решение для приватных документов и небольшой команды. Для сотен одновременных пользователей и для обучения моделей нужен сервер с видеокартами.
Mac Studio для локального ИИ — это компьютер с единой архитектурой памяти, где процессор и графическое ядро делят один пул объёмом до 512 ГБ, поэтому большая языковая модель помещается целиком, без разделения между видеокартами. Фокус не в частотах, а в том, что модель на сотни гигабайт перестаёт быть проблемой сборки. Разбираю, чем это отличается от стойки видеокарт и облака и по какой методике я подбираю конфигурацию.
В чём фокус единой памяти
В обычном ПК память разделена: у процессора своя оперативная, у видеокарты своя видеопамять, между ними шина PCIe. Модель должна лежать в видеопамяти, и как только она туда не влезает, начинается либо выгрузка слоёв в оперативную память с падением скорости в разы, либо разделение модели между несколькими картами.
Разделение работает, но платит задержками: на каждом шаге генерации промежуточные состояния переезжают между картами. И чем больше карт, тем сложнее сборка — плата, корпус, питание, охлаждение.
Единая память убирает этот слой проблем целиком: один пул, одна адресация, никаких копирований между устройствами. По опубликованным данным, Mac Studio M5 Ultra на 512 ГБ с пропускной способностью 1,2 ТБ/с вмещает модель GLM-5.3-Flash на 320 млрд параметров в FP8 — около 306 ГБ весов — и выдаёт примерно 60 токенов в секунду. У RTX 5090 видеопамяти 32 ГБ, поэтому под те же веса нужно минимум десять карт: 10 x 32 = 320 ГБ, более 20 000 долларов и порядка 5000 Вт.
Оговорюсь честно: это цифры из публикации от 31 августа 2026 года, а не мои замеры — сам подход я считаю архитектурно верным, но результаты на конкретной задаче проверяю отдельно.
Три подхода: Mac, стойка видеокарт, облако
| Параметр | Единая память | Сборка на видеокартах | Облачный API |
|---|---|---|---|
| Цена входа | Одна покупка | Карты, платформа, питание | Оплата по факту |
| Потолок модели | До 512 ГБ пула | Сумма памяти карт | Не ограничен |
| Скорость | Комфортна для чата | Выше на пакетах | Зависит от лимитов |
| Энергия | Сотни ватт | Киловатты, отдельная линия | Не ваша забота |
| Шум и место | Тихо, на столе | Шумно, нужна серверная | Отсутствует |
| Обслуживание | Минимальное | Драйверы, охлаждение | Только интеграция |
| Данные | Не покидают устройство | Не покидают контур | Уходят провайдеру |
Вывод, к которому я прихожу на разборах: Mac выигрывает там, где нужен большой объём памяти при скромном бюджете на инфраструктуру и отсутствии серверной. Стойка — там, где нужна пропускная способность на много запросов. Облако — на старте и там, где данные не чувствительны. Про выбор конкретной карты я писал в материале какую видеокарту брать под локальные LLM, требования к железу — в статье сколько железа нужно локальному ИИ. Эта статья — про выбор между тремя подходами.
Кому это подходит, а кому нет
Подходит, если данные чувствительные, а нагрузка умеренная:
- Юристы, медицина, бухгалтерия. Договоры, карты пациентов, первичка — материал, который в чужое облако не отправляют.
- Студии и подрядчики под NDA. Материалы заказчика не выходят за пределы офиса, и это фиксируется в договоре.
- Компании под 152-ФЗ. Персональные данные обрабатываются внутри периметра; аргументы разбирал в статье локальный ИИ — не паранойя, а расчёт.
- Разработка на своём коде. Репозиторий не уезжает наружу, а модель на сотни гигабайт даёт качество, недостижимое для лёгких моделей.
Не подходит в двух случаях. Первый — высокая нагрузка: сотни одновременных пользователей, тысячи документов за ночь; здесь нужен сервер с видеокартами. Второй — обучение моделей, а не инференс.
Методика: как я подбираю конфигурацию
Первым делом я считаю память, а не смотрю на цену. Правило: размер модели в гигабайтах примерно равен числу параметров, умноженному на байты на параметр — 2 байта в FP16, 1 байт в FP8, около 0,5 байта в 4-битном квантовании. Модель на 70 млрд параметров займёт порядка 140, 70 и 35 ГБ соответственно. Квантование — огрубление весов ради экономии памяти: до 8 бит потери обычно незаметны, ниже 4 бит качество на русском заметно проседает.
Дальше — запас. К весам добавляются контекст и KV-кэш: чем длиннее диалог и чем больше документов в запросе, тем больше памяти уходит сверх модели. Без запаса всё упрётся в память ровно тогда, когда система понадобится.
Потом четыре проверки на арендованном или демонстрационном железе, до покупки:
- Скорость на своих текстах — на реальных договорах и письмах компании, а не на синтетическом тесте.
- Русский язык — падежи, числительные, названия организаций, документы с опечатками.
- Вызов инструментов — если агент должен ходить в CRM и базу, это проверяется заранее.
- Поведение при нехватке данных — модель должна говорить «в документах этого нет», а не выдумывать.
Честная оговорка про скорость: около 60 токенов в секунду комфортны для чата и документов — текст идёт быстрее, чем человек читает. Для потоковой обработки тысяч запросов этого мало, и единая память тут не спасёт. Если не хотите проверять это на своих деньгах, я подбираю конфигурацию под сценарий: считаю память под модель, замеряю скорость на ваших документах и честно говорю, если нужен другой класс железа.
Как встроить это в работу компании
Купить коробку — самая простая часть. Дальше начинается то, на чём чаще всего спотыкаются.
- Кто администрирует. У машины должен быть владелец: обновления моделей, мониторинг, реакция на сбой.
- Доступ для команды. Одна машина обслуживает отдел по сети: интерфейс в локальной сети, учётные записи, разграничение прав.
- Бэкапы. Резервируются не веса, а нажитое: база знаний, история, настройки, промпты.
- Непрерывность. Если единственный знающий человек уходит в отпуск, система не должна вставать: инструкция, доступы у двоих, порядок восстановления.
Поэтому локальный ИИ — не «поставил и забыл», а маленькая, но настоящая ИТ-система. Развернуть её под ключ — моя работа: собираю контур, настраиваю доступы, подключаю базу знаний и мессенджеры, оставляю инструкцию и сопровождение. Формат — на странице приватного ИИ-облака, сеть и резервное копирование — в разделе ИТ-инфраструктура.
Частые вопросы
Почему Mac Studio подходит для больших языковых моделей?
Из-за единой памяти: процессор и графика делят один пул до 512 ГБ. Модель на сотни гигабайт помещается целиком, её не нужно резать между картами и гонять данные по PCIe.
Сколько видеокарт заменяет Mac Studio с 512 ГБ памяти?
По опубликованным расчётам, для модели на 320 млрд параметров в FP8 (около 306 ГБ весов) на картах с 32 ГБ нужно минимум десять штук только под веса — более 20 000 долларов и порядка 5000 Вт.
Сколько памяти нужно под конкретную модель?
Считайте число параметров, умноженное на байты на параметр: 1 байт в FP8, около 0,5 в 4 битах, 2 в FP16. Добавьте запас под контекст и KV-кэш, иначе длинные документы упрутся в память.
Хватит ли 60 токенов в секунду для работы?
Для чата и ассистента по базе знаний — да, текст идёт быстрее, чем читает человек. Для сотен одновременных пользователей или ночной обработки тысяч файлов нужен сервер с видеокартами.
Что выгоднее: локальная машина или облачный API?
Если данные попадают под 152-ФЗ или NDA, вопрос решается в пользу локального контура; если нет, а объём непредсказуем, разумнее начать с облака. Сравнение — в статье локальный LLM против облака.
Коротко о главном
Единая память меняет правила: модель на сотни гигабайт помещается в тихую коробку на столе, а не в шумную стойку на киловатты. Mac не отменяет серверы с видеокартами — он закрывает другую нишу: приватные документы, небольшая команда, отсутствие серверной. Решение принимается счётом памяти и проверкой скорости на ваших текстах, а не по обзорам.
С чего начнём: вы описываете задачу и тип документов, я считаю нужный объём памяти, подбираю модель и конфигурацию, проверяю скорость и русский язык на ваших материалах. Дальше разворачиваю контур под ключ — доступ для команды, база знаний, бэкапы, инструкция. Начать можно со страницы приватного ИИ-облака.
Что я делаю для бизнеса
- Боты в Telegram, MAX, VK
- Автоматизация процессов и CRM
- Аналитика и дашборды
- Сайты и лендинги под ключ
Бесплатно: чек-лист «Готов ли ваш бизнес к 152-ФЗ»
12 пунктов, которые проверяют готовность за час: данные, согласия, уведомление в РКН, локализация, защита. Отметьте, что уже сделано, и увидите дыры, за которые сейчас штрафуют.
Готовы обсудить вашу задачу?
Бесплатная консультация — разберём, как внедрить это в вашем бизнесе под ключ. Без форм, пишите напрямую.
Разборы, кейсы и практика — без воды. Выходит регулярно, читать 3–5 минут.


