AI-инструменты 2026-06-08 · ~14 мин

Гайд по локальным LLM на Mac 2026: что запускают 8, 16, 24 и 64 ГБ памяти?

Если у вас уже есть Mac или вы собираетесь его купить, но до сих пор непонятно, что реально тянут 8, 16, 24 или 64 ГБ объединённой памяти, здесь — таблица по четырём уровням RAM с основными размерами моделей и граничными попытками. Вместо расплывчатого «запускается» используем три уровня: загрузится / на каждый день / комфортно. Материал построен по объёму памяти, с примерами моделей, заметками по инструментам и чек-листом из 7 шагов (на 08.06.2026).

Гайд по локальным LLM на Mac 2026: 8, 16, 24 и 64 ГБ объединённой памяти

1. Ответ по четырём уровням: таблица 8 / 16 / 24 / 64 ГБ

Одна и та же модель на Mac с 8 ГБ может не загрузиться стабильно, на 16 ГБ — отвечать в чате, а на 24 ГБ — оставаться удобной, когда параллельно открыты браузер и заметки. Самая частая ошибка при настройке локальных LLM на Mac — принять «модель запустилась» за «ею можно пользоваться каждый день».

Краткий ответ: 8 ГБ → 1B–4B; 16 ГБ → в основном 7B–8B; 24 ГБ → 12B–14B; 64 ГБ → 30B–32B. На 64 ГБ можно попробовать часть квантизированных 70B, но это не означает длинный контекст, несколько моделей одновременно или стабильный мультитаскинг.

Объединённая память Лучше как основная модель Осторожная граничная попытка Типичные задачи Главное напоминание
8 ГБ Квантизированные модели 1B–4B Часть 7B в низкобитной квантизации, короткий контекст Лёгкий чат, краткие summary, знакомство с локальным AI Закрывайте фоновые приложения; не покупайте 8 ГБ ради LLM
16 ГБ Квантизированные модели 7B–8B Часть моделей 12B–14B в квантизации Ежедневный чат, лёгкий код, простой Q&A по документам 16 ГБ — входной порог, а не комфортная линия для 14B
24 ГБ Квантизированные модели 12B–14B Часть 20B–30B в низкобитной или эффективной квантизации Стабильный личный ассистент, код, RAG, сравнение моделей Длинный контекст и мультитаск быстро съедают запас
64 ГБ Квантизированные модели 30B–32B Часть 70B в низкобитной или 4-bit квантизации Крупные модели, dev-бэкенды, сложный RAG 70B — граничное исследование, не безусловный комфорт

Этот гайд не ранжирует поколения чипов. Он отвечает, что тянет каждый уровень памяти, где появляются тормоза и какой запас закладывать при покупке Mac под локальный AI.

2. Загрузится, на каждый день и комфортно: три уровня опыта

По всему тексту используем три уровня, чтобы «запускается» не скрывало плохой опыт:

Уровень Что означает Типичное поведение
Загрузится (едва) Модель стартует, но запас памяти минимален Фон закрыт, короткий контекст; swap, медленный первый токен, подтормаживания в длинных диалогах
На каждый день Можно пользоваться долго при одной задаче и умеренном контексте Стабильный чат и лёгкий код; браузер + IDE ещё терпимы
Комфортно Есть запас под длинный контекст и мультитаск RAG, длинные треды, параллельные приложения без заметных лагов

Основная модель в таблицах — это уровень «на каждый день» до «комфортно». Граничная попытка — уровень «загрузится», но не для постоянной работы.

3. Три типичные ошибки в оценке

  1. Смотреть только на параметры или размер скачивания. 7B, 14B и 32B — это масштаб; при той же цифре объём сильно меняется от квантизации (Q4, Q5, Q8), архитектуры и vision-компонентов. Тег в Ollama не гарантирует комфорт на вашем Mac.
  2. Считать «модель загрузилась» равным «ею стоит пользоваться каждый день». При нехватке памяти macOS активно уходит в swap на SSD — инференс резко замедляется, растёт износ диска. Swap не заменяет апгрейд RAM, а лишь удерживает систему на плаву.
  3. Игнорировать загрузку весов у MoE-моделей. У mixture-of-experts меньше активируемых параметров, но для инференса обычно всё равно загружаются все или почти все веса. Нельзя планировать RAM только по activated parameters.

4. Почему размер файла ≠ память во время работы

На Mac с Apple Silicon используется объединённая память: CPU, GPU и Neural Engine делят один пул — отдельной VRAM нет. Это первый и главный фильтр при выборе локальной LLM: общий объём RAM — жёсткий потолок.

4.1 Четыре понятия, которые нельзя смешивать

  • Число параметров: 7B, 14B, 70B — масштаб модели, не размер на диске.
  • Уровень квантизации: Q4_K_M, Q5, Q8 и т.д. — биты на параметр, влияют на файл и качество.
  • Размер файла модели: объём GGUF/MLX при скачивании, обычно близок к весам, но не равен полной нагрузке на RAM.
  • Память во время работы: веса + KV cache + фреймворк + macOS + другие приложения — реальное давление.

4.2 Куда уходит дополнительная память

macOS: часто 2–4 ГБ и больше
Браузер / IDE: Chrome + Xcode могут занять 4–8 ГБ
Стек инференса: накладные расходы Ollama, llama.cpp, MLX
KV cache: растёт с длиной контекста — критично для чата и RAG
Несколько моделей: каждая загруженная модель добавляет ещё один блок весов
Vision / мультимодальность: у части моделей заметный дополнительный расход

Поэтому модель, которая «влезает на бумаге», всё равно может упасть: контекст 32K, десятки вкладок Chrome и KV cache съедают запас. Практическое правило: держите 20%–30% свободной RAM под локальные LLM; для граничных моделей — больше.

4.3 Примеры размеров в Ollama (на 08.06.2026)

Цифры иллюстрируют границы — это не полная память во время инференса:

Модель Типичная квантизация ≈ скачивание Какой уровень RAM
Gemma 3 4B По умолчанию ~3,3 ГБ 8 ГБ — пробный опыт
Gemma 3 12B По умолчанию ~8,1 ГБ 16 ГБ — граница / 24 ГБ — основа
Qwen3 14B Q4_K_M ~9,3 ГБ 24 ГБ — комфортная основа
Gemma 3 27B По умолчанию ~17 ГБ 64 ГБ — основной диапазон
Llama 3.3 70B По умолчанию ~43 ГБ 64 ГБ — граница (контролируйте контекст)

5. 8 ГБ: только мелкие модели и пробный опыт

8 ГБ — уровень знакомства с локальными LLM на Mac, а не ежедневная рабочая конфигурация. macOS и фон уже забирают заметную долю; под модель часто остаётся лишь около 3–4 ГБ практического запаса.

  • Комфортная основа: квантизированные 1B–4B, например Gemma 3 1B/4B, Qwen3 1.7B/4B
  • Граничная попытка: часть 7B в Q4 или ниже — короткий контекст, закрытый браузер и тяжёлые приложения
  • Типичные задачи: лёгкий чат, краткие summary, проверка, стоит ли вам локальный AI

Уже есть 8 ГБ: попробуйте 1B–4B через Ollama или LM Studio, ограничьте контекст 4K–8K; в «Мониторинге системы» проверьте >2 ГБ свободной памяти перед загрузкой. Покупка нового Mac: не выбирайте 8 ГБ в первую очередь ради локальных LLM.

6. 16 ГБ: входной порог для локальных LLM

16 ГБ — самый обсуждаемый входной порог. Официальные рекомендации LM Studio тоже указывают 16 ГБ и выше; для 8 ГБ советуют мелкие модели и умеренный контекст — это подтверждает 16 ГБ как разумную стартовую линию.

  • Комфортная основа: квантизированные 7B–8B, например Qwen3 8B, DeepSeek-R1 Distill 7B/8B (Q4)
  • Граничная попытка: часть 12B–14B (например Gemma 3 12B ~8,1 ГБ) — закройте IDE и тяжёлые вкладки, контекст ≤8K
  • 7B vs 14B на этом уровне: 7B–8B — на каждый день; 14B обычно только граница, не комфортный дефолт для 16 ГБ

16 ГБ хватает для обычного чата, лёгкого кода и простого Q&A по документам. Если нужен частый RAG или 14B как основная модель — смотрите на 24 ГБ.

7. 24 ГБ: сбалансированный вариант на долгий срок

24 ГБ — более сбалансированный выбор для долгосрочного личного использования локальных LLM: модели 12B–14B становятся основой, оставаясь место под браузер, IDE и заметки.

  • Комфортная основа: квантизированные 12B–14B, например Gemma 3 12B, Qwen3 14B (Q4_K_M ~9,3 ГБ), DeepSeek-R1 Distill 14B
  • Граничная попытка: часть 20B–30B в низкобитной или эффективной квантизации — контролируйте контекст и фон
  • Типичные задачи: стабильный личный ассистент, помощь с кодом, прототипы RAG, сравнение моделей

Скрытая цена на 24 ГБ — длинный контекст и мультитаск: RAG на 32K может добавить несколько гигабайт KV cache. Чем ближе модель к потолку RAM, тем хуже скорость, запас по контексту и параллельная работа.

8. 64 ГБ: 30B–32B как основа, 70B на грани

64 ГБ открывают диапазон крупных моделей как основы. Квантизированные 30B–32B могут быть главными моделями с запасом под разработку и RAG.

  • Комфортная основа: квантизированные 27B–32B, например Gemma 3 27B (~17 ГБ), Qwen3 30B/32B, DeepSeek-R1 Distill 32B
  • Граничная попытка: часть 70B в низкобитной или 4-bit квантизации — Llama 3.3 70B по умолчанию ~43 ГБ загружается, но длинный контекст и высокая параллельность не идеальны
  • Про 70B: ~43 ГБ весов + система + KV cache + фреймворк оставляют мало запаса на 64 ГБ. Лучше контекст ≤8K–16K, одна крупная модель, без параллельных 70B
Размер модели 8 ГБ 16 ГБ 24 ГБ 64 ГБ
7B–8B (Q4) Граничная попытка Комфортная основа Легко Легко
14B (Q4) Обычно нереально Граничная попытка Комфортная основа Легко
32B (Q4) Нереально Нереально Граничная попытка Комфортная основа
70B (Q4 ~43 ГБ) Нереально Нереально Нереально Граничная попытка

Помимо RAM, важны место на SSD, пропускная способность памяти, охлаждение и длительная нагрузка. Инференс крупных моделей чувствителен к bandwidth; безвентиляторный MacBook Air может троттлить при долгой работе. Конкретные tokens/s не приводим — скорость зависит от поколения чипа, GPU-ядер и фреймворка.

9. Ollama, LM Studio и MLX: как выбрать

Фреймворки не снимают потолок RAM, но меняют удобство, скорость загрузки и эффективность на Apple Silicon:

Инструмент Роль Влияние на лимит памяти
Ollama CLI + API-бэкенд, простое управление моделями Относительно низкие накладные расходы; физический RAM не увеличивает
LM Studio GUI-лаборатория моделей; GGUF и MLX GUI добавляет расход; официально рекомендуют 16 ГБ+
MLX / MLX LM Нативный стек Apple, глубокая работа с объединённой памятью Часто эффективнее на гигабайт, но крупные модели всё равно уходят в swap

Кратко: API и автоматизация → Ollama; графические эксперименты и настройка → LM Studio; выжать эффективность Apple Silicon → модели в формате MLX. В любом случае сначала сверяйте размер модели с таблицами выше.

10. Покупка нового Mac: сколько памяти закладывать

Память на Mac после покупки не апгрейдится — недобор обычно дороже, чем разовая доплата за RAM. Подбирайте под сценарий:

Ваша цель Рекомендуемый RAM Почему
Иногда попробовать локальный AI На имеющихся 8 ГБ — проба; при покупке — минимум 16 ГБ 8 ГБ вмещают только мелкие модели 1B–4B
Ежедневный чат + лёгкий код 16 ГБ Входной порог для квантизированных 7B–8B
Долгосрочный ассистент / RAG / разработка 24 ГБ 12B–14B как основа + запас под мультитаск
30B–32B как основа или эксперименты с 70B 64 ГБ и больше Разумная стартовая точка для крупных моделей и сложного RAG

Итог по покупке: на 8 ГБ сегодня — начните с 1B–4B; при покупке нового — минимум 16 ГБ; для долгосрочного личного использования — лучше 24 ГБ; если 30B–32B как основа или эксперименты с 70B — 64 ГБ и выше. Заложите место на SSD под веса: одна квантизированная 70B может занять более 40 ГБ на диске.

11. Чек-лист перед запуском (7 шагов)

Перед загрузкой новой модели пройдите список, чтобы не получить «скачалось, а работает плохо»:

  1. Проверьте тег квантизации. В Ollama или LM Studio читайте точную метку (например qwen3:14b-q4_K_M), а не только число параметров.
  2. Сверьте размер файла. Сравните с таблицей выше; веса выше ~50%–60% от вашего уровня RAM уже на грани.
  3. Ограничьте контекст. Начните с 4K–8K; увеличивайте только после стабильной работы. Для RAG заранее планируйте KV cache.
  4. Проверьте свободную память. «Мониторинг системы» → Память: зелёный индикатор, >20% свободной RAM перед загрузкой.
  5. Закройте лишний фон. Chrome, Slack, симуляторы и т.п.
  6. Убедитесь в запасе на SSD. Файлы моделей плюс swap — держите минимум ~20 ГБ свободно.
  7. Проверьте лицензию. Особенно для GGUF с Hugging Face или сторонних зеркал.

12. Локальные LLM на Mac mini

Всё из этого гайда работает на Mac с Apple Silicon — а Mac mini часто даёт лучшее соотношение цены и постоянной работы для локального AI. По сравнению с Windows-коробками или NUC того же класса Mac mini M4 с объединённой памятью даёт более высокую пропускную способность; CPU, GPU и Neural Engine делят один быстрый пул — для локального инференса в той же ценовой категории это обычно выгоднее классической связки CPU + дискретная VRAM.

Mac mini удобен и для долгой нагрузки: около 4 Вт в простое для круглосуточного Ollama-бэкенда; стабильность macOS для безнадзорных RAG- и API-узлов; Gatekeeper и SIP для более контролируемой среды моделей. Если вы подбираете 24 или 64 ГБ под постоянный локальный AI, компактный корпус, тишина и TCO Mac mini часто выигрывают у классических башен.

Если вы уже выбрали объём RAM по четырёхуровневой таблице и ищете железо под него, Mac mini M4 — один из самых экономичных стартов, особенно в конфигурациях 24 и 64 ГБ, где модели 14B и 32B переходят из «загрузится» в по-настоящему комфортную ежедневную работу. Самое время взять Mac mini и дать локальному LLM-воркфлоу работать на полную.

Конфигурации под локальный AI

Запускайте локальные LLM на Mac mini

Объединённая память Apple Silicon + тихая низкая мощность — конфигурации 24 / 64 ГБ делают модели 14B–32B по-настоящему комфортными.

🧠 До 64 ГБ RAM ⚡ ~4 Вт в простое 🔒 Нативная безопасность macOS
Аренда macOS в облаке Спеццена — ограниченное время
Получить сейчас