Гайд по локальным LLM на Mac 2026: что запускают 8, 16, 24 и 64 ГБ памяти?
Если у вас уже есть Mac или вы собираетесь его купить, но до сих пор непонятно, что реально тянут 8, 16, 24 или 64 ГБ объединённой памяти, здесь — таблица по четырём уровням RAM с основными размерами моделей и граничными попытками. Вместо расплывчатого «запускается» используем три уровня: загрузится / на каждый день / комфортно. Материал построен по объёму памяти, с примерами моделей, заметками по инструментам и чек-листом из 7 шагов (на 08.06.2026).
1. Ответ по четырём уровням: таблица 8 / 16 / 24 / 64 ГБ
Одна и та же модель на Mac с 8 ГБ может не загрузиться стабильно, на 16 ГБ — отвечать в чате, а на 24 ГБ — оставаться удобной, когда параллельно открыты браузер и заметки. Самая частая ошибка при настройке локальных LLM на Mac — принять «модель запустилась» за «ею можно пользоваться каждый день».
Краткий ответ: 8 ГБ → 1B–4B; 16 ГБ → в основном 7B–8B; 24 ГБ → 12B–14B; 64 ГБ → 30B–32B. На 64 ГБ можно попробовать часть квантизированных 70B, но это не означает длинный контекст, несколько моделей одновременно или стабильный мультитаскинг.
| Объединённая память | Лучше как основная модель | Осторожная граничная попытка | Типичные задачи | Главное напоминание |
|---|---|---|---|---|
| 8 ГБ | Квантизированные модели 1B–4B | Часть 7B в низкобитной квантизации, короткий контекст | Лёгкий чат, краткие summary, знакомство с локальным AI | Закрывайте фоновые приложения; не покупайте 8 ГБ ради LLM |
| 16 ГБ | Квантизированные модели 7B–8B | Часть моделей 12B–14B в квантизации | Ежедневный чат, лёгкий код, простой Q&A по документам | 16 ГБ — входной порог, а не комфортная линия для 14B |
| 24 ГБ | Квантизированные модели 12B–14B | Часть 20B–30B в низкобитной или эффективной квантизации | Стабильный личный ассистент, код, RAG, сравнение моделей | Длинный контекст и мультитаск быстро съедают запас |
| 64 ГБ | Квантизированные модели 30B–32B | Часть 70B в низкобитной или 4-bit квантизации | Крупные модели, dev-бэкенды, сложный RAG | 70B — граничное исследование, не безусловный комфорт |
Этот гайд не ранжирует поколения чипов. Он отвечает, что тянет каждый уровень памяти, где появляются тормоза и какой запас закладывать при покупке Mac под локальный AI.
2. Загрузится, на каждый день и комфортно: три уровня опыта
По всему тексту используем три уровня, чтобы «запускается» не скрывало плохой опыт:
| Уровень | Что означает | Типичное поведение |
|---|---|---|
| Загрузится (едва) | Модель стартует, но запас памяти минимален | Фон закрыт, короткий контекст; swap, медленный первый токен, подтормаживания в длинных диалогах |
| На каждый день | Можно пользоваться долго при одной задаче и умеренном контексте | Стабильный чат и лёгкий код; браузер + IDE ещё терпимы |
| Комфортно | Есть запас под длинный контекст и мультитаск | RAG, длинные треды, параллельные приложения без заметных лагов |
Основная модель в таблицах — это уровень «на каждый день» до «комфортно». Граничная попытка — уровень «загрузится», но не для постоянной работы.
3. Три типичные ошибки в оценке
- Смотреть только на параметры или размер скачивания. 7B, 14B и 32B — это масштаб; при той же цифре объём сильно меняется от квантизации (Q4, Q5, Q8), архитектуры и vision-компонентов. Тег в Ollama не гарантирует комфорт на вашем Mac.
- Считать «модель загрузилась» равным «ею стоит пользоваться каждый день». При нехватке памяти macOS активно уходит в swap на SSD — инференс резко замедляется, растёт износ диска. Swap не заменяет апгрейд RAM, а лишь удерживает систему на плаву.
- Игнорировать загрузку весов у MoE-моделей. У mixture-of-experts меньше активируемых параметров, но для инференса обычно всё равно загружаются все или почти все веса. Нельзя планировать RAM только по activated parameters.
4. Почему размер файла ≠ память во время работы
На Mac с Apple Silicon используется объединённая память: CPU, GPU и Neural Engine делят один пул — отдельной VRAM нет. Это первый и главный фильтр при выборе локальной LLM: общий объём RAM — жёсткий потолок.
4.1 Четыре понятия, которые нельзя смешивать
- Число параметров: 7B, 14B, 70B — масштаб модели, не размер на диске.
- Уровень квантизации: Q4_K_M, Q5, Q8 и т.д. — биты на параметр, влияют на файл и качество.
- Размер файла модели: объём GGUF/MLX при скачивании, обычно близок к весам, но не равен полной нагрузке на RAM.
- Память во время работы: веса + KV cache + фреймворк + macOS + другие приложения — реальное давление.
4.2 Куда уходит дополнительная память
Поэтому модель, которая «влезает на бумаге», всё равно может упасть: контекст 32K, десятки вкладок Chrome и KV cache съедают запас. Практическое правило: держите 20%–30% свободной RAM под локальные LLM; для граничных моделей — больше.
4.3 Примеры размеров в Ollama (на 08.06.2026)
Цифры иллюстрируют границы — это не полная память во время инференса:
| Модель | Типичная квантизация | ≈ скачивание | Какой уровень RAM |
|---|---|---|---|
| Gemma 3 4B | По умолчанию | ~3,3 ГБ | 8 ГБ — пробный опыт |
| Gemma 3 12B | По умолчанию | ~8,1 ГБ | 16 ГБ — граница / 24 ГБ — основа |
| Qwen3 14B | Q4_K_M | ~9,3 ГБ | 24 ГБ — комфортная основа |
| Gemma 3 27B | По умолчанию | ~17 ГБ | 64 ГБ — основной диапазон |
| Llama 3.3 70B | По умолчанию | ~43 ГБ | 64 ГБ — граница (контролируйте контекст) |
5. 8 ГБ: только мелкие модели и пробный опыт
8 ГБ — уровень знакомства с локальными LLM на Mac, а не ежедневная рабочая конфигурация. macOS и фон уже забирают заметную долю; под модель часто остаётся лишь около 3–4 ГБ практического запаса.
- Комфортная основа: квантизированные 1B–4B, например Gemma 3 1B/4B, Qwen3 1.7B/4B
- Граничная попытка: часть 7B в Q4 или ниже — короткий контекст, закрытый браузер и тяжёлые приложения
- Типичные задачи: лёгкий чат, краткие summary, проверка, стоит ли вам локальный AI
Уже есть 8 ГБ: попробуйте 1B–4B через Ollama или LM Studio, ограничьте контекст 4K–8K; в «Мониторинге системы» проверьте >2 ГБ свободной памяти перед загрузкой. Покупка нового Mac: не выбирайте 8 ГБ в первую очередь ради локальных LLM.
6. 16 ГБ: входной порог для локальных LLM
16 ГБ — самый обсуждаемый входной порог. Официальные рекомендации LM Studio тоже указывают 16 ГБ и выше; для 8 ГБ советуют мелкие модели и умеренный контекст — это подтверждает 16 ГБ как разумную стартовую линию.
- Комфортная основа: квантизированные 7B–8B, например Qwen3 8B, DeepSeek-R1 Distill 7B/8B (Q4)
- Граничная попытка: часть 12B–14B (например Gemma 3 12B ~8,1 ГБ) — закройте IDE и тяжёлые вкладки, контекст ≤8K
- 7B vs 14B на этом уровне: 7B–8B — на каждый день; 14B обычно только граница, не комфортный дефолт для 16 ГБ
16 ГБ хватает для обычного чата, лёгкого кода и простого Q&A по документам. Если нужен частый RAG или 14B как основная модель — смотрите на 24 ГБ.
7. 24 ГБ: сбалансированный вариант на долгий срок
24 ГБ — более сбалансированный выбор для долгосрочного личного использования локальных LLM: модели 12B–14B становятся основой, оставаясь место под браузер, IDE и заметки.
- Комфортная основа: квантизированные 12B–14B, например Gemma 3 12B, Qwen3 14B (Q4_K_M ~9,3 ГБ), DeepSeek-R1 Distill 14B
- Граничная попытка: часть 20B–30B в низкобитной или эффективной квантизации — контролируйте контекст и фон
- Типичные задачи: стабильный личный ассистент, помощь с кодом, прототипы RAG, сравнение моделей
Скрытая цена на 24 ГБ — длинный контекст и мультитаск: RAG на 32K может добавить несколько гигабайт KV cache. Чем ближе модель к потолку RAM, тем хуже скорость, запас по контексту и параллельная работа.
8. 64 ГБ: 30B–32B как основа, 70B на грани
64 ГБ открывают диапазон крупных моделей как основы. Квантизированные 30B–32B могут быть главными моделями с запасом под разработку и RAG.
- Комфортная основа: квантизированные 27B–32B, например Gemma 3 27B (~17 ГБ), Qwen3 30B/32B, DeepSeek-R1 Distill 32B
- Граничная попытка: часть 70B в низкобитной или 4-bit квантизации — Llama 3.3 70B по умолчанию ~43 ГБ загружается, но длинный контекст и высокая параллельность не идеальны
- Про 70B: ~43 ГБ весов + система + KV cache + фреймворк оставляют мало запаса на 64 ГБ. Лучше контекст ≤8K–16K, одна крупная модель, без параллельных 70B
| Размер модели | 8 ГБ | 16 ГБ | 24 ГБ | 64 ГБ |
|---|---|---|---|---|
| 7B–8B (Q4) | Граничная попытка | Комфортная основа | Легко | Легко |
| 14B (Q4) | Обычно нереально | Граничная попытка | Комфортная основа | Легко |
| 32B (Q4) | Нереально | Нереально | Граничная попытка | Комфортная основа |
| 70B (Q4 ~43 ГБ) | Нереально | Нереально | Нереально | Граничная попытка |
Помимо RAM, важны место на SSD, пропускная способность памяти, охлаждение и длительная нагрузка. Инференс крупных моделей чувствителен к bandwidth; безвентиляторный MacBook Air может троттлить при долгой работе. Конкретные tokens/s не приводим — скорость зависит от поколения чипа, GPU-ядер и фреймворка.
9. Ollama, LM Studio и MLX: как выбрать
Фреймворки не снимают потолок RAM, но меняют удобство, скорость загрузки и эффективность на Apple Silicon:
| Инструмент | Роль | Влияние на лимит памяти |
|---|---|---|
| Ollama | CLI + API-бэкенд, простое управление моделями | Относительно низкие накладные расходы; физический RAM не увеличивает |
| LM Studio | GUI-лаборатория моделей; GGUF и MLX | GUI добавляет расход; официально рекомендуют 16 ГБ+ |
| MLX / MLX LM | Нативный стек Apple, глубокая работа с объединённой памятью | Часто эффективнее на гигабайт, но крупные модели всё равно уходят в swap |
Кратко: API и автоматизация → Ollama; графические эксперименты и настройка → LM Studio; выжать эффективность Apple Silicon → модели в формате MLX. В любом случае сначала сверяйте размер модели с таблицами выше.
10. Покупка нового Mac: сколько памяти закладывать
Память на Mac после покупки не апгрейдится — недобор обычно дороже, чем разовая доплата за RAM. Подбирайте под сценарий:
| Ваша цель | Рекомендуемый RAM | Почему |
|---|---|---|
| Иногда попробовать локальный AI | На имеющихся 8 ГБ — проба; при покупке — минимум 16 ГБ | 8 ГБ вмещают только мелкие модели 1B–4B |
| Ежедневный чат + лёгкий код | 16 ГБ | Входной порог для квантизированных 7B–8B |
| Долгосрочный ассистент / RAG / разработка | 24 ГБ | 12B–14B как основа + запас под мультитаск |
| 30B–32B как основа или эксперименты с 70B | 64 ГБ и больше | Разумная стартовая точка для крупных моделей и сложного RAG |
Итог по покупке: на 8 ГБ сегодня — начните с 1B–4B; при покупке нового — минимум 16 ГБ; для долгосрочного личного использования — лучше 24 ГБ; если 30B–32B как основа или эксперименты с 70B — 64 ГБ и выше. Заложите место на SSD под веса: одна квантизированная 70B может занять более 40 ГБ на диске.
11. Чек-лист перед запуском (7 шагов)
Перед загрузкой новой модели пройдите список, чтобы не получить «скачалось, а работает плохо»:
- Проверьте тег квантизации. В Ollama или LM Studio читайте точную метку (например
qwen3:14b-q4_K_M), а не только число параметров. - Сверьте размер файла. Сравните с таблицей выше; веса выше ~50%–60% от вашего уровня RAM уже на грани.
- Ограничьте контекст. Начните с 4K–8K; увеличивайте только после стабильной работы. Для RAG заранее планируйте KV cache.
- Проверьте свободную память. «Мониторинг системы» → Память: зелёный индикатор, >20% свободной RAM перед загрузкой.
- Закройте лишний фон. Chrome, Slack, симуляторы и т.п.
- Убедитесь в запасе на SSD. Файлы моделей плюс swap — держите минимум ~20 ГБ свободно.
- Проверьте лицензию. Особенно для GGUF с Hugging Face или сторонних зеркал.
12. Локальные LLM на Mac mini
Всё из этого гайда работает на Mac с Apple Silicon — а Mac mini часто даёт лучшее соотношение цены и постоянной работы для локального AI. По сравнению с Windows-коробками или NUC того же класса Mac mini M4 с объединённой памятью даёт более высокую пропускную способность; CPU, GPU и Neural Engine делят один быстрый пул — для локального инференса в той же ценовой категории это обычно выгоднее классической связки CPU + дискретная VRAM.
Mac mini удобен и для долгой нагрузки: около 4 Вт в простое для круглосуточного Ollama-бэкенда; стабильность macOS для безнадзорных RAG- и API-узлов; Gatekeeper и SIP для более контролируемой среды моделей. Если вы подбираете 24 или 64 ГБ под постоянный локальный AI, компактный корпус, тишина и TCO Mac mini часто выигрывают у классических башен.
Если вы уже выбрали объём RAM по четырёхуровневой таблице и ищете железо под него, Mac mini M4 — один из самых экономичных стартов, особенно в конфигурациях 24 и 64 ГБ, где модели 14B и 32B переходят из «загрузится» в по-настоящему комфортную ежедневную работу. Самое время взять Mac mini и дать локальному LLM-воркфлоу работать на полную.
Запускайте локальные LLM на Mac mini
Объединённая память Apple Silicon + тихая низкая мощность — конфигурации 24 / 64 ГБ делают модели 14B–32B по-настоящему комфортными.