Guide de configuration LLM local sur Mac en 2026 : que faire avec 8 Go, 16 Go, 24 Go et 64 Go ?
Vous avez déjà un Mac — ou vous en achetez un — et vous ne savez toujours pas ce que 8, 16, 24 ou 64 Go de mémoire unifiée permettent réellement en local ? Ce guide vous donne un tableau en quatre paliers avec tailles principales et essais limites, en distinguant chargement / usage quotidien / confort plutôt qu'un vague « ça tourne ». Tout est organisé par paliers de RAM, avec modèles représentatifs, notes sur les outils et une checklist en sept étapes (au 08-06-2026).
1. Réponse en quatre paliers : tableau 8 / 16 / 24 / 64 Go
Un même modèle peut ne pas se charger de façon stable sur un Mac 8 Go, suffire pour discuter sur 16 Go, et ne devenir vraiment pratique qu'à 24 Go lorsque vous gardez aussi un navigateur et des notes ouverts. L'erreur la plus courante en configuration LLM locale sur Mac : confondre « le modèle a démarré » avec « je peux l'utiliser tous les jours ».
Réponse rapide : 8 Go → 1B–4B ; 16 Go → 7B–8B en principal ; 24 Go → 12B–14B ; 64 Go → 30B–32B. Sur 64 Go, vous pouvez essayer certains modèles 70B quantifiés, mais cela n'implique ni long contexte, ni plusieurs modèles, ni multitâche toujours fluide.
| Mémoire unifiée | Mieux comme modèle principal | Essai limite prudent | Usage typique | Rappel clé |
|---|---|---|---|---|
| 8 Go | Modèles quantifiés 1B–4B | Certains 7B basse quantification, contexte court | Chat léger, résumés, découvrir l'IA locale | Fermer les apps en arrière-plan ; ne pas acheter 8 Go neuf pour les LLM |
| 16 Go | Modèles quantifiés 7B–8B | Certains modèles quantifiés 12B–14B | Chat quotidien, code léger, Q&R document simple | 16 Go = ligne d'entrée, pas confort 14B garanti |
| 24 Go | Modèles quantifiés 12B–14B | Certains 20B–30B basse quantification ou quantification efficace | Assistant personnel stable, code, RAG, comparer des modèles | Long contexte et multitâche mangent vite la marge |
| 64 Go | Modèles quantifiés 30B–32B | Certains 70B basse quantification ou 4 bits | Inférence grands modèles, backends dev, RAG complexe | 70B = exploration limite, pas confort inconditionnel |
Ce guide ne classe pas les générations de puces. Il répond à ce que chaque palier de mémoire peut faire, où les frictions apparaissent, et quelle marge prévoir à l'achat d'un Mac pour l'IA locale.
2. Chargement, usage quotidien et confort : trois niveaux
Dans tout l'article, nous utilisons trois niveaux pour que « ça tourne » ne masque pas une mauvaise expérience :
| Niveau | Signification | Comportement typique |
|---|---|---|
| Charge (à peine) | Le modèle démarre, mais la marge est minuscule | Apps fermées, contexte court ; swap, premier token lent, saccades après longues conversations |
| Usage quotidien | Utilisable durablement pour une tâche à contexte modéré | Chat et code léger stables ; navigateur + IDE encore acceptables |
| Confort | Marge pour contexte long et multitâche | RAG, fils longs, applications parallèles occasionnelles encore fluides |
Quand nous disons modèle principal, nous visons usage quotidien à confort. Quand nous disons essai limite, nous visons charge mais pas fiable sur la durée.
3. Trois erreurs de jugement fréquentes
- Ne regarder que le nombre de paramètres ou la taille du téléchargement. 7B, 14B et 32B sont des étiquettes d'échelle ; le même nombre peut varier fortement selon la quantification (Q4, Q5, Q8), l'architecture et les composants vision. Un tag Ollama ne garantit pas un usage confortable au quotidien sur votre Mac.
- Prendre « modèle chargé » pour « utilisable tous les jours ». Sous pression mémoire, macOS peut basculer massivement sur le SSD : l'inférence ralentit fortement et les écritures disque augmentent. Le swap n'est pas une extension de RAM — il maintient le système à flot.
- Ignorer le chargement des poids MoE. Les modèles mixture-of-experts annoncent moins de paramètres activés, mais l'inférence charge en général tous ou presque tous les poids en mémoire. Ne budgétisez pas la RAM uniquement sur les paramètres activés.
4. Pourquoi la taille du fichier n'est pas la mémoire à l'exécution
Les Mac Apple Silicon utilisent la mémoire unifiée : CPU, GPU et Neural Engine partagent un seul pool — pas de VRAM séparée. C'est le premier filtre pour dimensionner un LLM local : votre RAM totale est le plafond dur.
4.1 Quatre notions à distinguer
- Nombre de paramètres : ex. 7B, 14B, 70B — échelle du modèle, pas taille disque.
- Niveau de quantification : Q4_K_M, Q5, Q8, etc. — bits par paramètre, impact sur fichier et qualité.
- Taille du fichier modèle : téléchargement GGUF/MLX, proche de l'empreinte des poids mais pas du coût total à l'exécution.
- Mémoire à l'exécution : poids + cache KV + framework + macOS + autres apps — la vraie pression.
4.2 Où part la mémoire supplémentaire à l'exécution
Un modèle qui « tient sur le papier » peut donc échouer : contexte 32K, dizaines d'onglets Chrome et cache KV peuvent effacer la marge. En règle générale, gardez au moins 20 %–30 % de mémoire libre pour les LLM locaux ; les modèles limites en demandent plus.
4.3 Tailles Ollama représentatives (au 08-06-2026)
Ces chiffres illustrent les limites — ils ne sont pas la mémoire totale à l'exécution :
| Modèle | Quantification par défaut / courante | Téléchargement approx. | Palier illustré |
|---|---|---|---|
| Gemma 3 4B | Quantification par défaut | ~3,3 Go | Essai petit modèle 8 Go |
| Gemma 3 12B | Quantification par défaut | ~8,1 Go | Limite 16 Go / principal 24 Go |
| Qwen3 14B | Q4_K_M | ~9,3 Go | Principal confortable 24 Go |
| Gemma 3 27B | Quantification par défaut | ~17 Go | Plage principale 64 Go |
| Llama 3.3 70B | Quantification par défaut | ~43 Go | Limite 64 Go (contrôler le contexte) |
5. 8 Go : petits modèles et essais à faible coût
8 Go est un palier d'expérience pour les LLM locaux sur Mac, pas un palier d'usage quotidien. macOS et les applications en arrière-plan prennent déjà une large part ; les modèles disposent souvent de seulement 3–4 Go de marge pratique.
- Principal confortable : modèles quantifiés 1B–4B, ex. Gemma 3 1B/4B, Qwen3 1,7B/4B
- Essai limite : certains 7B Q4 ou quantification plus basse — contexte court, fermer navigateurs et apps lourdes
- Usage typique : chat léger, résumés, vérifier si l'IA locale est viable
Déjà en 8 Go : essayez 1B–4B avec Ollama ou LM Studio et plafonnez le contexte à 4K–8K ; vérifiez dans Moniteur d'activité qu'il reste >2 Go libres avant chargement. Achat neuf : ne choisissez pas 8 Go principalement pour les LLM locaux.
6. 16 Go : la ligne d'entrée pour les LLM locaux
16 Go est la ligne d'entrée la plus discutée pour les LLM locaux sur Mac. Les recommandations officielles de LM Studio suggèrent aussi 16 Go+ ; les machines 8 Go doivent rester sur des modèles plus petits et un contexte modéré — ce qui conforte 16 Go comme point de départ raisonnable.
- Principal confortable : modèles quantifiés 7B–8B, ex. Qwen3 8B, DeepSeek-R1 Distill 7B/8B (Q4)
- Essai limite : certains 12B–14B quantifiés (ex. Gemma 3 12B ~8,1 Go) — fermer IDE et onglets lourds, contexte ≤8K
- 7B vs 14B sur ce palier : 7B–8B = usage quotidien ; 14B = en général limite seulement, pas défaut confortable en 16 Go
16 Go convient au chat occasionnel, au code léger et à la Q&R document simple. Si vous prévoyez du RAG fréquent ou un 14B au quotidien, visez plutôt 24 Go.
7. 24 Go : meilleur équilibre pour un usage personnel durable
24 Go est un choix plus équilibré pour un usage personnel durable des LLM locaux : les modèles 12B–14B deviennent des principaux confortables tout en laissant de la place au navigateur, à l'IDE et aux notes.
- Principal confortable : 12B–14B quantifiés, ex. Gemma 3 12B, Qwen3 14B (Q4_K_M ~9,3 Go), DeepSeek-R1 Distill 14B
- Essai limite : certains 20B–30B basse quantification ou quantification efficace — contrôler contexte et charge en arrière-plan
- Usage typique : assistant personnel stable, aide au code, prototypes RAG, comparer des modèles
Le coût caché à 24 Go : long contexte et multitâche. Un RAG à 32K peut ajouter plusieurs Go de cache KV. Plus un modèle approche le plafond RAM, plus vitesse, marge de contexte et multitâche se dégradent.
8. 64 Go : 30B–32B au quotidien, 70B en limite
64 Go entre dans la plage de grands modèles au quotidien. Les modèles quantifiés 30B–32B peuvent être principaux avec de la marge pour le développement et le RAG.
- Principal confortable : 27B–32B quantifiés, ex. Gemma 3 27B (~17 Go), Qwen3 30B/32B, DeepSeek-R1 Distill 32B
- Essai limite : certains 70B basse quantification ou 4 bits — Llama 3.3 70B par défaut ~43 Go se charge, mais long contexte et forte concurrence ne sont pas idéaux
- Note 70B : ~43 Go de poids + système + cache KV + framework laisse une marge serrée sur 64 Go. Préférez contexte ≤8K–16K, un seul grand modèle à la fois, pas de 70B en parallèle
| Taille modèle | 8 Go | 16 Go | 24 Go | 64 Go |
|---|---|---|---|---|
| 7B–8B (Q4) | Essai limite | Principal confortable | Facile | Facile |
| 14B (Q4) | En général non viable | Essai limite | Principal confortable | Facile |
| 32B (Q4) | Non viable | Non viable | Essai limite | Principal confortable |
| 70B (Q4 ~43 Go) | Non viable | Non viable | Non viable | Essai limite |
Au-delà de la RAM, l'espace SSD, la bande passante mémoire, la dissipation thermique et la charge soutenue comptent. L'inférence des grands modèles est sensible à la bande passante ; les MacBook Air sans ventilateur peuvent limiter la fréquence sous charge longue. Nous ne citons pas de tokens/s précis — la vitesse dépend aussi de la génération de puce, des cœurs GPU et du framework.
9. Ollama, LM Studio et MLX : comment choisir
Les frameworks ne lèvent pas le plafond RAM, mais changent l'ergonomie, la vitesse de chargement et l'efficacité sur Apple Silicon :
| Outil | Rôle | Effet sur les limites mémoire |
|---|---|---|
| Ollama | CLI + backend API, gestion simple des modèles | Surcharge relativement faible ; n'augmente pas la RAM physique |
| LM Studio | Atelier graphique ; GGUF et MLX | L'interface ajoute de la surcharge ; recommandation officielle 16 Go+ |
| MLX / MLX LM | Stack native Apple, usage profond de la mémoire unifiée | Souvent plus efficace par Go, mais modèles trop gros = swap |
Choix rapides : API et automatisation → Ollama ; essais graphiques et réglages → LM Studio ; tirer le maximum d'Apple Silicon → modèles format MLX. Quel que soit l'outil, alignez d'abord la taille du modèle sur votre palier via les tableaux ci-dessus.
10. Acheter un nouveau Mac : combien de mémoire choisir
La RAM Apple n'est pas évolutive après achat — sous-dimensionner coûte souvent plus cher qu'un surcoût mémoire ponctuel. Adaptez à votre usage :
| Votre objectif | RAM suggérée | Pourquoi |
|---|---|---|
| Essai occasionnel d'IA locale | Essayer sur 8 Go existant ; achat neuf minimum 16 Go | 8 Go ne convient qu'aux petits modèles 1B–4B |
| Chat quotidien + code léger | 16 Go | Ligne d'entrée pour modèles quantifiés 7B–8B |
| Assistant durable / RAG / dev | 24 Go | Principaux 12B–14B + marge multitâche |
| Principal 30B–32B ou essais 70B | 64 Go ou plus | Point de départ raisonnable pour grands modèles et RAG complexe |
Synthèse achat : déjà en 8 Go → commencez par 1B–4B ; achat neuf → minimum 16 Go ; usage personnel durable → privilégiez 24 Go ; principal 30B–32B ou essais 70B → 64 Go ou plus. Prévoyez aussi de l'espace SSD pour les poids — un seul 70B quantifié peut dépasser 40 Go sur disque.
11. Checklist avant lancement (sept étapes)
Avant de charger un nouveau modèle, parcourez cette liste pour éviter « téléchargement OK, exécution médiocre » :
- Confirmer le tag de quantification. Dans Ollama ou LM Studio, lisez l'étiquette exacte (ex.
qwen3:14b-q4_K_M), pas seulement le nombre de paramètres. - Vérifier la taille du fichier. Comparez au tableau de référence ; des poids au-dessus de ~50 %–60 % de votre palier sont déjà serrés.
- Plafonner le contexte. Commencez à 4K–8K ; n'étendez qu'après stabilité. Le RAG demande une planification cache KV supplémentaire.
- Contrôler la mémoire libre. Moniteur d'activité → Mémoire : pression verte, >20 % de RAM libre avant chargement.
- Quitter les apps inutiles. Chrome, Slack, simulateurs, etc.
- Confirmer l'espace SSD libre. Fichiers modèles plus swap — gardez au moins ~20 Go libres.
- Vérifier la licence. Surtout pour les GGUF depuis Hugging Face ou miroirs tiers.
12. Faire tourner des LLM locaux sur Mac mini
Tout ce guide fonctionne sur les Mac Apple Silicon — et le Mac mini est souvent le meilleur rapport qualité-prix pour une IA locale toujours allumée. Face à des PC Windows ou NUC du même prix, la mémoire unifiée du Mac mini M4 offre une bande passante plus élevée ; CPU, GPU et Neural Engine partagent un pool rapide, ce qui dépasse en général les configurations CPU + VRAM discrète à prix équivalent pour l'inférence locale.
Le Mac mini convient aussi aux charges IA longues : ~4 W au repos pour un backend Ollama 24h/24 ; stabilité macOS pour nœuds RAG et API sans surveillance ; Gatekeeper et SIP pour un environnement modèles plus contrôlé. Si vous dimensionnez 24 ou 64 Go pour un flux IA local permanent, le format, le silence et le coût total de possession du Mac mini battent la plupart des tours de bureau.
Si vous choisissez la RAM avec le tableau en quatre paliers et voulez du matériel à la hauteur, le Mac mini M4 est l'un des points d'entrée les plus rentables — surtout en 24 et 64 Go, où les modèles 14B et 32B passent de « charge » à un usage quotidien vraiment confortable. Passez à l'action et laissez votre flux LLM local exprimer tout son potentiel.
Faites tourner des LLM locaux sur Mac mini
Mémoire unifiée Apple Silicon + faible consommation silencieuse — configs 24 / 64 Go pour des modèles 14B–32B vraiment confortables.