Apple Mac mini auf einem Schreibtisch

LLMs locaux sur le Mac mini avec M6: Ce qu’Apple est nouvelle puce peut vraiment faire

Avec la nouvelle puce M6, Apple met l’IA locale à l’avant et au centre. Mais dans quelle mesure le Mac M6 – en particulier le nouveau mini Mac – gère-t-il réellement les gros modèles de langage (LLM) directement sur votre propre machine ? La réponse est de deux chiffres, pas le message marketing.

Related: Apple dévoile le nouveau Mac mini avec puce M6 – ici on décompose ce que cela signifie pour les LLM locaux.

Pourquoi lancer des LLM localement sur un Mac ?

Un modèle de langue fonctionnant localement présente trois avantages concrets : vos données ne quittent jamais la machine (privacité), il n’y a pas de coûts d’API par demande, et il fonctionne entièrement hors ligne. Pour les documents sensibles, l’aide au codage, ou simplement l’expérimentation, qui est attrayant – à condition que le matériel continue. Et c’est exactement là que le message marketing se part de la pratique.

Deux chiffres le décident – pas le moteur neuronal

Pour la pratique du LLM, deux mesures comptent le plus :

  • Mémoire unifiée (RAM): il détermine qui Les modèles s’inscrivent dans la mémoire du tout. Un modèle doit être chargé en totalité – s’il ne s’intègre pas en RAM, il ne s’exécutera pas ou ne rampera pas via le SSD.
  • Bande passante mémoire (GB/s): il détermine à quelle vitesse texte est généré. LLM inférence est presque toujours limitée par bande passante : pour chaque jeton, le modèle entier doit être lu à travers la mémoire une fois.

Une règle de pouce utile pour le plafond de vitesse: jetons/seconde φ bande passante mémoire ÷ taille du modèle en RAM. En réalité, vous atteignez environ 60 à 80 % de cela, parce que le cache KV, l’attention et les frais généraux du noyau consomment de la bande passante supplémentaire.

Ce que le M6 Mac mini offre en fait

Le nouveau Mac mini commence à 16 Go de mémoire unifiée avec 153 Go/s de bande passante (899 $). La mise à niveau à 24 ou 32 Go augmente la bande passante à 170 Go/s. Les maximum est de 32 Go – et c’est la limite décisive pour les LLM locaux.

  • 16 Go (153 Go/s): après macOS, environ 10 à 12 Go restent utilisables. Réaliste sont des modèles 7B/8B (4-bit quantifié, ~5 GB) – idéal pour le chat, les résumés, et l’aide de codage simple.
  • 24 Go (170 Go/s): maintenant les modèles 14B (~8–9 Go) s’adaptent confortablement, avec une salle de tête pour un contexte plus long.
  • 32 Go (170 Go/s): le plafond. Ceci charge même les modèles 30B/32B (4 bits, ~18-20 Go) – serrés, mais faisables. Les modèles de la classe 70B (~40 Go) ne correspondent plus.

C’est rapide ? Quelques points de référence

Appliqué aux 170 Go/s du M6 (avec un rabais réaliste de 70 pour cent), vous obtenez à peu près :

  • Modèle 8B (~5 Go): environ 20 à 25 jetons/s – plus rapide que la vitesse de lecture, très confortable.
  • Modèle 14B (~8.5 Go): environ 12-16 jetons/s – bien utilisables pour des tâches plus sérieuses.
  • Modèle 32B (~19 Go) : environ 5 à 7 jetons/s – nettement plus lent, mais bon pour les réponses de qualité si vous n’attendez pas chaque mot.

Pour le contexte : la base M6 à 153-170 Go/s est solide mais pas de monstre de bande passante. Un Mac Studio avec puce M-Max ou Ultra atteint 400 à plus de 800 Go/s et jusqu’à 192 Go de RAM – c’est là que les modèles 70B et des vitesses plus élevées deviennent possibles.

Le moteur neuronal double aide-t-il les LLM?

Apple commercialise le M6 avec un nouveau moteur neuronal double (deux unités de 16 cœurs). Important à savoir: les outils LLM communs tels que Ollama, LM Studio, ou lama.cpp calculent presque exclusivement sur le GPU, pas sur le moteur neuronal (ANE). L’ANE accélère principalement les propres fonctionnalités d’Apple sur les appareils et les modèles CoreML. Ainsi, pour les chatbots locaux classiques, le deuxième moteur neuronal apporte moins que le nom suggéré – le goulot d’étranglement reste bande passante mémoire.

Le bon logiciel

  • Ollama – l’entrée la plus facile : une commande, le modèle charge et exécute. Idéal pour un premier test.
  • Studio LM – une interface graphique avec un navigateur modèle, idéale pour les débutants sans terminal.
  • MLX – Le propre cadre d’Apple, optimisé spécifiquement pour Apple Silicon et souvent un peu plus rapide que les runtimes génériques.
  • Lama.cpp – la base maigre sur laquelle se fondent de nombreux outils ; contrôle maximal pour les utilisateurs avancés.

Mac mini, Studio ou Pro – ce qui convient aux LLM locaux?

En bref: M6 Mac mini est le point d’entrée idéal pour les LLM locaux jusqu’à environ 14B, et avec la variante 32 Go jusqu’à ~32B. Toute personne travaillant régulièrement avec des modèles 70B, chargeant plusieurs modèles en parallèle, ou voulant des vitesses élevées devrait atteindre Mac Studio avec une puce M-Max ou Ultra (plus de RAM et de bande passante). Il n’y a pas de « Mac Pro avec M6 » – les meilleurs modèles comptent toujours sur les puces Ultra. Pour la grande majorité des configurations de la maison et du développeur, cependant, le Mac mini avec 32 Go est le bon endroit.

Foire aux questions (FAQ)

Est-ce que 16 Go suffisent pour les LLM locaux ? Pour les modèles 7B/8B, oui – ils couvrent bien le chat, les résumés et les tâches de codage simples. Pour 14B et plus, choisissez la variante 24 ou 32 Go.

Quel modèle est un bon départ ? Un modèle 8B actuel (par exemple de la famille Llama, Qwen ou gpt-oss) en quantification 4 bits fonctionne sans problème sur n’importe quel mini Mac M6 et offre déjà des résultats étonnamment bons.

Que signifie « quantisé 4 bits »? Une compression qui bloque à peu près l’utilisation de la mémoire avec seulement une petite perte de qualité. C’est la façon standard de rendre les modèles utilisables sur le matériel grand public.

Puis-je exécuter des modèles 70B sur le Mac mini? Pratiquement non – ils ont besoin d’environ 40 Go et plus, et le mini Mac s’élève à 32 Go. Cela nécessite un Mac Studio avec une mémoire plus unifiée.

Est-ce qu’un Mac mini ou un PC de jeu avec une carte graphique est mieux? Un GPU dédié avec beaucoup de VRAM est souvent plus rapide sur la bande passante, mais coûteux et faible en puissance. Les scores Mac mini avec très faible puissance, fonctionnement silencieux, et la capacité de charger de grands modèles du tout grâce à la mémoire unifiée.


Sources : 9à5Mac, PommeInsider, Pomme Newsroom. Les figures de vitesse sont des approximations basées sur la règle de bande passante du pouce et varient avec le modèle, la quantification et la longueur du contexte.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Mastodon
Retour en haut