Apple Mac mini auf einem Schreibtisch

LLM local en el mini Mac con M6: Lo Nuevo Chip de Apple puede realmente hacer

Con el nuevo chip M6, Apple pone al frente y al centro de computación local AI. Pero ¿qué tan bien el M6 Mac – específicamente el nuevo Mac mini – realmente maneja modelos de lenguaje grandes (LLMs) directamente en su propia máquina? La respuesta se reduce a dos números, no el mensaje de marketing.

Relacionados: Apple revela el nuevo Mac mini con chip M6 – aquí derribamos lo que significa para los LLM locales.

¿Por qué ejecutar LLMs localmente en un Mac?

Un modelo de lenguaje local tiene tres ventajas concretas: sus datos nunca salen de la máquina (privacy), no hay costos de API por solicitud, y funciona completamente fuera de línea. Para documentos sensibles, ayuda de codificación, o simplemente experimentando, que es atractivo – siempre que el hardware se mantenga levantado. Y esto es exactamente donde el mensaje de marketing se divide en formas con la práctica.

Dos números lo deciden – no el motor neuronal

Para la práctica de LLM, dos métricas importan más:

  • Memoria unificada (RAM): determina que modelos encajan en la memoria. Un modelo debe ser cargado en su totalidad – si no encaja en la RAM, no funcionará ni se arrastrará a través de la SSD.
  • Ancho de memoria (GB/s): determina que rápido texto se genera. La inferencia LLM está casi siempre limitada a ancho de banda: para cada ficha, todo el modelo tiene que ser leído a través de la memoria una vez.

Una regla útil para el techo de velocidad: tokens/second ♥ memoria ancho de banda ÷ tamaño de modelo en RAM. En realidad se alcanza alrededor del 60-80 por ciento de eso, porque el caché KV, la atención y el núcleo de arriba consumen ancho de banda adicional.

Lo que el M6 Mac mini realmente ofrece

El nuevo Mac mini comienza a 16 GB de memoria unificada con 153 GB/s de ancho de banda (899). La actualización de 24 o 32 GB eleva ancho de banda a 170 GB/s. El máximo es de 32 GB – y ese es el límite decisivo para las LLM locales.

  • 16 GB (153 GB/s): después de macOS, aproximadamente 10–12 GB siguen siendo utilizables. Realista son modelos 7B/8B (4 bits cuantificados, ~5 GB) – ideal para chat, resúmenes y simple ayuda de codificación.
  • 24 GB (170 GB/s): ahora los modelos 14B (~8–9 GB) encajan cómodamente, con el aula para un contexto más largo.
  • 32 GB (170 GB/s): el techo. Esto incluso carga 30B/32B modelos (4-bit, ~18–20 GB) – apretado, pero factible. Los modelos en la clase 70B (~40 GB) ya no encajan.

¿Qué tan rápido es? Algunos puntos de referencia

Aplicado a los 170 GB/s del M6 (con un descuento realista del 70%), se obtiene aproximadamente:

  • Modelo 8B (~5 GB): aproximadamente 20–25 fichas/s – más rápido que la velocidad de lectura, muy cómodo.
  • Modelo 14B (~8.5 GB): aproximadamente 12–16 fichas/s – bien utilizable para tareas más serias.
  • Modelo 32B (~19 GB): aproximadamente 5–7 fichas/s – notablemente más lenta, pero bien para respuestas de calidad si no estás esperando en cada palabra.

Para contexto: la base M6 a 153–170 GB/s es sólida pero ningún monstruo ancho de banda. Un Mac Studio con un chip M-Max o Ultra alcanza los 400 a más de 800 GB/s y hasta 192 GB de RAM, es decir, donde los modelos 70B y las velocidades más altas son posibles.

¿El dual Neural Engine ayuda con LLMs?

Apple comercializa el M6 con un nuevo dual Neural Engine (dos unidades de 16 núcleos). Importante para saber: las herramientas LLM comunes como Ollama, LM Studio, o llama.cpp compute casi exclusivamente en el GPU, no en el Motor Neural (ANE). El ANE acelera principalmente las propias características de Apple en el dispositivo y los modelos CoreML. Así que para los chatbots locales clásicos, el segundo Neural Engine trae menos que el nombre sugiere – el cuello de botella permanece ancho de banda de memoria.

El software adecuado

  • Ollama – la entrada más fácil: un comando, el modelo carga y corre. Ideal para una primera prueba.
  • LM Studio – una interfaz gráfica con un navegador modelo, ideal para principiantes sin terminal.
  • MLX – El propio marco de Apple, optimizado específicamente para Apple Silicon y a menudo un poco más rápido que los tiempos de ejecución genéricos.
  • llama.cpp – la base magra muchas herramientas se construyen; control máximo para usuarios avanzados.

Mac mini, Studio, o Pro – ¿Qué cabe para LLMs locales?

En resumen: el M6 Mac mini es el punto de entrada ideal para LLMs locales hasta alrededor de 14B, y con la variante 32 GB hasta ~32B. Cualquier persona que trabaje regularmente con modelos 70B, cargando varios modelos en paralelo, o deseando altas velocidades debe llegar a los Mac Studio con un M-Max o Ultra chip (mucho más RAM y ancho de banda). No hay «Mac Pro con M6» – los modelos superiores todavía dependen de los chips Ultra. Para la gran mayoría de las configuraciones del hogar y del desarrollador, sin embargo, el Mac mini con 32 GB es el punto de rendimiento del precio.

Preguntas frecuentes (FAQ)

¿Son 16 GB suficientes para las LLM locales? Para los modelos 7B/8B, sí – cubren bien las tareas de chat, resúmenes y codificación simple. Para 14B y más grande, elija la variante 24 o 32 GB.

¿Qué modelo es un buen comienzo? Un modelo actual de 8B (p. ej. de la familia Llama, Qwen, o gpt-oss) en cuantización de 4 bits funciona sin problemas en cualquier mini M6 Mac y ya ofrece resultados sorprendentemente buenos.

¿Qué significa «cuantización de 4 bits»? Una compresión que cuelga aproximadamente el uso de la memoria con sólo una pequeña pérdida en calidad. Es la forma estándar de hacer modelos utilizables en hardware de consumo.

¿Puedo ejecutar modelos 70B en el Mac mini? Prácticamente no – necesitan alrededor de 40 GB y más, y el Mac mini tops fuera de 32 GB. Eso requiere un Mac Studio con memoria más unificada.

¿Es un Mac mini o un PC de juego con una tarjeta gráfica mejor? Una GPU dedicada con un montón de VRAM es a menudo más rápido en ancho de banda, pero costoso y hambriento de poder. El Mac mini puntua con muy baja potencia, operación tranquila, y la capacidad de cargar grandes modelos en absoluto gracias a la memoria unificada.


Fuentes: 9to5Mac, AppleInsider, Apple Newsroom. Las figuras de velocidad son aproximaciones basadas en la regla de ancho de banda del pulgar y varían con modelo, cuantificación y longitud de contexto.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Mastodon
Scroll al inicio