La mejor compra que pude hacer, el M4 Pro sin desempaquetar por Wallapop. 24GB de RAM, que no son parar tirar cohetes, pero es lo que dices, te venden lo de la IA y no deja de ser Apple Intelligence y gracias.
Apple Intelligence de momento es un fiasco, pero un Mac con Apple Silicon es hoy por hoy una de las mejores maneras de usar modelos de IA de forma local con total privacidad y control de costes.
Apple lo sabe, es una compañía que vende hardware, y su apuesta fuerte con la IA va a ser vender un hardware que cada vez es más caro, pero lo van a vender como churros. Y si es demasiado caro, lo van vender como un servicio.
Un Mac mini bien configurado es una gran alternativa para IA local, pero para eso hace falta memoria, muchísima y cuanta más mejor.
El Mac mini M6 se sitúa como un modelo "de consumo", hipervitaminado para consumo, pero insuficiente para IA con su tope de 32GB de RAM, para lo que te invitan a comprar un M5 Pro. No sé quién está a los mandos del "naming" de los modelos, pero necesita un recambio.
Además, gracias a la posibilidad de conectar varios Mac entre sí con las conexiones Thunderbolt, puedes hacer que funcionen de forma conjunta para poder cargar en memoria y de forma distribuida un modelo de los grandes, de los que compiten con los modelos frontera.
Mi MacBook Air M5 con 24GB se queda justo para ejecutar los modelos más potentes, pero con las herramientas y modelos adecuados, tienes un sistema que responde rapidísimo a cualquier consulta que le hagas.
En la última WWDC a principios de junio, presentaron MLX Serve como plataforma de IA local especializada para equipos como Apple Silicon. Es lo que estoy usando últimamente y me está gustando mucho el resultado.
MLX Serve es un proyecto open-source que proporciona un servidor para realizar inferencia de forma nativa en equipos con Apple Silicon, que puedes configurar como end-points gracias a las API compatibles con OpenAI y Anthropic. Utiliza el framework MLX, optimizado al máximo para el hardware, escrito en Swift y no en Python.
Native Zig inference server for Apple Silicon. MLX + GGUF. OpenAI- and Anthropic-compatible APIs. No Python. Drop-in alternative to LM Studio and Ollama on macOS.
mlxserve.com
Para los que hayáis usado LM Studio, es parecido pero funciona notablemente más rápido en mi equipo.
He usado las recomendaciones de la propia aplicación MLX Core, que te indica si el modelo es adecuado o no para tu hardware.
Para chats de texto, la latencia con Gemma 4 12B de Google es excelente, con respuestas prácticamente instantáneas. Me gusta bastante más que Gemma4 26B A4B porque en general me ofrece mejores resultados y en menos tiempo.
El modelo tiene capacidades de visión y le puedes pedir que analice una imagen al mismo tiempo que le pides una respuesta.
Para realizar tareas con agentes y herramientas, algo con lo que me estoy metiendo ahora poco a poco, tengo instalado el modelo que Qwen3.5 9B que recomienda
Qwen3 TTS 1.7B bf16 se puede usar para conversión de texto a voz con bastante calidad y con capacidad incluso de clonar voces.
Flux 2 Klein 9B 4-bit lo he probado para generar imágenes. Es una tarea pesada y lenta en el MacBook Air M5, pero para cuando quieres privacidad 100% y poder ejecutarlo sin salir de tu equipo, te ofrece un solución.
Se pueden usar también modelos para generar música y vídeo, pero son tareas que a las que no llega mi hardware.
El MacBook Air M5 Pro es el único equipo que tengo con capacidad de ejecutar modelos de IA de forma local, y MLX Serve me permite configurarlo de forma que pueda actuar como servidor, y acceder a él desde cualquiera de mis equipos estén donde estén gracias a la red virtual que tengo configurada con Tailscale.
MLX Serve puedes usarlo como aplicación para interactuar con la IA, pero como front-end prefiero utilizar OpenWebUI, que tengo instalado en un Docker en mi Sagar Hozkatua.


