Ollama activa MLX por defecto en Apple Silicon
Ollama cambia automáticamente a MLX en modelos compatibles para ejecutar IA local en Apple Silicon.
El cambio está en el runtime, no en tu código
Si usas un Mac con Apple Silicon como nodo local de IA, normalmente quieres que el modelo aproveche el runtime adecuado sin convertir cada actualización en una sesión de pruebas. Ollama 0.40.0-rc0 cambia ese comportamiento para las arquitecturas compatibles: en Apple Silicon, los modelos soportados por MLX se ejecutan automáticamente con ese runtime. La novedad no exige cambiar comandos, endpoints ni clientes que ya hablen con Ollama.
Esto encaja especialmente bien en un homelab donde el Mac hace de servidor de inferencia y el resto de servicios consumen su API local. Un asistente de programación, una automatización o una aplicación Laravel pueden seguir apuntando al servidor de Ollama como antes. La diferencia relevante está debajo: el runtime se elige automáticamente cuando el modelo y el equipo son compatibles.
Una prueba local mínima
La propia nota de lanzamiento propone descargar y ejecutar qwen3.8. Es un flujo útil para comprobar que Ollama está operativo antes de conectarlo a una aplicación, sin introducir Docker, proxies ni una interfaz adicional. Si el modelo aún no está descargado, pull lo obtiene; después, run abre una conversación local.
ollama pull qwen3.8
ollama run qwen3.8No hace falta añadir un parámetro para pedir MLX en esos comandos. La selección automática depende de que estés en Apple Silicon y de que la arquitectura del modelo esté soportada por ese runtime. Durante esta versión preliminar, Ollama indica además que seguirá probando y habilitando modelos adicionales.
Conectar Laravel al servidor local
Para una aplicación Laravel, el punto de integración es la API local de Ollama en http://localhost:11434/api. El endpoint /api/chat acepta un modelo, una lista de mensajes y la opción stream; al usar false, recibimos una respuesta JSON completa, cómoda para una primera integración HTTP. Laravel permite establecer un tiempo máximo con timeout, enviar el cuerpo con post y lanzar una excepción HTTP con throw.
use Illuminate\Support\Facades\Http;
$response = Http::timeout(120)->post('http://localhost:11434/api/chat', [
'model' => 'qwen3.8',
'messages' => [
[
'role' => 'user',
'content' => 'Resume este ticket y propone los siguientes pasos.',
],
],
'stream' => false,
]);
$body = $response->throw()->json();
return $body['message']['content'];Con este patrón, Laravel no necesita saber si Ollama está ejecutando el modelo mediante MLX u otro runtime. La aplicación envía una petición HTTP local y consume el contenido de la respuesta. Esa separación permite cambiar de modelo sin rehacer la capa de integración.
La letra pequeña
No todos los modelos pasan automáticamente a MLX: el anuncio limita el cambio a las arquitecturas que el runtime soporta. Tampoco convierte cualquier Mac en una máquina adecuada para cualquier modelo o contexto; la memoria disponible sigue siendo un límite práctico. Conviene probar el modelo concreto y el tipo de carga real antes de convertirlo en dependencia de un flujo de trabajo.
Esta versión es una release candidate, no una versión final. El equipo de Ollama avisa de que durante el periodo preliminar seguirá validando y activando modelos, así que el alcance puede cambiar antes de una publicación estable. Si el nodo forma parte de un servicio importante, actualizar primero en un entorno de pruebas sigue siendo una decisión razonable.
Por último, localhost solo sirve a la propia máquina. Si Laravel se ejecuta en otro host, en una máquina virtual o dentro de un contenedor, esa dirección no apuntará automáticamente al Mac que ejecuta Ollama. Antes de abrir el servicio en red, revisa la exposición, el control de acceso y qué datos estás enviando al modelo local.