gratis · macOS · apple silicon

Todo aquello para lo que usas IA.
Nada de ello sale del Mac.

Chatea con cualquier modelo abierto, escribe código con 20 herramientas agénticas, genera y edita imágenes con Flux, convierte modelos entre formatos y sirve una API compatible con OpenAI o Anthropic a tus otras apps. Una sola app, funcionando enteramente en Apple Silicon. Sin claves de API, sin suscripción, sin subir nada.

Gratis para siempre · macOS 14.5+ · del M1 al M5 · 8 GB mínimo, 16 GB o más recomendado

MLX Studio — Consola
La consola a media respuesta: el bloque de razonamiento desplegado y un pie de turno con tokens, rendimiento, velocidad de prompt, estado de caché y tiempo hasta el primer token.
herramientas agénticas
20+
Archivos, búsqueda, shell, git, web — sin configurar
arquitecturas
50+
Incluidos híbridos Mamba y SSM
modelos de imagen
9
6 de generación, 3 de edición, todos locales
coste
$0
Sin suscripción, sin claves de API, sin cuenta
01

Todo lo que necesitas. Nada en la nube.

Lo bastante simple para abrirla y empezar a chatear, lo bastante profunda para ejecutar debajo una pila de inferencia completa — cuantización de caché KV, caché de prefijos, decodificación especulativa y 14 analizadores de herramientas, todo a mano si lo quieres e invisible si no.

01 Chat en streamingConversaciones de varios turnos con marcas de llamadas a herramientas, bloques de razonamiento plegables, vistas previas de imágenes y estado en vivo. cualquier modelo
02 Programación agénticaMás de 20 herramientas integradas con soporte nativo de MCP. Los modelos leen, escriben, buscan y ejecutan directamente en tu máquina. 20 herramientas
03 Generación y edición de imágenesFlux Schnell, Dev y Klein para generar; Qwen Image Edit, Flux Kontext y Flux Fill para retocar y cambiar de estilo. 9 modelos
04 Visión y multimodalArrastra una imagen al chat. Los modelos de visión la analizan localmente, con vista previa ampliable. qwen vl
05 Bloques de razonamientoCadena de pensamiento plegable para DeepSeek R1, Qwen 3 y GLM. Mira el proceso o guárdalo. 4 analizadores
06 VozLectura en voz alta de cada respuesta con la síntesis de voz nativa del Mac. Salida sin manos. integrado
07 APIs de Anthropic y OpenAIUn endpoint nativo de Anthropic Messages junto a OpenAI Chat y Responses. Claude Code, OpenClaw y el SDK de Anthropic se conectan sin cambios, y también puedes apuntar a endpoints remotos. ambas
08 Conversor de modelosDe GGUF a MLX dentro de la app, más perfiles de cuantización de precisión mixta JANG. Sin esperar a que otro publique una conversión. gguf → mlx
────────────────────────────────────────────────────────────────────────────────────────────────────────
02

Más de 20 herramientas integradas. Cero configuración.

Llamadas a herramientas MCP nativas, activadas de serie. El modelo puede leer tus archivos, buscar en tu código, ejecutar un comando y consultar el estado de git — todo en local, sin plugins que instalar ni claves que pegar.

File I/O

  • read_file
  • write_file
  • edit_file
  • list_dir
  • copy
  • move
  • delete

Code search

  • grep
  • glob

Shell

  • execute_command

Web

  • duckduckgo_search
  • brave_search
  • fetch_url

Git

  • git_status
  • git_diff
  • git_log
  • git_show

Utilities

  • clipboard_read
  • clipboard_write
  • current_datetime
────────────────────────────────────────────────────────────────────────────────────────────────────────
03

Genera y edita imágenes en tu propia máquina

Nueve modelos, descargados cuando hacen falta y ejecutados en Apple Silicon. Dale un prompt, o una foto y un prompt para retocar, transformar o cambiar el estilo. Sin API en la nube, sin créditos.

Flux Schnell
Generación más rápida · 4 pasos · ~6-24 GB
Z-Image Turbo
Turbo rápido · 4 pasos · ~6-24 GB
Flux Dev
Alta calidad · 20 pasos · ~6-24 GB
FLUX.2 Klein 4B
Rápido y pequeño · 20 pasos · ~4-8 GB
FLUX.2 Klein 9B
Calidad media · 20 pasos · ~8-18 GB
Qwen Image
Gran comprensión del prompt · 20 pasos · ~20-40 GB
Qwen Image Edit
Edición por instrucciones · 28 pasos · ~54 GB
Flux Kontext
Edición con sujeto consistente · 24 pasos · ~6-24 GB
Flux Fill
Retoque interior con máscara · 20 pasos · ~24 GB
────────────────────────────────────────────────────────────────────────────────────────────────────────
04

Debajo, el motor vMLX

MLX Studio es la app — la ventana de chat, las herramientas, el explorador de modelos. vMLX es el motor de inferencia que la mueve, y es de código abierto. La relación es más o menos la de LM Studio con llama.cpp, salvo que las dos mitades son nuestras.

01 Caché de prefijosLas partes repetidas de una conversación se calculan una vez y se reutilizan, así que un hilo largo no se vuelve más lento. capa 1
02 Caché KV paginadaTodos los chats abiertos siguen en memoria — cambiar entre ellos no descarta nada. capa 2
03 Cuantización de cachéq4/q8 reduce la memoria de caché en vivo entre 4 y 8 veces, que es lo que permite contextos muy largos. Los prefijos guardados mantienen la precisión completa. capa 3
04 Batching continuoHasta 256 secuencias simultáneas sobre un único modelo cargado, de modo que varios agentes pueden compartirlo. capa 4
05 Caché persistente en discoEl cálculo del prompt sobrevive a un reinicio de la app — vuelves a un arranque en caliente, no en frío. capa 5
Tiempo hasta el primer token — M3 Ultra 256 GB · Llama 3.2 3B 4-bit · frente a LM Studio
ContextoMLX StudioLM StudioDiferencia
2.5K tokensPrompt corto0.05 s0.49 s9.7×
10K tokensContexto de trabajo0.08 s6.12 s76×
100K tokensProcesado de prompt en frío0.65 s131 s224×

Medido en un M3 Ultra con 256 GB, Llama 3.2 3B a 4 bits, frente a LM Studio. Las dos primeras filas son tiempo hasta el primer token; la última es procesado de prompt en frío. El rendimiento de decodificación es otra medida distinta, que depende de la longitud del contexto y de lo predecible que sea la salida, por eso no se resume en una sola cifra.

────────────────────────────────────────────────────────────────────────────────────────────────────────
05

Qué aspecto tiene

Pantallas de la app funcionando en Apple Silicon.

Chat e imágenes
Chat e imágenes — los selectores de modelos de generación y edición, cada uno con sus pasos y su huella de memoria.
Modelos — buscar y descargar
Modelos — buscar en Hugging Face y descargar modelos MLX en segundo plano.
Servidores y API — pasarela
Servidores y API — una pasarela única ante cada modelo cargado, hablando OpenAI, Anthropic y Ollama.
────────────────────────────────────────────────────────────────────────────────────────────────────────
06

Consíguela

Descarga la app, o instala solo el motor si lo único que quieres es el servidor.

la apprecomendado
# descarga, arrastra a Aplicaciones y abre
# chat, herramientas, imágenes, conversor y
# el servidor de API, todo en uno
el motorpip
$ pip install vmlx
$ vmlx serve mlx-community/Qwen3-8B-4bit
# compatible con OpenAI + Anthropic en
# http://127.0.0.1:8000
────────────────────────────────────────────────────────────────────────────────────────────────────────
07

Preguntas

¿Qué es MLX Studio?
Una app gratuita de macOS para chat con IA y programación agéntica, que ejecuta modelos localmente en Apple Silicon. Incluye más de 20 herramientas integradas para editar archivos, buscar en código, ejecutar comandos y buscar en la web, además de generación y edición de imágenes, un conversor de modelos y un servidor de API, todo movido por el motor vMLX.
¿En qué se diferencia MLX Studio del motor vMLX?
MLX Studio es la app — la interfaz de chat, las herramientas agénticas, el explorador de modelos y los ajustes. vMLX es el backend de inferencia que la mueve: caché, batching, carga de modelos y la capa de API. Más o menos la relación que tiene LM Studio con llama.cpp, salvo que ambas mitades son el mismo proyecto. El motor es de código abierto y se instala por separado con pip install vmlx.
¿Necesita conexión a internet?
Solo para descargar los modelos la primera vez. Toda la inferencia es local, sin conexión a la nube, sin claves de API y sin que los datos salgan de tu Mac.
¿Qué Mac necesito?
Cualquier Mac con Apple Silicon — M1 o posterior — con macOS 14.5 o más reciente. 8 GB de memoria unificada es el mínimo; 16 GB o más va holgado. Conectar con endpoints remotos funciona desde macOS 14.
¿Puedo usar también APIs en la nube?
Sí. Puedes conectar con OpenAI, Anthropic, Groq o cualquier endpoint compatible con OpenAI. Las herramientas agénticas funcionan igual tanto si el modelo es local como remoto.
¿Cuánto cuesta?
Nada. Gratis para siempre, sin suscripción, sin cuenta y sin versión de pago.