Meta libera Muse Glimmer: un modelo agéntico abierto de 30B que corre en una sola GPU de consumo
Meta Superintelligence Labs publicó los pesos de Muse Glimmer bajo licencia Apache 2.0. Son 30 mil millones de parámetros optimizados para agentes que caben en una GPU de 24 GB o en un Mac, sin llamadas a la nube.

La noticia en 30 segundos
Meta liberó Muse Glimmer, un modelo agéntico de 30 mil millones de parámetros con licencia Apache 2.0. Comprimido a unos 4 bits ocupa menos de 20 GB y corre en una GPU de 24 GB o en un Mac M4/M5 Max, sin conexión a internet. Está optimizado para trabajo de agentes: llamada a funciones con esquemas precisos, razonamiento multipaso, recuperación ante errores y lectura de imágenes. Para empresas en Chile y Latinoamérica habilita agentes on-premise sin costo por token y con datos que nunca salen del perímetro.
Meta Superintelligence Labs anunció el 10 de agosto de 2026 la liberación de Muse Glimmer, un modelo multimodal de 30 mil millones de parámetros destilado desde Muse Spark, con pesos abiertos bajo licencia Apache 2.0. La apuesta no es competir en la frontera: es que un agente completo corra dentro del equipo del usuario, sin red.
¿Qué es exactamente Muse Glimmer?
Es un transformer causal denso con un codificador de percepción visual dedicado de aproximadamente 1.800 millones de parámetros. Acepta texto e imágenes de entrada y entrega texto. La ventana de contexto supera los 131.000 tokens y el corte de conocimiento es el 4 de enero de 2026. No procesa audio, y el video lo trata como fotogramas individuales.
Meta lo entrenó en tres fases: pre-entrenamiento por destilación de logits sobre las salidas de Muse Spark, mid-training con datos de contexto largo y trazas de razonamiento más ricas, y post-entrenamiento que combinó ajuste supervisado, destilación on-policy y aprendizaje por refuerzo en dominios generales, de razonamiento, de código y agénticos.
Las capacidades declaradas apuntan todas al mismo lugar: ejecución de tareas de punta a punta, uso confiable de herramientas, razonamiento de múltiples pasos, recuperación ante fallas (cuando una llamada a herramienta falla, el modelo diagnostica y reintenta en lugar de detenerse), entrada multimodal para leer capturas de pantalla y documentos, y compatibilidad con scaffolds como OpenClaw. Está entrenado en más de 100 idiomas.
¿Cómo logra Meta meter 30B en una GPU de consumo?
A precisión completa el modelo necesitaría más de 55 GB de memoria, muy por encima de cualquier GPU de consumo. Meta comprime los pesos a aproximadamente 4 bits y deja el modelo de lenguaje por debajo de 20 GB, con espacio suficiente para la caché KV, el codificador visual y el drafter dentro de un presupuesto de 24 o 32 GB.
Se publican dos versiones cuantizadas: K-Quant-Dynamic, orientada a 32 GB de VRAM con 0,2% de degradación promedio, y K-Quant-17GB, orientada a 24 GB con 1,0%. La velocidad llega por decodificación especulativa: un drafter liviano basado en DFlash predice bloques de 16 tokens de una vez y el modelo principal los verifica en paralelo. En una RTX 5090 el rendimiento sube de 74,9 a 233,4 tokens por segundo, un aumento de 3,1 veces. En un Mac M5 Max pasa de 26,6 a 50,2 y en un M4 Max de 23,7 a 37,8.
¿Qué dicen los benchmarks frente a Gemma4 y Qwen3.6?
Meta compara Muse Glimmer contra Gemma4-31B y Qwen3.6-27B en modo de razonamiento. Lidera en MCP Atlas con 75,5 frente a 54,2 y 62,5, en DeepSearch QA con 74,6, en Gaia2 con 43,3 y en SWE-Bench Pro con 51,2. En razonamiento marca 94,7 en AIME 2026 y 77,0 en IFBench.
El patrón también tiene su reverso, y conviene decirlo: Qwen3.6-27B sigue adelante en OSWorld-Verified (75,6 contra 65,9), en TerminalBench 2.1 (60,7) y en SWE-Bench Verified (77,2). Traducido: Muse Glimmer gana en orquestación agéntica y razonamiento, y pierde en uso de computador y trabajo de terminal.
Los pesos están disponibles en Hugging Face con formatos BF16, k-quants GGUF, builds de ExecuTorch y el drafter DFlash. Meta anunció integraciones con llama.cpp, MLX, Ollama, LM Studio, vLLM y SGLang, y trabajo conjunto con AMD, Arm, Dell, Intel y NVIDIA.
¿Por qué importa en Chile y Latinoamérica?
Porque cambia la ecuación de costos y de residencia de datos para un mercado donde el presupuesto de IA se mide en dólares y el tipo de cambio no perdona. Un agente que corre en un notebook o en un servidor propio elimina el costo por token y la dependencia de latencia transcontinental, dos fricciones concretas para equipos comerciales en Chile, Perú, Colombia o México.
El segundo punto es regulatorio y contractual. En sectores como salud, servicios financieros, legal y sector público, la conversación con el área de riesgo suele frenarse en la misma pregunta: dónde queda el dato. Un modelo abierto y ejecutable dentro del perímetro corporativo convierte esa objeción en un problema de infraestructura, no en un veto.
Análisis de Revenue Hub
Para un líder comercial B2B en Latinoamérica, la noticia relevante no es el benchmark: es que apareció una opción de agente sin factura variable. Hasta ahora, escalar agentes de ventas, de servicio o de operaciones significaba aceptar un costo que crece con el uso y un proveedor que puede cambiar precios sin aviso. Un modelo abierto de 30B que corre en hardware que ya tienes convierte ese gasto operacional en una inversión de capital acotada.
La decisión que esto abre no es «migramos todo a local». Es más quirúrgica: identificar qué cargas de trabajo agénticas son de alto volumen y baja complejidad (clasificación de leads, enriquecimiento de registros, resúmenes de llamadas, extracción de datos de documentos) y evaluarlas contra un modelo local, dejando los casos de frontera en la nube. Ese corte suele mover más margen que cualquier negociación de licencia.
El riesgo también es real y conviene nombrarlo: un modelo abierto no trae gobernanza incluida. Meta mismo recomienda agregar controles a nivel de sistema en lugar de exponer el modelo como endpoint desnudo, y su tasa de éxito de ataque en Siren AgentDojo es 28,4. Sin trazabilidad, permisos y auditoría, un agente local es simplemente un riesgo que no aparece en tu factura. Si estás evaluando dónde ubicar agentes dentro de tu operación comercial, revisa nuestra cobertura de IA aplicada a ventas y los análisis de arquitectura de datos en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a MarkTechPost.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es Muse Glimmer de Meta?
Es un modelo de lenguaje multimodal de 30 mil millones de parámetros publicado por Meta Superintelligence Labs el 10 de agosto de 2026, con pesos abiertos bajo licencia Apache 2.0 y optimizado para flujos de trabajo de agentes que corren de forma local.
¿Cuánta memoria necesita Muse Glimmer para funcionar?
A precisión completa requeriría más de 55 GB. Cuantizado a aproximadamente 4 bits, el modelo de lenguaje baja de 20 GB y funciona dentro de un presupuesto de 24 o 32 GB de VRAM, lo que permite correrlo en una sola GPU de consumo o en un Mac M4 Max o M5 Max.
¿Muse Glimmer es gratis para uso comercial?
Los pesos se publicaron bajo licencia Apache 2.0, que es permisiva y permite uso comercial, modificación y redistribución. El costo real no es de licencia sino de infraestructura: hardware, operación y gobernanza del despliegue.
¿Muse Glimmer vs Qwen3.6-27B: cuál conviene?
Según las comparaciones publicadas por Meta, Muse Glimmer lidera en tareas agénticas y de razonamiento como MCP Atlas (75,5), DeepSearch QA (74,6) y SWE-Bench Pro (51,2). Qwen3.6-27B se mantiene adelante en uso de computador con OSWorld-Verified (75,6), TerminalBench 2.1 (60,7) y SWE-Bench Verified (77,2). La elección depende de si tu caso es orquestación de herramientas o control de escritorio y terminal.
¿Qué ventaja tiene correr un modelo de IA localmente en una empresa de Chile o Latinoamérica?
Tres ventajas concretas: elimina el costo variable por token, quita la dependencia de latencia y disponibilidad de servicios en el extranjero, y permite que los datos sensibles nunca salgan del perímetro corporativo, lo que simplifica la conversación con áreas de riesgo y cumplimiento.
¿Dónde se descarga Muse Glimmer?
Los pesos están en Hugging Face en formatos BF16, k-quants GGUF y builds de ExecuTorch, junto con el drafter DFlash. Meta anunció soporte progresivo en llama.cpp, MLX, ExecuTorch, Ollama, LM Studio, vLLM y SGLang, además de acceso vía Together AI, Fireworks AI y OpenRouter.
¿Qué tan rápido responde Muse Glimmer en hardware de consumo?
Con la versión K-Quant-17GB y el drafter DFlash, Meta midió 233,4 tokens por segundo en una RTX 5090 (3,1 veces más rápido que sin decodificación especulativa), 50,2 en un Mac M5 Max y 37,8 en un M4 Max.
¿Es seguro desplegar un modelo abierto como agente en producción?
No de forma automática. Meta recomienda agregar salvaguardas a nivel de sistema en lugar de exponer el modelo como endpoint sin controles, y reporta una tasa de éxito de ataque de 28,4 en el benchmark Siren AgentDojo. Un despliegue responsable exige permisos acotados, trazabilidad de acciones y auditoría.



