Microsoft lleva MAI-Image-2.6 a Foundry y suma MAI-Image-2.6-Flash para producción
Microsoft abrió su modelo de imagen MAI-Image-2.6 a desarrolladores en Microsoft Foundry y lanzó una variante Flash que genera imágenes 2.8 veces más rápido que GPT-Image-2-Medium, con 72% más de eficiencia.

La noticia en 30 segundos
Microsoft anunció el 4 de septiembre de 2026 que su modelo de imagen MAI-Image-2.6 llega a los desarrolladores en Microsoft Foundry, en vista previa pública, y que se suma MAI-Image-2.6-Flash, una variante pensada para cargas de producción con alta demanda y baja latencia. Flash genera imágenes 2.8 veces más rápido que GPT-Image-2-Medium con 72% más de eficiencia. Ambos modelos soportan edición con múltiples imágenes de referencia, anclaje en información de la web y proporciones dinámicas hasta 1.5K de resolución.
Microsoft AI publicó el 4 de septiembre de 2026 la disponibilidad de MAI-Image-2.6 en Microsoft Foundry, en vista previa pública para desarrolladores, junto con el lanzamiento de MAI-Image-2.6-Flash, una variante construida para cargas de producción sensibles a la latencia y de alto volumen.
El movimiento cierra el ciclo del modelo: MAI-Image-2.6 se presentó en agosto con su debut en el segundo lugar del ranking Arena, y ahora pasa de demostración a herramienta que un equipo puede integrar en su propio producto o flujo de trabajo.
¿Qué diferencia hay entre MAI-Image-2.6 y la versión Flash?
Según Microsoft, la elección es entre precisión máxima y velocidad de producción. MAI-Image-2.6 mantiene el foco en calidad: la compañía informa que está en el puesto número 2 de texto a imagen y número 2 de edición de imágenes en Arena, y número 2 de texto a imagen y número 1 de edición en Artificial Analysis, ambos datos al 4 de septiembre de 2026.
MAI-Image-2.6-Flash apunta al otro extremo. Microsoft afirma que genera imágenes 2.8 veces más rápido que GPT-Image-2-Medium con 72% más de eficiencia, manteniendo una calidad comparable. La compañía sostiene que la combinación de calidad y eficiencia de la familia entrega «el mejor rendimiento de precio por Elo del mundo».
¿Qué capacidades nuevas trae la familia de modelos?
Ambos modelos comparten tres funciones que Microsoft describe como respuesta directa a cómo la gente estaba usando las versiones anteriores:
- Edición con múltiples referencias. Permite combinar personas, productos, estilos y escenas provenientes de distintas imágenes en una sola composición.
- Anclaje en la web. El modelo trae información actualizada desde internet para generar visuales informados por contexto real y vigente, no solo por lo aprendido en el entrenamiento.
- Resoluciones más altas y proporciones dinámicas. El modelo elige el formato óptimo para la composición, con soporte hasta 1.5K de resolución.
Los dos modelos se pueden probar en MAI Playground y construir sobre ellos en vista previa pública a través de Microsoft Foundry.
¿Por qué le importa esto a un equipo comercial en Chile y Latinoamérica?
Porque el cuello de botella de la producción de contenido visual en un equipo B2B rara vez es la calidad de un render aislado: es el costo unitario y el tiempo cuando hay que generar cientos de variantes. Un modelo que corre 2.8 veces más rápido con 72% más de eficiencia cambia la ecuación de campañas con creatividades segmentadas por industria, por país o por etapa del funnel.
La función de anclaje en la web también tiene un uso comercial concreto: generar visuales que incorporen información actual sin que alguien tenga que investigarla y describirla manualmente en el prompt. Para equipos de marketing pequeños en Latinoamérica, que suelen ser dos o tres personas cubriendo varios mercados, eso es capacidad real, no una demo.
Análisis de Revenue Hub
La noticia real aquí no es el ranking de Arena, es que Microsoft está empujando el precio hacia abajo en la capa de generación de imagen mientras la calidad se estanca en un empate técnico entre los principales modelos. Cuando varias opciones producen resultados equivalentes, la decisión deja de ser «cuál es el mejor modelo» y pasa a ser «cuál es el más barato de operar dentro de la nube donde ya estoy». Para una empresa que ya vive en Azure, eso es una respuesta bastante corta.
La consecuencia para un líder comercial es menos glamorosa de lo que suena: si el costo de producir una creatividad se derrumba, el diferencial deja de estar en el activo y pasa a estar en el criterio. Quién decide qué segmento merece su propia pieza, con qué mensaje, y quién mide si eso movió la conversión. Hemos visto equipos multiplicar por diez el volumen de creatividades y no mover la tasa de conversión ni un punto, porque nadie estaba conectando la pieza al dato de qué funciona.
La recomendación es simple: antes de escalar el volumen, cierra el circuito de medición. Si no puedes atribuir resultado por variante creativa, generar más variantes solo te da más ruido más rápido. Revisamos el resto de los movimientos de modelos y precios en nuestra sección de IA aplicada a ventas.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a Microsoft AI.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es MAI-Image-2.6-Flash?
Es la variante rápida del modelo de imagen de Microsoft, diseñada para cargas de producción de alto volumen y sensibles a la latencia. Microsoft informa que genera imágenes 2.8 veces más rápido que GPT-Image-2-Medium con 72% más de eficiencia.
¿Dónde puedo usar MAI-Image-2.6?
Se puede probar en MAI Playground y construir sobre el modelo en vista previa pública a través de Microsoft Foundry, el catálogo de modelos de Microsoft para desarrolladores.
¿MAI-Image-2.6 es mejor que GPT-Image o los modelos de Google?
Microsoft reporta que al 4 de septiembre de 2026 MAI-Image-2.6 está en el puesto número 2 de texto a imagen y número 2 de edición en Arena, y número 2 de texto a imagen y número 1 de edición en Artificial Analysis. Son rankings comparativos, no una superioridad absoluta en todos los casos de uso.
¿Qué es la edición con múltiples referencias?
Es la capacidad de combinar personas, productos, estilos y escenas provenientes de imágenes distintas en una sola composición, en lugar de generar todo desde un prompt de texto.
¿Qué significa el anclaje en la web en un modelo de imagen?
Significa que el modelo puede traer información actualizada desde internet para generar visuales informados por contexto vigente, sin que la persona tenga que describir ese contexto en el prompt.
¿Qué resolución máxima soportan estos modelos?
Microsoft indica soporte de resoluciones más altas y proporciones dinámicas, con hasta 1.5K de resolución, eligiendo el formato óptimo para cada composición.
¿Cómo aprovecha esto un equipo de marketing B2B en Latinoamérica?
El caso de uso más directo es producir muchas variantes de una misma creatividad segmentadas por industria, país o etapa del funnel, algo que antes era prohibitivo por costo y tiempo para equipos de dos o tres personas.
¿Conviene escalar el volumen de creatividades apenas baja el costo?
No sin medición. Si no se puede atribuir resultado por variante creativa, más volumen solo genera más ruido. Conviene cerrar el circuito de medición antes de multiplicar la producción.




¿Cómo se vive esto en tu equipo?
Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.
Cargando comentarios…