Imagine Video 1.5 de xAI ahora acepta referencias de imagen y de voz
xAI actualizó Imagine Video 1.5 con referencias de imagen y de voz, generación de video a partir de un prompt de texto y 1080p nativo. Permite hasta siete imágenes de referencia por generación para fijar cara, producto o locación.

La noticia en 30 segundos
xAI actualizó el 31 de julio de 2026 su modelo Imagine Video 1.5 con tres capacidades nuevas: referencias de imagen y de voz para mantener la misma cara y la misma voz en todas las escenas, generación de video solo a partir de un prompt de texto, y resolución 1080p nativa. Se pueden usar hasta siete imágenes de referencia por generación para fijar un rostro, un producto o una locación. Las referencias de imagen y voz parten en Estados Unidos para SuperGrok Heavy y SuperGrok Plus, y el modelo grok-imagine-video-1.5 está disponible en la API de xAI.
xAI publicó el 31 de julio de 2026 una actualización de Imagine Video 1.5, su modelo de generación de video. La empresa lo resume en una línea: «nuestro mejor modelo de video, ahora con referencias de texto, imagen y voz, generando hasta 1080p».
El modelo se había lanzado el mes anterior con mejoras en movimiento, física y audio. Esta entrega suma tres cosas concretas: referencias de imagen y de voz, video a partir de un prompt de texto sin imagen inicial, y 1080p nativo.
¿Qué resuelven las referencias de imagen y de voz?
El problema clásico de los modelos de video generativo es la consistencia entre escenas: el mismo personaje cambia de cara, la voz cambia de timbre, el producto se deforma. xAI ataca eso de forma directa. Al pasar una imagen de personaje junto con una referencia de voz, el rostro y la voz se mantienen iguales en todas las escenas.
El sistema de multi-referencia extiende la idea: cada imagen de referencia fija un elemento, sea una cara, un producto o una locación. Se puede mantener el personaje y cambiar la escena, mantener la escena y cambiar el personaje, o fijar ambos y cambiar solo la acción. El límite es de hasta siete referencias por generación.
¿Qué significa el 1080p nativo y el texto a video?
Con texto a video ya no se necesita una imagen de partida: basta describir la toma. xAI explica que la función combina su generación de imágenes con la conversión de imagen a video. El 1080p nativo quedó soportado tanto para texto a video como para imagen a video.
Ambas funciones están en disponibilidad general en grok.com/imagine, iOS y Android. Las referencias de imagen y de voz, en cambio, parten en Estados Unidos para suscriptores SuperGrok Heavy y SuperGrok Plus, con despliegue progresivo al resto de los niveles.
¿Cómo se accede desde la API?
Las referencias de imagen, el texto a video y el 1080p nativo están activos en la API de xAI bajo el modelo grok-imagine-video-1.5. La generación admite parámetros de duración, relación de aspecto y resolución, y recibe las imágenes de referencia como una lista de URLs. El soporte de referencia de voz en la API se entrega a pedido a través del equipo comercial de xAI.
¿Por qué le importa esto a un equipo comercial en Chile y Latinoamérica?
La consistencia de personaje y voz es exactamente lo que separa una demo llamativa de un activo de marketing usable. Un video donde el vocero cambia de cara entre escenas no sirve para una campaña. Uno donde el mismo rostro, la misma voz y el mismo producto se sostienen a lo largo de varias tomas sí entra en el terreno de la producción de contenido comercial: piezas de producto, testimoniales guionados, contenido para redes y anuncios en video.
Para equipos en Chile y Latinoamérica, donde el presupuesto de producción audiovisual suele ser el primero en recortarse, esa diferencia tiene efecto directo en cuántas variantes creativas puede probar un equipo por trimestre.
Análisis de Revenue Hub
La lectura de negocio de esta actualización no es «xAI mejoró su modelo de video». Es que el costo marginal de producir una variante creativa adicional en video sigue bajando, y con referencias de personaje y voz ya no baja a costa de la coherencia de marca. Eso cambia la economía del testing creativo: donde antes un equipo probaba dos o tres piezas por campaña, la restricción pasa a ser la capacidad de medir, no la de producir.
El riesgo, y conviene decirlo sin suavizar, es el mismo que trae toda caída de costo de producción: volumen sin criterio. Más piezas no mejoran resultados si no hay una hipótesis por variante y una lectura limpia de qué mueve conversión. El patrón que ya se ve en varios equipos es acumular decenas de assets generados sin trazabilidad de cuál produjo qué, y terminar sin poder responder qué funcionó.
La decisión práctica para un líder de marketing o comercial es sencilla de enunciar y difícil de sostener: antes de escalar producción, dejar amarrada la instrumentación. Un naming consistente de creatividades, una convención de UTM por variante y atribución conectada al CRM. Con eso, este tipo de herramientas multiplica aprendizaje. Sin eso, multiplica archivos. Cubrimos estos movimientos en nuestra sección de IA en ventas y en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a xAI.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es Imagine Video 1.5 de xAI?
Es el modelo de generación de video de xAI. En su actualización del 31 de julio de 2026 sumó referencias de imagen y de voz, generación de video a partir de un prompt de texto y resolución 1080p nativa.
¿Cuántas imágenes de referencia se pueden usar por generación?
Hasta siete. Cada imagen de referencia fija un elemento distinto, por ejemplo un rostro, un producto o una locación, y se pueden combinar para mantener personaje y cambiar escena o al revés.
¿Cómo mantiene la misma voz en todas las escenas?
Se pasa una imagen del personaje junto con una referencia de voz. Con ambas entradas, el modelo mantiene el mismo rostro y el mismo timbre a lo largo de las escenas generadas.
¿Quién puede usar hoy las referencias de imagen y de voz?
Parten en Estados Unidos para suscriptores SuperGrok Heavy y SuperGrok Plus en grok.com/imagine y en iOS, con despliegue progresivo al resto de los niveles en los días siguientes.
¿Está disponible en la API de xAI?
Sí. Las referencias de imagen, el texto a video y el 1080p nativo están activos en la API bajo el modelo grok-imagine-video-1.5. El soporte de referencia de voz se entrega a pedido a través del equipo comercial de xAI.
¿Qué es el texto a video y en qué se diferencia de imagen a video?
Texto a video genera la pieza describiendo la toma, sin necesidad de una imagen de partida, combinando la generación de imágenes de xAI con la conversión de imagen a video. Imagen a video parte de una imagen existente.
¿Para qué sirve esto en marketing B2B en Chile y Latinoamérica?
La consistencia de personaje, voz y producto entre escenas permite usar video generativo en piezas de producto, testimoniales guionados y anuncios, ampliando cuántas variantes creativas puede probar un equipo por trimestre sin aumentar el presupuesto de producción.
¿Qué conviene tener listo antes de escalar producción de video con IA?
Instrumentación. Un naming consistente de creatividades, una convención de UTM por variante y atribución conectada al CRM, para poder responder qué pieza movió conversión en lugar de acumular archivos sin trazabilidad.



