Google presenta Gemini 3.8 Live con Live Avatar: agentes de IA que hablan en video y en 97 idiomas
Google sumó a Gemini 3.8 Live un avatar en video de baja latencia que sincroniza labios y gestos mientras conversa. Llega primero a Gemini Enterprise y apunta a los agentes de atención y venta.

La noticia en 30 segundos
Google lanzó el 24 de septiembre de 2026 Gemini 3.8 Live con Live Avatar, una capacidad que le da a sus agentes conversacionales una presencia visual en video casi en tiempo real. El avatar genera video en streaming junto con la voz, sincroniza labios y expresiones faciales, respeta los turnos de la conversación y adapta el movimiento de la boca a 97 idiomas. También ejecuta herramientas en segundo plano, es decir, consulta datos sin cortar el diálogo. Está disponible en Gemini Enterprise y todo el video generado lleva marca de agua SynthID.
Google presentó el 24 de septiembre de 2026 Gemini 3.8 Live con Live Avatar, una evolución de su modelo conversacional en vivo que agrega una capa visual: el agente ya no solo responde con voz, sino que aparece como un rostro en video que habla, gesticula y sincroniza labios mientras conversa.
El anuncio apunta de lleno al segmento empresarial. Live Avatar llega primero a Gemini Enterprise, la línea con la que Google compite por los despliegues corporativos de agentes de IA, y no a la app de consumo.
¿Qué hace exactamente Live Avatar?
Según Google, la capacidad combina generación de video en streaming de baja latencia con diálogo nativo en vivo. Los elementos concretos que describe el anuncio son:
- Presencia visual casi en tiempo real, con video generado en paralelo a la voz.
- Sincronización labial precisa y expresiones faciales naturales durante la conversación.
- Turnos de habla fluidos, para que la interrupción y la respuesta se sientan como un diálogo humano y no como un sistema de preguntas y respuestas.
- Ejecución asíncrona de herramientas: el agente consulta datos o sistemas de fondo sin cortar la conversación.
- 97 idiomas con adaptación dinámica del movimiento de la boca a cada uno.
- Avatares personalizados a partir de imágenes de referencia, restringidos a clientes empresariales en lista de acceso, más una biblioteca de avatares predefinidos.
- Marca de agua SynthID en todo el contenido generado, para que el video sea detectable como producido por IA.
«Live Avatar lleva estas capacidades a los agentes empresariales. Al procesar entradas visuales y de audio de forma simultánea, genera conversaciones más ricas para una experiencia más completa», señala Google en su anuncio.
¿Por qué importa la ejecución asíncrona de herramientas?
Es el detalle menos vistoso y probablemente el más relevante para un equipo comercial. Un agente que debe consultar el CRM, el stock o el estado de un pedido normalmente deja un silencio incómodo mientras busca. Con ejecución en segundo plano, la conversación sigue mientras el dato llega. Esa diferencia es la que separa una demo de un agente que un cliente en Chile o en Latinoamérica tolera usar dos veces.
El soporte de 97 idiomas con sincronía labial adaptada tampoco es cosmético: define si un avatar puede atender en español neutro, en español rioplatense o en portugués sin que la imagen se sienta doblada. Para empresas latinoamericanas que operan en varios mercados, es la condición mínima para usar un único agente en toda la región.
¿Cómo queda el tablero frente a OpenAI y Anthropic?
La pelea por los agentes empresariales se venía jugando en tres frentes: calidad de razonamiento, costo por token y capacidad de conectarse a los sistemas del cliente. Live Avatar mueve la discusión a un cuarto frente, la interfaz. Google apuesta a que la presencia visual mejora la conversión en escenarios de atención, onboarding y venta asistida.
Es una apuesta razonable, pero todavía sin evidencia pública. El anuncio no incluye métricas de resolución, de satisfacción ni de conversión, ni precios específicos de la capacidad. Tampoco detalla el costo incremental de generar video frente a una conversación solo de voz, que es la pregunta que cualquier CFO va a hacer.
Análisis de Revenue Hub
Para un líder comercial B2B en Chile o Latinoamérica, la lectura correcta de este anuncio no es «necesito un avatar». Es que la capa de interfaz de los agentes se está encareciendo y diferenciando, y que el costo de mantenerse al día sube. Un avatar en video es caro de generar, caro de gobernar y fácil de convertir en un problema de marca si responde mal. La pregunta previa es si tu operación ya resuelve bien lo aburrido: datos limpios en el CRM, reglas de escalamiento claras y un agente de voz o texto que cierre casos sin intervención humana. Si eso no está, el avatar solo hace más visible el desorden.
Donde sí vemos un caso concreto es en onboarding y educación de clientes, no en prospección. Un agente con presencia visual que explique un producto complejo en el idioma del cliente reduce carga de Customer Success y escala sin sumar personas. Ese es un cálculo de margen medible, a diferencia del uso en ventas, donde el comprador B2B latinoamericano todavía castiga la sensación de estar hablando con una máquina disfrazada de persona.
La recomendación práctica: si vas a evaluarlo, hazlo como piloto acotado en un proceso de posventa con volumen alto y respuesta repetitiva, con una métrica dura definida antes de empezar, como tasa de resolución sin humano. No lo compres como iniciativa de innovación. Y exige transparencia frente al cliente sobre que está hablando con una IA, porque la marca de agua SynthID protege al ecosistema, no a tu reputación. Puedes seguir la cobertura de agentes aplicados a ventas en nuestra sección de IA en ventas y el análisis de fondo en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a Google.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es Gemini 3.8 Live con Live Avatar?
Es la versión del modelo conversacional en vivo de Google que agrega un avatar en video de baja latencia. El agente genera video en streaming junto con la voz, sincroniza labios y expresiones faciales y mantiene turnos de conversación naturales. Google lo anunció el 24 de septiembre de 2026.
¿Cuántos idiomas soporta Live Avatar?
97 idiomas, con adaptación dinámica de la sincronía labial a cada uno. Eso permite que un mismo agente atienda en español y portugués sin que el video se vea doblado, algo relevante para empresas que operan en varios mercados de Latinoamérica.
¿Dónde está disponible Gemini 3.8 Live con Live Avatar?
En Gemini Enterprise, la línea empresarial de Google, desde la fecha del anuncio. Los avatares personalizados creados a partir de imágenes de referencia están limitados a clientes empresariales en lista de acceso; el resto usa una biblioteca de avatares predefinidos.
¿Cuánto cuesta Live Avatar?
Google no publicó precios específicos para la capacidad en el anuncio. Tampoco detalló el costo incremental de generar video frente a una conversación solo de voz, que es el dato clave para evaluar el caso de negocio.
¿Gemini 3.8 Live vs ChatGPT para agentes de atención: cuál conviene?
Depende del criterio. Gemini 3.8 Live aporta hoy la capa visual en video y 97 idiomas con sincronía labial, mientras que la decisión de fondo sigue siendo calidad de razonamiento, costo por conversación y facilidad de conexión con tu CRM. Ninguno de los dos publicó métricas comparables de resolución, así que la comparación honesta se hace con un piloto propio.
¿Qué es la ejecución asíncrona de herramientas y por qué importa?
Permite que el agente consulte datos externos, como el CRM o el estado de un pedido, sin cortar la conversación. Elimina los silencios mientras busca información, que es una de las causas más comunes de abandono en agentes de atención.
¿El video generado se puede detectar como IA?
Sí. Google aplica marca de agua SynthID a todo el contenido generado, de modo que pueda identificarse como producido por inteligencia artificial. Eso no reemplaza la obligación de avisar al cliente que está hablando con un agente automatizado.
¿Qué caso de uso conviene probar primero en una empresa B2B de Chile o Latinoamérica?
Posventa y onboarding con volumen alto y respuestas repetitivas, antes que prospección. El caso de margen es medible por tasa de resolución sin intervención humana, mientras que en venta el comprador B2B todavía penaliza la sensación de hablar con una máquina que simula ser persona.




¿Cómo se vive esto en tu equipo?
Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.
Cargando comentarios…