---
title: "Google lanza comprensión agéntica de video en Gemini: hasta 88% menos tokens y 66% menos costo"
description: "Gemini ahora decide qué parte de un video mirar en lugar de procesarlo entero a una tasa fija de cuadros. Google reporta hasta 88% menos consumo de tokens, hasta 66% menos costo y hasta 7% más precisión, sin cargo adicional sobre el precio estándar de la API."
slug: "google-gemini-video-agentico-88-por-ciento-menos-tokens-66-menos-costo-26-09-03"
canonical: "https://www.revenuehublatam.com/noticias/ia-ventas/google-gemini-video-agentico-88-por-ciento-menos-tokens-66-menos-costo-26-09-03"
language: "es"
section: "Noticias"
category: "IA en Ventas"
published: "2026-09-03T10:35:00+00:00"
updated: "2026-09-03T10:35:00+00:00"
tags: ["Gemini", "Google", "video", "costos de IA", "agentes"]
keywords: ["Gemini video agéntico", "Gemini 3.7 Flash", "costo análisis de video IA", "comprensión agéntica de video", "IA para ventas Chile", "inteligencia de conversaciones Latinoamérica", "API Gemini precios"]
source_name: "Google (The Keyword)"
source_url: "https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/"
publisher: "Revenue Hub Latam"
publisher_url: "https://www.revenuehublatam.com"
---

# Google lanza comprensión agéntica de video en Gemini: hasta 88% menos tokens y 66% menos costo

> Google lanzó el 1 de septiembre de 2026 la comprensión agéntica de video en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. En lugar de ingerir el video completo a una tasa fija de cuadros por segundo, el modelo decide activamente qué segmentos mirar, a qué velocidad y por qué modalidad: cuadros, audio o transcripción. Google reporta hasta 88% menos consumo de tokens, hasta 66% menos costo de análisis y hasta 7% más precisión en benchmarks estándar. Se activa poniendo el procesamiento en "agentic" en la API y no tiene cargo adicional sobre el precio estándar por tokens de Gemini.

Google anunció el 1 de septiembre de 2026 el lanzamiento de la **comprensión agéntica de video** en sus modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. La función ya está disponible para videos subidos y videos de YouTube a través de la API de Gemini en Google AI Studio y en Gemini Enterprise Agent Platform.

El cambio técnico es concreto. Hasta ahora el procesamiento era estático: el modelo consumía el video a una tasa fija de cuadros por segundo, por defecto 1 FPS, y el desarrollador tenía que elegir entre pagar muchos tokens o aplicar técnicas que descartaban detalles críticos. Con el modo agéntico, Gemini combina su razonamiento con herramientas nativas de video para buscar, escanear e inspeccionar segmentos específicos, y solo carga los momentos y señales que necesita.

## ¿Cuánto ahorra realmente en costo y tokens?

Según Google, en benchmarks estándar de análisis de video los modelos Gemini con comprensión agéntica **reducen el costo del análisis hasta 66% y el consumo de tokens hasta 88%, mientras mejoran la precisión hasta 7%**. Las ganancias de eficiencia son más pronunciadas en video largo: desde guías de diez minutos hasta clases de noventa minutos y grabaciones de varias horas.

Google señala que Gemini 3.7 Flash con comprensión agéntica ofrece la mejor combinación de calidad y eficiencia de costo, ubicándose en la frontera de Pareto entre precisión y costo por consulta frente a los modelos evaluados.

## ¿Qué casos de uso habilita?

-   **Recuperación de momentos por debajo del segundo**: identifica cambios de estado y cortes que se pierden a 1 FPS, lo que hace viable la edición automatizada de video.
-   **Búsqueda de aguja en un pajar en video largo**: responde consultas complejas sobre grabaciones de varias horas sin consumir millones de tokens.
-   **Detección de anomalías**: vuelve a muestrear ventanas de tiempo interesantes a mayor FPS para inspeccionar movimiento rápido y artefactos visuales sutiles.
-   **Conteo de acciones y objetos**: sigue movimientos repetidos y objetos distintos a lo largo del tiempo con más exactitud.

## ¿Cómo se activa y cuánto cuesta?

Se habilita configurando el parámetro de procesamiento en **"agentic"** dentro de la llamada a la API. Google confirma que usa el precio estándar por tokens de Gemini, **sin tarifa adicional por la funcionalidad**. La compañía también anunció que llevará estas mejoras a la aplicación Gemini para todos los usuarios en los modelos Flash y Flash-Lite, y que en los próximos meses la función alimentará «Ask YouTube» en la página de reproducción.

## ¿Por qué importa esto en Chile y Latinoamérica?

Los equipos comerciales de Chile y Latinoamérica ya generan volúmenes enormes de video sin explotar: grabaciones de llamadas de venta, demos, sesiones de onboarding, capacitaciones internas y entrevistas con clientes. El bloqueador nunca fue la capacidad técnica de analizarlas, sino el costo por hora de video procesada, que en presupuestos regionales medidos en dólares se vuelve prohibitivo rápido. Un recorte de hasta 66% en el costo de análisis cambia esa aritmética.

## Análisis de Revenue Hub

Para un líder comercial en Chile o Latinoamérica, la noticia relevante no es el benchmark sino el cambio en el umbral de viabilidad. Muchos proyectos de inteligencia de conversaciones (analizar qué objeciones aparecen en las llamadas perdidas, qué preguntas repiten los clientes en onboarding, qué demos correlacionan con cierre) se descartaron en los últimos dos años porque el caso de negocio no cerraba al precio anterior por hora de video. Con una reducción de hasta dos tercios en el costo, vale la pena volver a correr ese cálculo con números actualizados antes de asumir que sigue siendo caro.

La decisión concreta que esto habilita es más acotada de lo que parece: no se trata de analizar todo el archivo histórico de grabaciones, sino de elegir una pregunta comercial específica con dueño y consecuencia. Por ejemplo, qué señales aparecen en las llamadas de negocios que se estancan entre propuesta y cierre. Ese tipo de pregunta se responde con decenas de horas de video, no con miles, y el output se conecta directo al CRM como una propiedad accionable. La trampa habitual es al revés: proyectos de análisis masivo que producen dashboards que nadie usa para decidir nada.

El riesgo a vigilar es la dependencia de proveedor. Estas ganancias de eficiencia vienen atadas a la API de un modelo específico, y el ritmo de lanzamientos de Google (tres releases Flash en seis semanas) implica que la arquitectura de tu integración debe poder cambiar de modelo sin rehacer el pipeline. Si vas a construir sobre esto, aísla la capa de inferencia detrás de una interfaz propia y guarda los resultados estructurados en tu CRM, no en el proveedor. Puedes revisar nuestro trabajo relacionado en [noticias de IA en ventas](/noticias/ia-ventas) y en el [blog de Revenue Hub](/blog).

## Preguntas frecuentes

### ¿Qué es la comprensión agéntica de video en Gemini?

Es una función lanzada por Google el 1 de septiembre de 2026 que permite a Gemini decidir activamente qué segmentos de un video analizar, a qué velocidad de cuadros y por qué modalidad (cuadros, audio o transcripción), en lugar de procesar el video completo a una tasa fija.

### ¿Cuánto reduce el costo de analizar video con Gemini?

Google reporta una reducción de hasta 66% en el costo de análisis y hasta 88% en el consumo de tokens en benchmarks estándar, además de una mejora de hasta 7% en precisión.

### ¿En qué modelos de Gemini está disponible?

Está disponible en Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite, a través de la API de Gemini en Google AI Studio y en Gemini Enterprise Agent Platform.

### ¿Tiene un costo adicional activar el modo agéntico?

No. Google confirma que usa el precio estándar por tokens de Gemini, sin tarifa adicional por la funcionalidad. Se activa configurando el procesamiento en "agentic" en la llamada a la API.

### ¿Sirve para analizar grabaciones de llamadas de venta?

Sí. Los casos de uso que Google describe (búsqueda de momentos específicos en video largo, detección de anomalías y conteo de acciones) aplican directamente a grabaciones de llamadas comerciales, demos y sesiones de onboarding, que suelen durar entre treinta y noventa minutos.

### ¿Qué modelo conviene si busco el mejor balance entre calidad y costo?

Según Google, Gemini 3.7 Flash con comprensión agéntica ofrece la mejor calidad general y la mejor combinación de calidad y eficiencia de costo, ubicándose en la frontera de Pareto entre precisión y costo por consulta.

### ¿Cómo afecta esto a los equipos comerciales en Chile y Latinoamérica?

Baja el umbral de viabilidad de los proyectos de inteligencia de conversaciones. Iniciativas que se descartaron por costo en presupuestos regionales medidos en dólares vuelven a ser evaluables con la nueva estructura de precio por hora de video procesada.

### ¿Llegará esta función a la aplicación Gemini y a YouTube?

Google anunció que la función se desplegará a todos los usuarios de la aplicación Gemini en los modelos Flash y Flash-Lite, y que en los próximos meses alimentará la función «Ask YouTube» en la página de reproducción de video.

---

Fuente original: [Google (The Keyword)](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/) (blog.google)
