Google introdujo la comprensión agéntica de vídeo para Gemini el 1 de septiembre y afirmó que reduce los costes de análisis hasta en un 66% y el consumo de tokens hasta en un 88%, al tiempo que mejora la precisión hasta en un 7%. Se activa estableciendo el procesamiento en agentic en la configuración de la API, con la tarificación estándar de tokens de Gemini API y sin tarifa adicional por la función.

Lo que la formulación habitual interpreta mal

Una reducción del 88% en tokens parece un avance de compresión dentro del modelo. No lo es. El modo agéntico permite a Gemini elegir qué momentos recuperar, a qué tasa de fotogramas y si usar fotogramas, audio o transcripción, en lugar del antiguo muestreo de fotogramas a tasa fija. El modelo está viendo menos del vídeo. Es una capacidad real y útil, pero está limitada por el propio criterio del modelo sobre lo que puede omitirse: en una tarea en la que la evidencia relevante está repartida de forma dispersa a lo largo de toda la duración, no hay nada que omitir y el ahorro se desploma.

La diferencia entre dos de las cifras

Nótese que el ahorro de costes (66%) es materialmente menor que el ahorro de tokens (88%). La diferencia es el propio bucle agéntico — decidir qué mirar también consume tokens. Las tres cifras son “hasta”, así que marcan techos y no expectativas.

Dónde se ejecuta realmente

El segundo error de enfoque es la distribución. Esto se lanzó solo en la línea Flash — Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite — y solo a través de la Gemini API en Google AI Studio y la Gemini Enterprise Agent Platform. La app de Gemini lo recibirá “pronto” y “Ask YouTube” de YouTube en “los próximos meses”. La mayor parte de la cobertura ilustró el lanzamiento con la app para consumidores, que no lo tiene.

Por qué la decisión sobre el precio es la señal

Google afirma que Gemini 3.7 Flash “logra la frontera de Pareto entre precisión y coste entre los modelos probados” y no cobra nada extra por este modo. El vídeo ha sido el formato en el que el contexto largo dejó de importar, porque una tasa fija de fotogramas hace que el coste escale con la duración y no con el contenido informativo. Romper esa relación y además renunciar a cobrarla por separado es una apuesta para convertir el análisis de vídeo largo en una carga de trabajo ordinaria y no en una especializada.