Ir al contenido
IA para hoy
Herramientas y productos Producto

Google lanza comprensión agéntica de vídeo para modelos Gemini Flash

Imagen: Google DeepMind

Hecho Qué ha ocurrido

Google DeepMind lanzó la comprensión agéntica de vídeo para Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. La función permite al modelo escanear dinámicamente segmentos de vídeo, reduciendo el consumo de tokens hasta un 88% y los costes hasta un 66%, mientras mejora la precisión hasta un 7%. Está disponible en Google AI Studio y Gemini Enterprise Agent Platform mediante configuración de API, sin coste adicional sobre el precio estándar de tokens.

Resumen generado mediante IA a partir de Google DeepMind (original en inglés). Naturaleza de la información: declaración de parte interesada.

Análisis Por qué importa

Reduce significativamente los costes de procesar vídeos largos, lo que puede desbloquear casos de uso empresariales antes inviables económicamente, como análisis de grabaciones extensas o vigilancia por vídeo.

Quién se ve afectado
Desarrolladores y empresas que usan la API de Gemini para análisis de vídeo, incluyendo sectores de contenido, formación, seguridad y atención al cliente.
Qué puede cambiar
Los equipos técnicos podrán procesar vídeos largos (de 10 a 90+ minutos) con mucho menor coste y mejor precisión sin necesidad de desarrollar lógica manual de muestreo de fotogramas.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Vigilar la adopción real en productos como YouTube 'Ask YouTube' y el despliegue en la app de Gemini para usuarios finales, así como si otros proveedores de modelos multimodales replican este enfoque agéntico.

Recomendación Qué debería hacer una empresa

Los equipos de desarrollo que procesen vídeo largo vía Gemini deberían probar la configuración 'agentic' en los próximos 3 meses para evaluar ahorro de costes y mejoras de precisión en sus casos de uso.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Fuente original: Google DeepMind (fuente primaria). La referencia es siempre el artículo original.

Ver fuente original ↗

multimodalvídeoagentes AI StudioGeminiGoogle DeepMindvídeoYouTube

Relacionadas

Gemini Spark de Google ya puede gestionar bibliotecas de Google Photos

Google anunció que su agente personal Gemini Spark puede ejecutar tareas en Google Photos, como editar imágenes, curar álbumes, crear álbumes compartidos…

Por qué importaEs un ejemplo más de cómo las grandes tecnológicas integran agentes de IA en servicios de consumo masivo, buscando justificar el valor de las…

Impacto muy bajo Fiabilidad una fuente fiable TechCrunch AI