En directo
[Herramientas]Hugging Face ficha al creador de oMLX para reforzar la IA local en dispositivos Apple[Herramientas]Google lanza Fairwind, un programa exclusivo para que gobiernos corrijan vulnerabilidades con IA[Modelos de IA]Google lanza Gemini 3.8 Flash, su modelo más rápido para programar y detectar vulnerabilidades[Modelos de IA]Gemini ahora analiza vídeos de forma 'agéntica' y reduce costes hasta un 66%[Herramientas]El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA[Negocios]NVIDIA, Google y Emerald AI crean una alianza para que los centros de datos de IA consuman electricidad de forma flexible[Investigación]La Universidad de Manchester predice la contaminación del aire en todo el Reino Unido con modelos de IA climática de NVIDIA[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Hugging Face ficha al creador de oMLX para reforzar la IA local en dispositivos Apple[Herramientas]Google lanza Fairwind, un programa exclusivo para que gobiernos corrijan vulnerabilidades con IA[Modelos de IA]Google lanza Gemini 3.8 Flash, su modelo más rápido para programar y detectar vulnerabilidades[Modelos de IA]Gemini ahora analiza vídeos de forma 'agéntica' y reduce costes hasta un 66%[Herramientas]El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA[Negocios]NVIDIA, Google y Emerald AI crean una alianza para que los centros de datos de IA consuman electricidad de forma flexible[Investigación]La Universidad de Manchester predice la contaminación del aire en todo el Reino Unido con modelos de IA climática de NVIDIA[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAGoogle DeepMind Blog2 min

Gemini ahora analiza vídeos de forma 'agéntica' y reduce costes hasta un 66%

Google DeepMind presenta una nueva capacidad en sus modelos Gemini que permite analizar vídeos de forma inteligente, consumiendo hasta un 88% menos de tokens y mejorando la precisión en un 7%.

Por Redacción2 min
En resumen

Google DeepMind lanzó comprensión de vídeo agéntica para Gemini 3.7, 3.6 y 3.5 Flash-Lite. En lugar de procesar cada fotograma a velocidad fija, el modelo decide qué partes inspeccionar (imagen, audio o transcripción), reduciendo consumo de tokens hasta 88%, costes hasta 66% y mejorando precisión 7%. Disponible hoy vía API.

Compartir
Gemini ahora analiza vídeos de forma 'agéntica' y reduce costes hasta un 66%
Modelos de IA · Google DeepMind Blog

Google DeepMind ha lanzado una nueva función llamada "comprensión de vídeo agéntica" para sus modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, según anunció la compañía en su blog oficial. Esta capacidad permite que el modelo analice vídeos de forma mucho más eficiente: en lugar de procesar cada fotograma a una velocidad fija (como hacía hasta ahora), Gemini ahora decide de forma autónoma qué partes del vídeo inspeccionar, a qué velocidad y a través de qué modalidad —imagen, audio o transcripción—, cargando solo los momentos y señales que necesita para responder a la consulta del usuario.

Los resultados son especialmente llamativos en vídeos largos. En las pruebas internas de Google, la función redujo el consumo de tokens (las unidades en que se mide el coste de procesar información con modelos de IA) hasta un 88% y los costes de análisis hasta un 66%, mientras mejoraba la precisión en un 7%. Esto es relevante porque, hasta ahora, analizar vídeos extensos —desde tutoriales de 10 minutos hasta conferencias de 90 minutos o grabaciones de varias horas— obligaba a los desarrolladores a elegir entre pagar mucho o perder detalles importantes al reducir la calidad del procesamiento.

La mejora no es solo de eficiencia. La capacidad agéntica desbloquea nuevas aplicaciones prácticas: permite recuperar momentos específicos con precisión de fracciones de segundo (útil para edición automática de vídeo), buscar información concreta en vídeos de varias horas sin consumir millones de tokens, detectar anomalías visuales reprocesando segmentos de interés a mayor velocidad de fotogramas, y contar objetos o acciones repetidas a lo largo del tiempo con mayor exactitud. Google compara esta función con la "visión agéntica" que ya ofrecía para imágenes: en ambos casos, el modelo combina su capacidad nativa de entender contenido visual con herramientas de código que le permiten inspeccionar de forma selectiva.

La función está disponible desde hoy a través de la API de Gemini (la interfaz que permite a desarrolladores integrar el modelo en sus aplicaciones) en Google AI Studio y la plataforma Gemini Enterprise Agent. Se activa simplemente configurando el parámetro "processing" como "agentic" en la llamada a la API, y usa el mismo precio estándar por token que Gemini, sin coste adicional por la nueva capacidad. Google también planea llevar estas mejoras a productos de consumo: se implementará pronto en la aplicación de Gemini para miles de millones de usuarios, y en los próximos meses potenciará la función "Ask YouTube" (Pregunta a YouTube), que permite hacer consultas sobre el contenido de los vídeos directamente en la página de reproducción.

Según testimonios de socios que probaron la función antes del lanzamiento público, empresas como Sora Union (plataforma de vídeo generado por IA), Pika Labs (herramienta de creación de vídeo con IA) y ElevenLabs (síntesis de voz) reportaron mejoras significativas en velocidad, calidad de análisis y reducción de costes. Google posiciona a Gemini 3.7 Flash con comprensión de vídeo agéntica como el modelo con mejor relación calidad-coste del mercado para análisis de vídeo, según sus propias pruebas comparativas.

Más en · Modelos de IA