En directo
[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónThe Decoder1 min

LAION publica un enorme dataset de vídeo abierto con 10 millones de horas de grabaciones para entrenar modelos de IA

La organización sin ánimo de lucro LAION ha publicado Big Video Dataset, una colección de 80 millones de vídeos etiquetados automáticamente que supera en rendimiento al conjunto de datos de referencia usado hasta ahora por los investigadores.

Por Redacción1 min
En resumen

LAION ha publicado Big Video Dataset, un conjunto de datos abierto con 80 millones de vídeos (unas 10 millones de horas) y 55 millones de clips con descripciones automáticas. Los modelos entrenados con este dataset superan en rendimiento al anterior de referencia, InternVid, en hasta 2,1 puntos porcentuales.

Compartir
LAION publica un enorme dataset de vídeo abierto con 10 millones de horas de grabaciones para entrenar modelos de IA
Investigación · The Decoder

LAION (una organización sin ánimo de lucro alemana que recopila conjuntos de datos masivos para investigación en inteligencia artificial) acaba de publicar Big Video Dataset (BVD), uno de los mayores datasets de vídeo abiertos disponibles para entrenar modelos de IA. La colección incluye 80 millones de vídeos, que suman unas 10 millones de horas de grabación, de los cuales 55 millones están acompañados de descripciones generadas automáticamente. Todos los datos están disponibles de forma pública y gratuita para investigadores.

Los modelos entrenados con BVD superan en hasta 2,1 puntos porcentuales al benchmark (conjunto de datos de referencia usado para comparar el rendimiento de modelos) anterior más utilizado, llamado InternVid. Según LAION, esto convierte a BVD en el nuevo estándar de facto para desarrolladores que quieran entrenar modelos capaces de entender o generar vídeo, como sistemas de búsqueda visual o herramientas de edición automática.

La publicación del dataset llega en un momento delicado, cuando los tribunales europeos están decidiendo hasta qué punto se puede usar contenido protegido por derechos de autor para entrenar IA. LAION apunta a una sentencia de 2024 del tribunal de Hamburgo que permitió recopilar material con copyright para investigación no comercial. Esta interpretación legal, sin embargo, no está cerrada: varias editoriales y titulares de derechos siguen impugnando este tipo de prácticas en otros países.

LAION saltó a la fama por datasets anteriores como LAION-5B, una colección de 5.000 millones de pares de imágenes y texto que se usó para entrenar modelos de generación de imagen como Stable Diffusion (un sistema que crea imágenes a partir de descripciones textuales). La organización defiende que sus conjuntos de datos aceleran la investigación abierta y evitan que solo las grandes empresas con recursos para recopilar datos propios puedan desarrollar modelos avanzados.

Fuente original
The Decoder
Más en · Investigación