LAION publica un enorme dataset de vídeo abierto con 10 millones de horas de grabaciones para entrenar modelos de IA
La organización sin ánimo de lucro LAION ha publicado Big Video Dataset, una colección de 80 millones de vídeos etiquetados automáticamente que supera en rendimiento al conjunto de datos de referencia usado hasta ahora por los investigadores.
LAION ha publicado Big Video Dataset, un conjunto de datos abierto con 80 millones de vídeos (unas 10 millones de horas) y 55 millones de clips con descripciones automáticas. Los modelos entrenados con este dataset superan en rendimiento al anterior de referencia, InternVid, en hasta 2,1 puntos porcentuales.

LAION (una organización sin ánimo de lucro alemana que recopila conjuntos de datos masivos para investigación en inteligencia artificial) acaba de publicar Big Video Dataset (BVD), uno de los mayores datasets de vídeo abiertos disponibles para entrenar modelos de IA. La colección incluye 80 millones de vídeos, que suman unas 10 millones de horas de grabación, de los cuales 55 millones están acompañados de descripciones generadas automáticamente. Todos los datos están disponibles de forma pública y gratuita para investigadores.
Los modelos entrenados con BVD superan en hasta 2,1 puntos porcentuales al benchmark (conjunto de datos de referencia usado para comparar el rendimiento de modelos) anterior más utilizado, llamado InternVid. Según LAION, esto convierte a BVD en el nuevo estándar de facto para desarrolladores que quieran entrenar modelos capaces de entender o generar vídeo, como sistemas de búsqueda visual o herramientas de edición automática.
La publicación del dataset llega en un momento delicado, cuando los tribunales europeos están decidiendo hasta qué punto se puede usar contenido protegido por derechos de autor para entrenar IA. LAION apunta a una sentencia de 2024 del tribunal de Hamburgo que permitió recopilar material con copyright para investigación no comercial. Esta interpretación legal, sin embargo, no está cerrada: varias editoriales y titulares de derechos siguen impugnando este tipo de prácticas en otros países.
LAION saltó a la fama por datasets anteriores como LAION-5B, una colección de 5.000 millones de pares de imágenes y texto que se usó para entrenar modelos de generación de imagen como Stable Diffusion (un sistema que crea imágenes a partir de descripciones textuales). La organización defiende que sus conjuntos de datos aceleran la investigación abierta y evitan que solo las grandes empresas con recursos para recopilar datos propios puedan desarrollar modelos avanzados.


