En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Cómo crear un modelo de embeddings especializado en menos de un día

Nvidia y Hugging Face publican una guía paso a paso para que empresas adapten modelos de lenguaje a sus propios documentos técnicos sin necesidad de grandes recursos.

Por Redacción2 min
Compartir
Cómo crear un modelo de embeddings especializado en menos de un día
Herramientas · Hugging Face Blog

Nvidia y Hugging Face (la plataforma donde desarrolladores comparten modelos de inteligencia artificial) acaban de publicar una receta práctica para que empresas y desarrolladores entrenen sus propios modelos de embeddings especializados. Los embeddings son representaciones matemáticas de textos que permiten a sistemas de IA buscar información relevante o responder preguntas sobre documentos internos, manuales técnicos o bases de conocimiento corporativas. Según el tutorial publicado, todo el proceso puede completarse en menos de un día usando hardware relativamente asequible.

El método propuesto parte de modelos base preentrenados, como el NV-Embed-v2 (un modelo desarrollado por Nvidia y optimizado para tareas de recuperación de información), y los ajusta mediante fine-tuning (un proceso de reentrenamiento con datos específicos del sector o empresa) usando datos sintéticos generados automáticamente. En lugar de depender de enormes conjuntos de datos etiquetados a mano, la técnica aprovecha modelos de lenguaje grandes o LLM (sistemas como GPT capaces de generar texto de forma autónoma) para crear pares de preguntas y respuestas a partir de documentos reales. Esto reduce drásticamente el tiempo y coste de preparar datos de entrenamiento.

El tutorial incluye código abierto y notebooks ejecutables que cubren desde la generación de datos sintéticos hasta el ajuste del modelo en GPUs Nvidia (procesadores especializados en acelerar cálculos de inteligencia artificial), pasando por la evaluación de rendimiento en tareas de recuperación de información. Los autores demuestran que, con unos pocos miles de ejemplos generados automáticamente a partir de documentación técnica propia, un modelo base puede mejorar significativamente su precisión a la hora de encontrar información relevante en ese dominio específico.

La propuesta tiene especial interés para empresas que manejan documentación técnica compleja, como manuales de ingeniería, expedientes médicos o bases de datos legales, donde los modelos genéricos suelen fallar porque no conocen la terminología o contexto del sector. Según Hugging Face, este tipo de soluciones puede ejecutarse on-premise (en servidores propios de la empresa, sin enviar datos a la nube), lo que facilita cumplir con normativas de privacidad o confidencialidad.

El código y los modelos están disponibles bajo licencias abiertas en el repositorio de Hugging Face, y la guía incluye estimaciones de coste y tiempo de entrenamiento según el tamaño del conjunto de datos y el hardware disponible. Los autores señalan que el enfoque es escalable: con más datos o GPUs más potentes, el proceso puede adaptarse a necesidades empresariales de mayor envergadura sin cambiar la metodología básica.

Fuente original
Hugging Face Blog
Más en · Herramientas