En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Hugging Face lanza TRL 1.0, su biblioteca para entrenar modelos de lenguaje de código abierto

La nueva versión facilita afinar y alinear LLMs localmente, con soporte para técnicas avanzadas y hardware desde GPUs de consumo hasta clusters de servidores.

Por Redacción2 min
Compartir
Hugging Face lanza TRL 1.0, su biblioteca para entrenar modelos de lenguaje de código abierto
Herramientas · Hugging Face Blog

Hugging Face (la plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado TRL 1.0, la primera versión estable de su biblioteca para entrenar y ajustar modelos de lenguaje. Según informó la compañía en su blog oficial, TRL (abreviatura de Transformer Reinforcement Learning, o aprendizaje por refuerzo para transformers) lleva tres años en desarrollo y ahora alcanza un nivel de madurez suficiente para producción, con más de 10 millones de descargas mensuales y uso en modelos destacados como Llama y Qwen.

La biblioteca permite aplicar técnicas de post-entrenamiento (el proceso de ajustar un modelo ya entrenado para tareas específicas o hacerlo más útil y seguro) sin necesidad de infraestructura propia en la nube. TRL 1.0 incluye métodos como SFT (Supervised Fine-Tuning, o ajuste supervisado con ejemplos etiquetados), DPO (Direct Preference Optimization, un sistema para alinear el modelo con preferencias humanas sin entrenar un modelo de recompensa aparte), PPO (Proximal Policy Optimization, un algoritmo de aprendizaje por refuerzo) y ORPO (Odds Ratio Preference Optimization, otra técnica reciente de alineación). También incorpora soporte para KTO, una variante que no requiere pares de respuestas comparadas.

Entre las novedades técnicas destacan la compatibilidad con entrenamiento distribuido mediante DeepSpeed y FSDP (estrategias para repartir el trabajo entre varias GPUs o servidores), integración nativa con Unsloth (una biblioteca que acelera el entrenamiento) y soporte experimental para modelos de difusión y visión-lenguaje. La biblioteca ahora permite entrenar modelos desde portátiles con GPU hasta clusters de cientos de procesadores, y cuenta con utilidades para evaluar modelos localmente usando jueces basados en LLMs (modelos de lenguaje que actúan como evaluadores automáticos de otros modelos).

Hugging Face también ha creado un roadmap público donde la comunidad puede votar qué funciones priorizar. Entre las más solicitadas figuran el soporte para modelos de audio, mejoras en el sistema de logging (registro de métricas durante el entrenamiento) y documentación ampliada. La empresa trabaja en una versión 1.1 que incluirá inferencia optimizada (ejecución rápida de modelos ya entrenados) mediante vLLM y SGLang, dos motores especializados en servir LLMs de forma eficiente.

Esta actualización refuerza la apuesta de Hugging Face por ofrecer herramientas de código abierto que compitan con plataformas cerradas de OpenAI o Anthropic, facilitando que investigadores y empresas entrenen sus propios modelos sin depender de APIs de pago. TRL 1.0 está disponible bajo licencia Apache 2.0 (una licencia de software libre permisiva) y puede instalarse vía pip, el gestor de paquetes de Python.

Fuente original
Hugging Face Blog
Más en · Herramientas