Hugging Face lanza una herramienta gratuita para que cualquiera evalúe los riesgos de un modelo de IA
RiskRubric.ai permite analizar posibles sesgos, brechas de seguridad y comportamientos problemáticos en modelos de lenguaje sin necesidad de conocimientos técnicos avanzados.
RiskRubric.ai es una herramienta web gratuita de Hugging Face (plataforma de modelos de IA) que permite evaluar riesgos de seguridad, sesgos y toxicidad en modelos de lenguaje grandes (LLM, la tecnología detrás de ChatGPT). Antes estas evaluaciones requerían equipos especializados; ahora cualquiera puede hacerlas introduciendo el nombre del modelo.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha presentado RiskRubric.ai, una herramienta web gratuita que permite a cualquier persona evaluar los riesgos de seguridad y ética de un modelo de lenguaje grande (LLM, el tipo de inteligencia artificial que hay detrás de ChatGPT o Claude). Hasta ahora, este tipo de evaluaciones solían requerir infraestructura costosa, equipos especializados y acceso a conjuntos de datos privados; con RiskRubric, basta con introducir el nombre del modelo en la web para obtener un informe detallado sobre sus posibles problemas.
La herramienta analiza aspectos como sesgos (si el modelo reproduce estereotipos raciales, de género o de otro tipo), tendencia a generar contenido tóxico, vulnerabilidades a ataques de jailbreak (técnicas para saltarse sus filtros de seguridad) y capacidad para seguir instrucciones de forma fiable. Según informó Hugging Face en su blog oficial, RiskRubric.ai se apoya en más de una docena de benchmarks (conjuntos de pruebas estandarizadas) públicos y de código abierto, y genera un informe en formato PDF que cualquier persona puede entender, aunque no tenga formación técnica.
El proyecto nace como respuesta a una necesidad práctica: mientras grandes empresas como OpenAI o Google cuentan con equipos enteros dedicados a evaluar la seguridad de sus modelos antes de lanzarlos, las organizaciones más pequeñas, equipos de investigación académica o gobiernos que quieren desplegar IA de forma responsable suelen carecer de recursos para hacerlo. RiskRubric democratiza ese proceso al ofrecer evaluaciones gratuitas, reproducibles y basadas en estándares abiertos que cualquiera puede auditar.
La herramienta está diseñada para complementar, no sustituir, evaluaciones más profundas. Hugging Face aclara que un buen resultado en RiskRubric no garantiza que un modelo sea completamente seguro para cualquier uso, pero sí ofrece una primera capa de transparencia que antes no existía. Además, al estar construida sobre infraestructura de código abierto, permite a otros desarrolladores replicar o mejorar las pruebas, algo fundamental para que la comunidad científica pueda contrastar resultados y detectar fallos que una sola empresa no vería.
RiskRubric.ai ya está disponible y permite evaluar modelos alojados en Hugging Face Hub (el repositorio público de la plataforma). La compañía ha anunciado que irá ampliando los tipos de evaluaciones y añadiendo soporte para modelos multimodales (aquellos que trabajan con texto, imágenes y otros formatos a la vez) en próximas versiones.


