En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

ServiceNow lanza AprielGuard, un sistema de protección para modelos de lenguaje que bloquea ataques y contenido peligroso

El filtro de seguridad detecta instrucciones ocultas maliciosas y respuestas tóxicas en tiempo real, funcionando con cualquier modelo de IA conversacional.

Por Redacción2 min
Compartir
ServiceNow lanza AprielGuard, un sistema de protección para modelos de lenguaje que bloquea ataques y contenido peligroso
Herramientas · Hugging Face Blog

ServiceNow (una empresa estadounidense de software empresarial) ha publicado AprielGuard, un sistema gratuito diseñado para proteger aplicaciones basadas en modelos de lenguaje grandes o LLM (los sistemas de inteligencia artificial que procesan y generan texto, como ChatGPT o Claude). El modelo actúa como un filtro de seguridad que revisa tanto las preguntas de los usuarios como las respuestas generadas por la IA, bloqueando contenido tóxico, instrucciones ocultas maliciosas y salidas no deseadas antes de que lleguen al usuario final.

AprielGuard funciona como una capa adicional de seguridad para aplicaciones ya existentes. Puede integrarse con cualquier modelo de lenguaje —sean de código abierto o privativos (modelos comerciales cuyo funcionamiento interno no se publica, como GPT-4)— y se ejecuta en paralelo, analizando cada conversación. Según explica la propia compañía en el anuncio publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), el sistema está especialmente pensado para empresas que despliegan chatbots internos, asistentes virtuales o herramientas de atención al cliente basadas en IA, donde un fallo de seguridad puede exponer datos sensibles o generar respuestas problemáticas.

El modelo detecta dos tipos principales de amenazas. Por un lado, identifica prompt injection (ataques donde alguien inserta instrucciones ocultas en su pregunta para manipular el comportamiento del sistema, por ejemplo pidiendo acceso a información restringida). Por otro, bloquea respuestas que contengan lenguaje ofensivo, información personal, sesgos evidentes o datos que el modelo no debería compartir. AprielGuard clasifica cada entrada y salida en categorías de riesgo, permitiendo a los desarrolladores configurar qué nivel de filtrado aplicar según el contexto de uso.

ServiceNow no ha revelado detalles técnicos sobre el entrenamiento del modelo, pero sí ha publicado el código y los pesos del sistema (los parámetros que definen cómo funciona el modelo, esenciales para poder usarlo o modificarlo) bajo licencia abierta. Esto permite a otras empresas implementarlo sin coste, adaptarlo a sus propias necesidades o auditarlo para verificar su comportamiento. El modelo está disponible para descarga directa desde Hugging Face y puede ejecutarse en servidores propios, lo que evita enviar datos de usuarios a servicios externos.

La publicación de AprielGuard coincide con una creciente preocupación en la industria por los riesgos de seguridad en sistemas de IA generativa. Empresas como Google, OpenAI y Anthropic han tenido que reforzar sus propios filtros tras casos documentados de manipulación de modelos mediante instrucciones maliciosas. ServiceNow, que ofrece herramientas de automatización empresarial usadas por miles de compañías en todo el mundo, apuesta ahora por ofrecer esta tecnología de forma pública como parte de su estrategia en inteligencia artificial para entornos corporativos.

Fuente original
Hugging Face Blog
Más en · Herramientas