ServiceNow lanza AprielGuard, un sistema de protección para modelos de lenguaje que bloquea ataques y contenido peligroso
El filtro de seguridad detecta instrucciones ocultas maliciosas y respuestas tóxicas en tiempo real, funcionando con cualquier modelo de IA conversacional.

ServiceNow (una empresa estadounidense de software empresarial) ha publicado AprielGuard, un sistema gratuito diseñado para proteger aplicaciones basadas en modelos de lenguaje grandes o LLM (los sistemas de inteligencia artificial que procesan y generan texto, como ChatGPT o Claude). El modelo actúa como un filtro de seguridad que revisa tanto las preguntas de los usuarios como las respuestas generadas por la IA, bloqueando contenido tóxico, instrucciones ocultas maliciosas y salidas no deseadas antes de que lleguen al usuario final.
AprielGuard funciona como una capa adicional de seguridad para aplicaciones ya existentes. Puede integrarse con cualquier modelo de lenguaje —sean de código abierto o privativos (modelos comerciales cuyo funcionamiento interno no se publica, como GPT-4)— y se ejecuta en paralelo, analizando cada conversación. Según explica la propia compañía en el anuncio publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), el sistema está especialmente pensado para empresas que despliegan chatbots internos, asistentes virtuales o herramientas de atención al cliente basadas en IA, donde un fallo de seguridad puede exponer datos sensibles o generar respuestas problemáticas.
El modelo detecta dos tipos principales de amenazas. Por un lado, identifica prompt injection (ataques donde alguien inserta instrucciones ocultas en su pregunta para manipular el comportamiento del sistema, por ejemplo pidiendo acceso a información restringida). Por otro, bloquea respuestas que contengan lenguaje ofensivo, información personal, sesgos evidentes o datos que el modelo no debería compartir. AprielGuard clasifica cada entrada y salida en categorías de riesgo, permitiendo a los desarrolladores configurar qué nivel de filtrado aplicar según el contexto de uso.
ServiceNow no ha revelado detalles técnicos sobre el entrenamiento del modelo, pero sí ha publicado el código y los pesos del sistema (los parámetros que definen cómo funciona el modelo, esenciales para poder usarlo o modificarlo) bajo licencia abierta. Esto permite a otras empresas implementarlo sin coste, adaptarlo a sus propias necesidades o auditarlo para verificar su comportamiento. El modelo está disponible para descarga directa desde Hugging Face y puede ejecutarse en servidores propios, lo que evita enviar datos de usuarios a servicios externos.
La publicación de AprielGuard coincide con una creciente preocupación en la industria por los riesgos de seguridad en sistemas de IA generativa. Empresas como Google, OpenAI y Anthropic han tenido que reforzar sus propios filtros tras casos documentados de manipulación de modelos mediante instrucciones maliciosas. ServiceNow, que ofrece herramientas de automatización empresarial usadas por miles de compañías en todo el mundo, apuesta ahora por ofrecer esta tecnología de forma pública como parte de su estrategia en inteligencia artificial para entornos corporativos.


