En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

ServiceNow lanza AprielGuard, un sistema de protección para modelos de lenguaje que bloquea ataques y contenido peligroso

El filtro de seguridad detecta instrucciones ocultas maliciosas y respuestas tóxicas en tiempo real, funcionando con cualquier modelo de IA conversacional.

Por Redacción2 min
Compartir
ServiceNow lanza AprielGuard, un sistema de protección para modelos de lenguaje que bloquea ataques y contenido peligroso
Herramientas · Hugging Face Blog

ServiceNow (una empresa estadounidense de software empresarial) ha publicado AprielGuard, un sistema gratuito diseñado para proteger aplicaciones basadas en modelos de lenguaje grandes o LLM (los sistemas de inteligencia artificial que procesan y generan texto, como ChatGPT o Claude). El modelo actúa como un filtro de seguridad que revisa tanto las preguntas de los usuarios como las respuestas generadas por la IA, bloqueando contenido tóxico, instrucciones ocultas maliciosas y salidas no deseadas antes de que lleguen al usuario final.

AprielGuard funciona como una capa adicional de seguridad para aplicaciones ya existentes. Puede integrarse con cualquier modelo de lenguaje —sean de código abierto o privativos (modelos comerciales cuyo funcionamiento interno no se publica, como GPT-4)— y se ejecuta en paralelo, analizando cada conversación. Según explica la propia compañía en el anuncio publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), el sistema está especialmente pensado para empresas que despliegan chatbots internos, asistentes virtuales o herramientas de atención al cliente basadas en IA, donde un fallo de seguridad puede exponer datos sensibles o generar respuestas problemáticas.

El modelo detecta dos tipos principales de amenazas. Por un lado, identifica prompt injection (ataques donde alguien inserta instrucciones ocultas en su pregunta para manipular el comportamiento del sistema, por ejemplo pidiendo acceso a información restringida). Por otro, bloquea respuestas que contengan lenguaje ofensivo, información personal, sesgos evidentes o datos que el modelo no debería compartir. AprielGuard clasifica cada entrada y salida en categorías de riesgo, permitiendo a los desarrolladores configurar qué nivel de filtrado aplicar según el contexto de uso.

ServiceNow no ha revelado detalles técnicos sobre el entrenamiento del modelo, pero sí ha publicado el código y los pesos del sistema (los parámetros que definen cómo funciona el modelo, esenciales para poder usarlo o modificarlo) bajo licencia abierta. Esto permite a otras empresas implementarlo sin coste, adaptarlo a sus propias necesidades o auditarlo para verificar su comportamiento. El modelo está disponible para descarga directa desde Hugging Face y puede ejecutarse en servidores propios, lo que evita enviar datos de usuarios a servicios externos.

La publicación de AprielGuard coincide con una creciente preocupación en la industria por los riesgos de seguridad en sistemas de IA generativa. Empresas como Google, OpenAI y Anthropic han tenido que reforzar sus propios filtros tras casos documentados de manipulación de modelos mediante instrucciones maliciosas. ServiceNow, que ofrece herramientas de automatización empresarial usadas por miles de compañías en todo el mundo, apuesta ahora por ofrecer esta tecnología de forma pública como parte de su estrategia en inteligencia artificial para entornos corporativos.

Fuente original
Hugging Face Blog
Más en · Herramientas