En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Los modelos de IA más nuevos siguen siendo igual de fáciles de hackear

Una investigación demuestra que las últimas versiones de GPT-4, Claude y Llama son tan vulnerables a ataques de jailbreak como sus predecesores.

Por Redacción2 min
Compartir
Los modelos de IA más nuevos siguen siendo igual de fáciles de hackear
Investigación · Hugging Face Blog

Cada vez que OpenAI, Anthropic o Meta lanzan una versión actualizada de sus modelos de inteligencia artificial, prometen que han mejorado la seguridad y reforzado las barreras que impiden que alguien les haga decir cosas peligrosas o inapropiadas. Pero según un estudio reciente de Dharma AI publicado en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), esas mejoras no están funcionando como se esperaba.

Los investigadores probaron técnicas de jailbreak (métodos para saltarse las restricciones de seguridad de un modelo y conseguir que genere contenido que normalmente rechazaría) en las versiones más recientes de GPT-4, Claude 3.7 Sonnet y Llama 3.3, entre otros. El resultado: los modelos nuevos fueron igual de fáciles de engañar que sus versiones anteriores. En algunos casos, la tasa de éxito de los ataques fue prácticamente idéntica entre generaciones, lo que sugiere que los sistemas de seguridad actuales no logran adaptarse a las tácticas que los atacantes ya conocen.

El problema, según el estudio, no es que las empresas no intenten proteger sus modelos, sino que las defensas que implementan —como filtros de contenido o ajustes de instrucciones— no son lo suficientemente robustas. Los atacantes utilizan métodos cada vez más sofisticados, como manipular el contexto de las preguntas o diseñar prompts (las instrucciones que se le dan al modelo) de forma que parezcan inofensivas pero terminen generando respuestas problemáticas. Y esos métodos siguen funcionando incluso después de que los modelos hayan sido actualizados.

Esto tiene implicaciones prácticas importantes. Empresas y gobiernos están integrando estos LLM (siglas de Large Language Model, los modelos de lenguaje grandes como GPT o Claude) en aplicaciones críticas, desde atención al cliente hasta sistemas de moderación de contenido. Si esos modelos pueden ser manipulados con relativa facilidad, el riesgo de que generen información falsa, contenido dañino o instrucciones peligrosas sigue presente, incluso en las versiones más recientes.

El equipo de Dharma AI, que se dedica a investigar la seguridad en sistemas de inteligencia artificial, argumenta que la industria necesita un cambio de enfoque: en lugar de limitarse a parchear vulnerabilidades conocidas, habría que diseñar sistemas que sean intrínsecamente más difíciles de manipular. Eso incluye mejores técnicas de alineación (el proceso de entrenar un modelo para que sus respuestas reflejen valores humanos y normas de seguridad) y, potencialmente, arquitecturas completamente nuevas que no dependan solo de filtros aplicados después del entrenamiento.

Fuente original
Hugging Face Blog
Más en · Investigación