En directo
[Negocios]Generalist, la startup de robots con IA, alcanza una valoración de 3.000 millones de dólares[Herramientas]Cuatro millones de modelos de IA escaneados en busca de vulnerabilidades[Negocios]OpenAI pierde a otro alto cargo: se va el responsable de sus centros de datos[Regulación]OpenAI desactiva cuentas rusas que usaban IA para difundir propaganda pro-Kremlin[Negocios]OpenAI explica cómo reduce los costes de su IA mientras mejora su rendimiento[Investigación]Co-Scientist, la IA de Google que ya diseña experimentos y redacta artículos científicos[Negocios]Una antigua fundición de aluminio en Kentucky será el próximo gran centro de datos de Anthropic[Negocios]La inteligencia artificial ahorra tres horas de trabajo a la semana, pero solo a la mitad de los empleados[Investigación]Una IA de OpenAI ayuda a diagnosticar 18 enfermedades raras infantiles que llevaban años sin identificar[Investigación]OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA[Negocios]Generalist, la startup de robots con IA, alcanza una valoración de 3.000 millones de dólares[Herramientas]Cuatro millones de modelos de IA escaneados en busca de vulnerabilidades[Negocios]OpenAI pierde a otro alto cargo: se va el responsable de sus centros de datos[Regulación]OpenAI desactiva cuentas rusas que usaban IA para difundir propaganda pro-Kremlin[Negocios]OpenAI explica cómo reduce los costes de su IA mientras mejora su rendimiento[Investigación]Co-Scientist, la IA de Google que ya diseña experimentos y redacta artículos científicos[Negocios]Una antigua fundición de aluminio en Kentucky será el próximo gran centro de datos de Anthropic[Negocios]La inteligencia artificial ahorra tres horas de trabajo a la semana, pero solo a la mitad de los empleados[Investigación]Una IA de OpenAI ayuda a diagnosticar 18 enfermedades raras infantiles que llevaban años sin identificar[Investigación]OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónThe Decoder2 min

Google quiere acabar con la trampa en los test de inteligencia artificial

La compañía ha probado por primera vez un sistema de evaluación donde ni los desarrolladores ven las preguntas del test ni los examinadores pueden acceder al modelo, usando criptografía para garantizar que nadie haga trampas.

Por Redacción2 min
En resumen

Google DeepMind ha probado por primera vez un sistema de evaluación doble ciego para modelos de inteligencia artificial, usando Confidential Space (una tecnología que protege datos con criptografía) para que ni Google vea las preguntas del test ni los evaluadores accedan a los pesos del modelo (los datos internos que definen su funcionamiento), evitando así manipulaciones en los resultados.

Compartir
Google quiere acabar con la trampa en los test de inteligencia artificial
Investigación · The Decoder

Google DeepMind (la división de inteligencia artificial de Google) acaba de probar un nuevo sistema de evaluación de modelos de IA que busca resolver un problema creciente: cómo estar seguros de que los resultados de los test son fiables cuando quien desarrolla el modelo es también quien lo evalúa. El proyecto piloto, realizado junto al Instituto de Seguridad en IA de Singapur, utiliza lo que se conoce como evaluación doble ciego: ni Google puede ver las preguntas del test ni los evaluadores pueden acceder a los pesos del modelo (los datos internos que definen cómo funciona el modelo y que son considerados secreto industrial).

La clave del sistema está en Confidential Space, una tecnología de Google Cloud que usa criptografía (técnicas matemáticas para proteger información) para crear un entorno aislado donde el modelo y las preguntas pueden interactuar sin que ninguna de las dos partes tenga acceso completo a lo que hace la otra. Es como poner a dos personas a trabajar en una habitación oscura donde solo pueden pasarse papeles, pero ninguna ve qué hay realmente en el escritorio de la otra.

El modelo usado en la prueba fue Gemini Flash Lite, una versión reducida del modelo de lenguaje de Google. Según informó The Decoder, citando fuentes de Google, el objetivo no era tanto evaluar ese modelo en concreto como demostrar que este tipo de evaluaciones es técnicamente posible y puede convertirse en un estándar de la industria.

El problema que intenta resolver Google no es trivial. En los últimos años ha habido casos documentados de empresas que entrenan sus modelos específicamente con las preguntas de los benchmarks más populares (los test estándar que se usan para medir el rendimiento de los modelos de IA), lo que infla artificialmente sus resultados. También existe la sospecha, aunque es más difícil de probar, de que algunas compañías podrían estar ajustando sus modelos después de ver las preguntas de evaluación. Un sistema doble ciego haría imposible este tipo de manipulaciones.

Si el enfoque de Google se adopta ampliamente, podría cambiar la forma en que se comparan los modelos de IA más avanzados, especialmente en áreas sensibles como la seguridad. El Instituto de Seguridad en IA de Singapur es precisamente una de las organizaciones públicas creadas para evaluar los riesgos de los modelos de frontera (los modelos más potentes y recientes, que están en la punta de lo que la tecnología permite). Para este tipo de evaluaciones, donde está en juego la confianza pública, un sistema a prueba de manipulaciones no es un lujo: es una necesidad.

Fuente original
The Decoder
Más en · Investigación