En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

IBM crea un test para medir si la IA puede migrar código empresarial antiguo

ScarfBench evalúa si los agentes de IA pueden actualizar aplicaciones Java heredadas, una tarea que las empresas pagan millones por hacer manualmente.

Por Redacción2 min
Compartir
IBM crea un test para medir si la IA puede migrar código empresarial antiguo
Investigación · Hugging Face Blog

IBM Research ha publicado ScarfBench, un banco de pruebas (un conjunto estandarizado de ejercicios para comparar el rendimiento de sistemas de IA) diseñado para evaluar si los agentes de inteligencia artificial pueden migrar código empresarial antiguo a frameworks modernos. El desafío concreto: transformar aplicaciones Java escritas con tecnologías obsoletas como Java EE (una plataforma para construir aplicaciones empresariales que ha quedado en desuso) hacia su sucesor moderno, Jakarta EE, según informó Hugging Face en su blog oficial.

La migración de código heredado (software antiguo que todavía está en uso pero que se construyó con tecnologías ya retiradas) es uno de los mayores dolores de cabeza de las empresas. Miles de aplicaciones críticas siguen corriendo sobre Java EE, un estándar que Oracle dejó de mantener en 2017, y actualizarlas manualmente consume meses de trabajo y presupuestos millonarios. IBM desarrolló ScarfBench precisamente para comprobar si los modelos de lenguaje grandes (LLM, sistemas de IA capaces de generar y entender código) pueden automatizar este proceso de forma fiable.

El benchmark incluye 57 aplicaciones Java reales con distintos grados de complejidad, desde proyectos pequeños hasta sistemas con decenas de miles de líneas de código. Cada aplicación debe pasar por cambios específicos: renombrar paquetes (carpetas lógicas donde se organiza el código), actualizar dependencias (librerías externas que usa el programa) y modificar archivos de configuración. IBM probó varios modelos actuales —entre ellos GPT-4o de OpenAI y modelos propios como Granite— y descubrió que ninguno consigue una tasa de éxito superior al 50% sin ayuda humana.

El problema principal no es que los LLM no entiendan Java, sino que las migraciones empresariales requieren decisiones contextuales que los modelos actuales no pueden tomar de forma autónoma: saber qué librerías son compatibles entre sí, detectar dependencias ocultas o entender reglas de negocio implícitas en el código. IBM plantea ScarfBench como un reto abierto para la comunidad investigadora, con todos los datos y scripts de evaluación disponibles en Hugging Face, para que otros equipos puedan medir el progreso de sus propios agentes de IA en esta tarea.

Aunque los resultados actuales son modestos, IBM considera que este tipo de benchmarks específicos de dominio (tests enfocados en problemas reales de la industria, no en ejercicios académicos genéricos) son necesarios para llevar los agentes de IA más allá de las demos y convertirlos en herramientas productivas. La empresa ya usa versiones internas de estos sistemas para acelerar sus propios proyectos de modernización de software, pero reconoce que falta camino antes de que puedan operar sin supervisión constante.

Fuente original
Hugging Face Blog
Más en · Investigación