En directo
[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónOpenAI News2 min

OpenAI lanza GeneBench-Pro, un test para medir si la IA entiende de biología

La compañía presenta un nuevo sistema de evaluación que pone a prueba la capacidad de los modelos de lenguaje para resolver problemas reales de genética y biología molecular, usando datos del mundo científico en lugar de preguntas de examen.

Por Redacción2 min
En resumen

GeneBench-Pro es un sistema de evaluación que OpenAI acaba de presentar para medir cómo se desempeñan los modelos de lenguaje (LLM, sistemas de IA que entienden y generan texto) en tareas reales de genómica y biología molecular, usando datos de investigaciones científicas en lugar de preguntas teóricas de examen.

Compartir
OpenAI lanza GeneBench-Pro, un test para medir si la IA entiende de biología
Investigación · OpenAI News

OpenAI ha presentado GeneBench-Pro, un banco de pruebas (benchmark, un conjunto de ejercicios estandarizados que permite comparar el rendimiento de distintos modelos) diseñado para evaluar cómo se desenvuelven los sistemas de inteligencia artificial en tareas de genómica (el estudio de los genomas, es decir, el conjunto completo de ADN de un organismo) y biología. A diferencia de otros tests que usan preguntas teóricas o ejercicios simplificados, este nuevo sistema emplea conjuntos de datos complejos extraídos de investigaciones científicas reales.

Según informó OpenAI en su blog oficial, GeneBench-Pro incluye problemas que requieren interpretar secuencias de ADN, predecir funciones de proteínas y analizar patrones en datos experimentales, tareas habituales en laboratorios de biología molecular pero que hasta ahora no tenían un estándar claro para medir el rendimiento de la IA. La intención es ofrecer a los desarrolladores una forma fiable de saber si sus modelos de lenguaje (LLM, sistemas de IA entrenados para entender y generar texto, como GPT o Claude) pueden realmente ayudar a biólogos y genetistas, y no solo aprobar exámenes académicos.

La compañía no ha detallado aún qué modelos ha probado con el benchmark ni qué puntuaciones han obtenido, pero el anuncio llega en un momento en que varias empresas tecnológicas están compitiendo por demostrar que sus sistemas pueden acelerar el descubrimiento de fármacos, identificar mutaciones genéticas o diseñar proteínas sintéticas. OpenAI ya había incursionado en este terreno con colaboraciones en medicina y bioquímica, aunque hasta ahora no existía un método público y estandarizado para comparar avances.

GeneBench-Pro estará disponible para investigadores y empresas que quieran evaluar sus propios modelos. La iniciativa responde a una demanda creciente en la comunidad científica, que ha advertido que muchos resultados espectaculares de IA en biología se basan en datos de laboratorio simplificados o en problemas que no reflejan la complejidad del trabajo real. Con este nuevo sistema, OpenAI busca establecer un estándar más riguroso y acercar la inteligencia artificial a aplicaciones prácticas en ciencias de la vida.

Fuente original
OpenAI News
Más en · Investigación