En directo
[Negocios]Generalist, la startup de robots con IA, alcanza una valoración de 3.000 millones de dólares[Herramientas]Cuatro millones de modelos de IA escaneados en busca de vulnerabilidades[Negocios]OpenAI pierde a otro alto cargo: se va el responsable de sus centros de datos[Regulación]OpenAI desactiva cuentas rusas que usaban IA para difundir propaganda pro-Kremlin[Negocios]OpenAI explica cómo reduce los costes de su IA mientras mejora su rendimiento[Investigación]Co-Scientist, la IA de Google que ya diseña experimentos y redacta artículos científicos[Negocios]Una antigua fundición de aluminio en Kentucky será el próximo gran centro de datos de Anthropic[Negocios]La inteligencia artificial ahorra tres horas de trabajo a la semana, pero solo a la mitad de los empleados[Investigación]Una IA de OpenAI ayuda a diagnosticar 18 enfermedades raras infantiles que llevaban años sin identificar[Investigación]OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA[Negocios]Generalist, la startup de robots con IA, alcanza una valoración de 3.000 millones de dólares[Herramientas]Cuatro millones de modelos de IA escaneados en busca de vulnerabilidades[Negocios]OpenAI pierde a otro alto cargo: se va el responsable de sus centros de datos[Regulación]OpenAI desactiva cuentas rusas que usaban IA para difundir propaganda pro-Kremlin[Negocios]OpenAI explica cómo reduce los costes de su IA mientras mejora su rendimiento[Investigación]Co-Scientist, la IA de Google que ya diseña experimentos y redacta artículos científicos[Negocios]Una antigua fundición de aluminio en Kentucky será el próximo gran centro de datos de Anthropic[Negocios]La inteligencia artificial ahorra tres horas de trabajo a la semana, pero solo a la mitad de los empleados[Investigación]Una IA de OpenAI ayuda a diagnosticar 18 enfermedades raras infantiles que llevaban años sin identificar[Investigación]OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónOpenAI News2 min

OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA

La empresa ha publicado LifeSciBench, una batería de preguntas de investigación en ciencias de la vida escritas y revisadas por científicos profesionales, diseñada para evaluar si los modelos de lenguaje pueden ayudar realmente en laboratorios y centros de investigación.

Por Redacción2 min
En resumen

LifeSciBench es un conjunto de pruebas (benchmark) creado por OpenAI y escrito por investigadores profesionales en ciencias de la vida, diseñado para medir si modelos de lenguaje como GPT-4o pueden ayudar realmente en tareas de investigación biomédica compleja, más allá de responder preguntas de manual.

Compartir
OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA
Investigación · OpenAI News

OpenAI ha lanzado LifeSciBench, un nuevo conjunto de pruebas (lo que en jerga se llama benchmark, una colección de preguntas y tareas estandarizadas) para medir cómo se desenvuelven los modelos de inteligencia artificial en problemas reales de investigación biomédica, según informó la compañía en su blog oficial. A diferencia de otros exámenes existentes, compuestos por preguntas genéricas o extraídas de libros de texto, LifeSciBench está escrito y revisado íntegramente por investigadores profesionales en activo: biólogos, químicos y especialistas en ciencias de la vida que trabajan a diario en laboratorios y centros académicos.

El objetivo es evaluar si los modelos de lenguaje avanzados —como GPT-4o o o1, ambos desarrollados por OpenAI— pueden realmente asistir en tareas complejas de investigación: interpretar resultados experimentales, proponer hipótesis, diseñar protocolos o analizar datos biológicos. Las preguntas no buscan respuestas memorizadas, sino razonamiento científico aplicado: el tipo de decisiones que un investigador toma cuando trabaja en un proyecto real, no cuando resuelve un test de opción múltiple.

LifeSciBench incluye problemas de distintas disciplinas dentro de las ciencias de la vida: desde biología molecular y genética hasta química medicinal y bioinformática (el uso de herramientas computacionales para analizar datos biológicos masivos, como secuencias de ADN). Cada pregunta ha sido redactada por un experto en el tema y revisada por otro investigador independiente, para asegurar que refleje con precisión los desafíos y el lenguaje propios de cada campo.

OpenAI no ha detallado aún los resultados concretos de sus modelos en este benchmark, pero la publicación de LifeSciBench responde a una demanda creciente en la comunidad científica: contar con herramientas estandarizadas que permitan comparar modelos de IA en contextos de investigación real, más allá de pruebas académicas genéricas. La empresa ha anunciado que pondrá el conjunto de datos a disposición de otros desarrolladores y grupos de investigación, para que puedan evaluar también sus propios sistemas.

El lanzamiento se produce en un momento en que varias farmacéuticas, universidades y laboratorios están integrando modelos de lenguaje en sus flujos de trabajo: desde la búsqueda de literatura científica hasta la predicción de estructuras de proteínas o el diseño de nuevos fármacos. La pregunta clave que intenta responder LifeSciBench es si esos modelos están realmente preparados para colaborar con científicos humanos en problemas complejos, o si aún les falta comprender matices cruciales del razonamiento experimental.

Fuente original
OpenAI News
Más en · Investigación