En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto

El Instituto Allen para IA libera un modelo de lenguaje de 8.000 millones de parámetros entrenado para sintetizar literatura científica con referencias verificables, reduciendo el tiempo de generación de tres minutos a menos de uno.

Por Redacción2 min
En resumen

AstaBrief es un modelo de lenguaje de 8.000 millones de parámetros (una medida del tamaño de un modelo de IA) que genera informes científicos con citas a partir de una pregunta de investigación y fragmentos de literatura académica. Lo desarrolló el Allen Institute for AI, tarda menos de un minuto en producir un informe completo y está disponible con pesos abiertos (los parámetros entrenados descargables) en Hugging Face.

Compartir
Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto
Modelos de IA · Hugging Face Blog

El Allen Institute for AI (un centro de investigación estadounidense especializado en inteligencia artificial sin ánimo de lucro, conocido como Ai2) ha publicado AstaBrief, un modelo de lenguaje de 8.000 millones de parámetros (una medida del tamaño y complejidad de un modelo de IA) diseñado específicamente para redactar informes científicos citados. El modelo toma una pregunta de investigación y fragmentos de literatura académica previamente recuperados, y genera un informe completo con referencias bibliográficas en una sola pasada, según informó la organización en su blog oficial.

AstaBrief se entrenó a partir de 90.000 consultas reales enviadas por usuarios de Asta, la plataforma de investigación científica del instituto. Los investigadores filtraron esas preguntas para eliminar consultas demasiado cortas, no científicas o que contuvieran información personal, quedándose con 47.000 ejemplos de calidad. A diferencia de otros modelos entrenados con preguntas sintéticas o diseñadas para tests de referencia (benchmarks), AstaBrief aprendió del lenguaje que usan los científicos en situaciones reales: consultas largas, con contexto detallado y múltiples restricciones simultáneas.

El modelo reduce el tiempo de generación de informes de 178,5 segundos de media (casi tres minutos) a 51,1 segundos (menos de un minuto), unas 3,5 veces más rápido que el modo Thinking de Asta, que utiliza Claude (una familia de modelos de lenguaje desarrollados por Anthropic). Esta mejora se consiguió prescindiendo de etapas intermedias costosas: AstaBrief genera el informe final directamente, sin resumir y agrupar fragmentos por separado ni escribir sección por sección, como hacían los sistemas anteriores basados en modelos propietarios (modelos cuyo código y pesos no están disponibles públicamente) como GPT-4.1 o Claude 3.5 Sonnet.

Para entrenar el modelo, el equipo del Ai2 combinó ajuste supervisado (SFT, un método en el que se muestra al modelo ejemplos correctos para que aprenda a imitarlos) con optimización directa de preferencias (DPO, una técnica que entrena el modelo comparando pares de respuestas y reforzando las mejores). Los investigadores generaron miles de pares de informes sobre las mismas preguntas y usaron modelos evaluadores para identificar cuál era mejor en cada caso, priorizando la calidad de las citas, la relevancia y la fidelidad a las fuentes. Evitaron deliberadamente métodos de aprendizaje por refuerzo más complejos, que pueden ser inestables y caros, apostando en cambio por un enfoque más sencillo y depurable.

Ai2 ha publicado tanto los pesos del modelo (los parámetros entrenados que permiten ejecutar el modelo de forma autónoma) como los datos de entrenamiento en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). La organización también ofrece un flujo de trabajo de ejemplo que permite a instituciones generar informes a partir de sus propios archivos PDF sin enviar datos a servicios externos, algo especialmente relevante cuando las preguntas de investigación contienen información sensible o resultados aún no publicados. El modelo ya está disponible en Asta como modo rápido (Fast mode), complementando el modo Thinking más lento pero más detallado.

Fuente original
Hugging Face Blog
Más en · Modelos de IA