En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Writer lanza Palmyra-mini, una familia de modelos de IA pequeños pensados para razonar

La empresa californiana presenta tres modelos ligeros que caben en un portátil y están optimizados para resolver problemas paso a paso, no solo para generar texto.

Por Redacción2 min
En resumen

Writer lanzó Palmyra-mini, una familia de tres modelos de lenguaje (programas de IA para texto) con 1.200 millones de parámetros, diseñados para ejecutarse en ordenadores normales y optimizados para resolver problemas paso a paso mediante aprendizaje por refuerzo (una técnica donde el modelo mejora al recibir recompensas por respuestas correctas).

Compartir
Writer lanza Palmyra-mini, una familia de modelos de IA pequeños pensados para razonar
Modelos de IA · Hugging Face Blog

Writer, una empresa de software con sede en San Francisco que se especializa en herramientas de escritura con inteligencia artificial, acaba de lanzar la familia Palmyra-mini: tres modelos de lenguaje (programas de IA entrenados para entender y generar texto) diseñados para ejecutarse en ordenadores normales sin necesidad de servidores potentes en la nube. Los tres modelos —Palmyra-mini-1.2B-Base, Palmyra-mini-1.2B-Instruct y Palmyra-mini-1.2B-Grounded— tienen 1.200 millones de parámetros (los números que definen cómo funciona un modelo), lo que los convierte en opciones ligeras comparadas con gigantes como GPT-4 o Claude.

Lo que distingue a estos modelos, según explica Writer en su anuncio publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), es su capacidad de razonamiento. La empresa los entrenó específicamente para resolver problemas complejos paso a paso —matemáticas, lógica, programación— en lugar de limitarse a predecir la siguiente palabra en una frase, que es lo que hacen la mayoría de modelos de lenguaje. Para lograrlo, Writer usó una técnica llamada reinforcement learning (aprendizaje por refuerzo, donde el modelo mejora al recibir recompensas cuando da buenas respuestas) durante el entrenamiento.

La familia incluye tres variantes: el modelo Base es la versión básica, sin ajustes adicionales; el Instruct está optimizado para seguir instrucciones conversacionales (del tipo "explícame X" o "escribe un correo sobre Y"); y el Grounded está pensado para trabajar con datos externos que el usuario le proporciona, como documentos de una empresa, y responder basándose estrictamente en esa información sin inventar nada. Este último caso de uso es especialmente relevante en entornos empresariales, donde alucinar (generar información falsa) puede tener consecuencias legales o financieras.

Los tres modelos están disponibles bajo una licencia Apache 2.0 (una licencia de código abierto que permite usarlos, modificarlos y comercializarlos libremente) en Hugging Face. Writer afirma que, pese a su tamaño reducido, Palmyra-mini compite en precisión con modelos mucho más grandes en tareas de razonamiento, aunque no especifica qué benchmarks (pruebas estandarizadas) usó para esa comparación. La apuesta de la empresa apunta a un segmento creciente del mercado: organizaciones que quieren ejecutar IA localmente, sin enviar datos sensibles a servidores externos, y que no tienen presupuesto o infraestructura para modelos gigantes.

El lanzamiento se enmarca en una tendencia más amplia de la industria hacia modelos pequeños y especializados. Mientras empresas como OpenAI o Anthropic compiten por crear los modelos más grandes y potentes, otras apuestan por eficiencia: menos parámetros, menos coste computacional, más control para el usuario final. Writer, que factura principalmente vendiendo software a empresas, usa Palmyra-mini como demostración de que su tecnología puede adaptarse a diferentes necesidades sin depender de los grandes proveedores de la nube.

Fuente original
Hugging Face Blog
Más en · Modelos de IA