En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Holotron-12B: un modelo de IA entrenado para usar tu ordenador como lo harías tú

Un equipo japonés publica un modelo de lenguaje de 12.000 millones de parámetros capaz de controlar aplicaciones de escritorio mediante capturas de pantalla y movimientos del ratón.

Por Redacción2 min
Compartir
Holotron-12B: un modelo de IA entrenado para usar tu ordenador como lo harías tú
Modelos de IA · Hugging Face Blog

La empresa japonesa Hcompany ha publicado Holotron-12B, un modelo de inteligencia artificial de pesos abiertos (es decir, que cualquiera puede descargar y ejecutar en su propio ordenador) diseñado específicamente para controlar interfaces gráficas de ordenadores. Según informa la compañía en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), el modelo es capaz de interpretar capturas de pantalla, decidir qué hacer a continuación y ejecutar acciones como mover el ratón, hacer clic o escribir texto, todo sin intervención humana.

A diferencia de otros modelos de lenguaje que solo generan texto, Holotron-12B es un «agente de computer use» (un tipo de IA entrenada para interactuar con software mediante su interfaz visual, como lo haría una persona), similar a lo que Anthropic presentó con Claude Computer Use. La diferencia clave es que Holotron-12B es de pesos abiertos, puede ejecutarse de forma local y está optimizado para tareas de alta frecuencia, procesando hasta 30 fotogramas por segundo en entornos de prueba. Esto significa que puede responder en tiempo real a cambios en la pantalla, algo crucial para aplicaciones interactivas.

El modelo tiene 12.000 millones de parámetros (los valores numéricos que determinan cómo responde una IA) y ha sido entrenado con una combinación de datos sintéticos generados automáticamente y datos reales de interacciones humanas con ordenadores. Hcompany utilizó su propio framework interno para generar millones de ejemplos de tareas en entornos simulados de Windows y macOS, lo que permitió entrenar al modelo sin depender exclusivamente de grabaciones manuales.

La empresa ha publicado tanto el modelo como el código de entrenamiento en Hugging Face bajo licencia Apache 2.0 (una licencia permisiva que permite uso comercial sin restricciones importantes). También han compartido OSWorld-Light, un conjunto de pruebas simplificado para evaluar la capacidad de modelos de IA de completar tareas reales en sistemas operativos, algo que hasta ahora requería benchmarks (conjuntos de pruebas estandarizadas) complejos y difíciles de replicar.

Holotron-12B obtiene un 23,2% de precisión en OSWorld-Light, una métrica que indica el porcentaje de tareas que completa correctamente de principio a fin sin ayuda. Aunque puede parecer bajo, es comparable a modelos comerciales mucho más grandes como GPT-4o, que alcanza un 26,7% en el mismo test, pero requiere conexión a internet y acceso mediante API de pago. Según Hcompany, el siguiente objetivo es escalar el modelo a versiones de 34.000 y 70.000 millones de parámetros para mejorar su capacidad de razonamiento en tareas complejas.

Fuente original
Hugging Face Blog
Más en · Modelos de IA