En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Un modelo de IA que maneja tu ordenador como si fuera humano

Hugging Face presenta Smol2Operator, un sistema que puede navegar interfaces gráficas, hacer clic y escribir por ti, entrenado para seguir instrucciones sin código.

Por Redacción2 min
Compartir
Un modelo de IA que maneja tu ordenador como si fuera humano
Investigación · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar Smol2Operator, un modelo de inteligencia artificial capaz de controlar tu ordenador de forma visual: puede mover el cursor, hacer clic en botones, rellenar formularios y seguir instrucciones complejas mirando únicamente la pantalla, como haría una persona. La novedad está en el enfoque: en lugar de entrenar el modelo desde cero, los investigadores tomaron modelos de lenguaje pequeños ya existentes (LLMs de entre 1,7 y 8.000 millones de parámetros, una medida que indica el tamaño y capacidad de un modelo) y los afinaron específicamente para esta tarea mediante un proceso llamado post-entrenamiento (ajustar un modelo ya creado para que haga algo nuevo sin empezar de cero).

El sistema funciona convirtiendo capturas de pantalla en coordenadas numéricas: tú le dices qué hacer («abre esta página web y rellena el formulario») y él decide dónde hacer clic o qué tecla pulsar, basándose en lo que ve en la interfaz gráfica. Esto es distinto de otras aproximaciones que requieren acceso al código de la aplicación o etiquetas ocultas en el HTML. Según informó Hugging Face, los modelos resultantes compiten con sistemas mucho más grandes, como GPT-4o (el modelo de lenguaje avanzado de OpenAI), en tareas específicas de control de interfaces, a pesar de ser hasta 25 veces más pequeños.

Para entrenarlos, usaron tres conjuntos de datos públicos con ejemplos de acciones en interfaces reales, más datos sintéticos generados automáticamente (ejemplos creados por otros modelos de IA en lugar de por humanos). El proceso de post-entrenamiento incluyó aprendizaje supervisado (enseñar al modelo con ejemplos correctos) y optimización directa de preferencias, o DPO (una técnica que mejora el modelo recompensando las respuestas que más se parecen al comportamiento deseado). Todo el código, los modelos y los conjuntos de datos están disponibles abiertamente en Hugging Face.

¿Por qué importa esto? Porque acerca la posibilidad de tener asistentes de IA que automaticen tareas tediosas en tu ordenador sin que tengas que instalar extensiones específicas para cada aplicación. También democratiza esta tecnología: al usar modelos pequeños que cualquiera puede descargar y ejecutar localmente, no necesitas depender de servicios en la nube de grandes empresas ni enviar capturas de tu pantalla a servidores externos. El equipo ya está trabajando en mejorar la velocidad y la capacidad de razonamiento de estos agentes (programas de IA que toman decisiones y actúan de forma autónoma), según detalla el artículo técnico publicado en su blog.

Fuente original
Hugging Face Blog
Más en · Investigación