Agentes de IA da Hugging Face agora conseguem 'ver' imagens
A biblioteca smolagents ganhou suporte a modelos de visão, permitindo que agentes de IA analisem páginas web com elementos visuais e tomem decisões baseadas no que veem na tela
A Hugging Face adicionou suporte a modelos de linguagem visual (VLMs, que processam texto e imagens) na biblioteca smolagents. Isso permite que agentes de IA analisem conteúdo visual de páginas web e tomem decisões baseadas no que veem na tela, como clicar em botões ou navegar entre páginas de forma autônoma.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou que sua biblioteca smolagents agora suporta modelos de linguagem visual, ou VLMs (sigla em inglês para modelos que processam tanto texto quanto imagens). Na prática, isso significa que agentes de IA (programas autônomos que executam tarefas sem supervisão constante) construídos com essa ferramenta podem finalmente enxergar e interpretar conteúdo visual — uma capacidade essencial para tarefas como navegar na internet de forma autônoma.
Até agora, muitos agentes de IA ficavam limitados ao processar páginas web porque dependiam apenas de texto extraído. Isso os impedia de captar informações transmitidas por cores, ícones, posicionamento de elementos ou qualquer outro dado visual. Com a nova funcionalidade, um agente pode tirar capturas de tela de uma página, analisar o que está vendo e decidir suas próximas ações — como clicar em um botão específico ou fechar uma janela pop-up — baseado no conteúdo visual.
A implementação oferece duas formas de passar imagens para os agentes. A primeira é fornecer as imagens logo no início, útil para casos como análise de documentos em PDF que incluem gráficos ou diagramas. A segunda permite adicionar imagens dinamicamente a cada passo da execução, usando callbacks (funções que são executadas automaticamente ao final de cada etapa do agente). Esse segundo método é ideal para situações em que o agente precisa ver o resultado de suas próprias ações, como ao navegar entre páginas diferentes de um site.
Para demonstrar o potencial da novidade, a equipe da Hugging Face criou um exemplo prático: um agente que navega na web usando a biblioteca Helium (uma ferramenta que automatiza ações em navegadores). O agente tira capturas de tela após cada ação, analisa o conteúdo visual da página e decide o que fazer em seguida — tudo de forma autônoma. O código-fonte do exemplo foi divulgado pela empresa e mostra como configurar callbacks para que o agente salve e processe imagens automaticamente durante sua execução.


