Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Agentes de IA da Hugging Face agora conseguem 'ver' imagens

A biblioteca smolagents ganhou suporte a modelos de visão, permitindo que agentes de IA analisem páginas web com elementos visuais e tomem decisões baseadas no que veem na tela

Por Redação2 min
Em resumo

A Hugging Face adicionou suporte a modelos de linguagem visual (VLMs, que processam texto e imagens) na biblioteca smolagents. Isso permite que agentes de IA analisem conteúdo visual de páginas web e tomem decisões baseadas no que veem na tela, como clicar em botões ou navegar entre páginas de forma autônoma.

Compartilhar
Agentes de IA da Hugging Face agora conseguem 'ver' imagens
Ferramentas · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou que sua biblioteca smolagents agora suporta modelos de linguagem visual, ou VLMs (sigla em inglês para modelos que processam tanto texto quanto imagens). Na prática, isso significa que agentes de IA (programas autônomos que executam tarefas sem supervisão constante) construídos com essa ferramenta podem finalmente enxergar e interpretar conteúdo visual — uma capacidade essencial para tarefas como navegar na internet de forma autônoma.

Até agora, muitos agentes de IA ficavam limitados ao processar páginas web porque dependiam apenas de texto extraído. Isso os impedia de captar informações transmitidas por cores, ícones, posicionamento de elementos ou qualquer outro dado visual. Com a nova funcionalidade, um agente pode tirar capturas de tela de uma página, analisar o que está vendo e decidir suas próximas ações — como clicar em um botão específico ou fechar uma janela pop-up — baseado no conteúdo visual.

A implementação oferece duas formas de passar imagens para os agentes. A primeira é fornecer as imagens logo no início, útil para casos como análise de documentos em PDF que incluem gráficos ou diagramas. A segunda permite adicionar imagens dinamicamente a cada passo da execução, usando callbacks (funções que são executadas automaticamente ao final de cada etapa do agente). Esse segundo método é ideal para situações em que o agente precisa ver o resultado de suas próprias ações, como ao navegar entre páginas diferentes de um site.

Para demonstrar o potencial da novidade, a equipe da Hugging Face criou um exemplo prático: um agente que navega na web usando a biblioteca Helium (uma ferramenta que automatiza ações em navegadores). O agente tira capturas de tela após cada ação, analisa o conteúdo visual da página e decide o que fazer em seguida — tudo de forma autônoma. O código-fonte do exemplo foi divulgado pela empresa e mostra como configurar callbacks para que o agente salve e processe imagens automaticamente durante sua execução.

Fonte original
Hugging Face Blog
Mais em · Ferramentas
Seu agente de IA acertou uma vez — mas vai acertar de novo?
Hugging Face Blog

Seu agente de IA acertou uma vez — mas vai acertar de novo?

Pesquisadores da IBM descobriram que agentes de inteligência artificial podem ter desempenho variável na mesma tarefa e criaram uma ferramenta que reduz pela metade essa instabilidade sem perder precisão