Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Modelos de visão e linguagem ficaram mais rápidos, baratos e precisos em 2024

Uma nova geração de modelos que entendem imagens e texto ao mesmo tempo está chegando a computadores comuns, celulares e até dispositivos offline, tornando a IA visual acessível para quem não tem acesso a servidores caros.

Por Redação2 min
Em resumo

Modelos de visão e linguagem (sistemas de IA que entendem imagens e texto juntos) ficaram muito mais rápidos, baratos e acessíveis em 2024. Tecnologias como quantização (reduzir a precisão interna do modelo para economizar memória) e pesos abertos (modelos que qualquer pessoa pode baixar e usar) permitem que esses sistemas rodem em computadores comuns, celulares e até offline, sem precisar de servidores caros.

Compartilhar
Modelos de visão e linguagem ficaram mais rápidos, baratos e precisos em 2024
Modelos de IA · Hugging Face Blog

Os modelos de visão e linguagem — sistemas de inteligência artificial capazes de processar ao mesmo tempo imagens e texto, respondendo perguntas sobre fotos ou gerando legendas detalhadas — evoluíram drasticamente em 2024, segundo levantamento publicado pela Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados). O que antes exigia GPUs potentes (chips gráficos caros, usados para treinar e rodar modelos grandes) agora roda em computadores pessoais, celulares e até em dispositivos que funcionam sem conexão com a internet.

Modelos como o Qwen2-VL, da chinesa Alibaba, e o Llama 3.2 Vision, da Meta, trouxeram desempenho comparável ao de sistemas fechados — como o GPT-4 Vision, da OpenAI — mas com pesos abertos (ou seja, qualquer pessoa pode baixar, modificar e rodar o modelo sem pagar por uso). Isso democratiza o acesso: pequenas empresas, universidades e desenvolvedores individuais conseguem usar IA visual sem depender de APIs pagas (interfaces que cobram por cada requisição enviada a um servidor externo).

A velocidade também melhorou. Técnicas como quantização (reduzir a precisão dos números usados internamente pelo modelo, economizando memória sem perder muita qualidade) e caches de atenção (armazenar cálculos intermediários para não refazê-los a cada nova palavra gerada) tornaram a inferência (o processo de usar o modelo já treinado para gerar respostas) até dez vezes mais rápida em alguns casos. O PaliGemma 2, do Google, por exemplo, roda bem em laptops comuns graças a essas otimizações.

Outra novidade importante é a capacidade de processar vídeos nativamente, sem precisar dividir o conteúdo em quadros estáticos. Modelos como o Aria e o Pixtral Large conseguem entender sequências de imagens ao longo do tempo, útil para tarefas como análise de câmeras de segurança, legendagem automática de vídeos ou assistentes que entendem tutoriais gravados. Esse tipo de funcionalidade era restrito a laboratórios de pesquisa até pouco tempo atrás.

A Hugging Face destacou ainda o papel de frameworks (conjuntos de ferramentas prontas para facilitar o desenvolvimento) como o Transformers e o vLLM, que simplificam a integração desses modelos em aplicações reais. Com suporte nativo para aceleração em chips Apple Silicon (os processadores M1, M2 e M3 da Apple, que combinam CPU e GPU no mesmo componente) e GPUs da Nvidia, a barreira técnica para adotar IA visual caiu consideravelmente. O resultado prático: em 2025, espera-se que qualquer startup ou projeto pessoal possa adicionar capacidades de visão computacional sem precisar de uma equipe especializada nem de um orçamento milionário.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA