Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog3 min

Modelo de IA compacto agora entende vídeos e roda em celulares sem internet

A Hugging Face lançou o SmolVLM2, um modelo de visão computacional que processa imagens e vídeos em dispositivos comuns, sem precisar de servidores nem conexão online.

Por Redação3 min
Em resumo

A Hugging Face lançou o SmolVLM2, um modelo de visão computacional (IA que entende imagens e vídeos) com 2 bilhões de parâmetros, capaz de processar vídeos e responder perguntas sobre eles rodando em celulares, computadores pessoais e dispositivos pequenos, sem precisar de internet ou servidores na nuvem.

Compartilhar
Modelo de IA compacto agora entende vídeos e roda em celulares sem internet
Modelos de IA · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou o SmolVLM2, um modelo de visão computacional (sistemas de IA que entendem imagens e vídeos) projetado para rodar em dispositivos comuns como celulares, computadores pessoais e até câmeras de segurança, sem depender de servidores na nuvem. A novidade central é a capacidade de processar vídeos: o modelo consegue responder perguntas sobre o que acontece em uma sequência de frames, entender o contexto temporal e descrever ações, algo que versões anteriores de modelos compactos não faziam.

O SmolVLM2 tem apenas 2 bilhões de parâmetros (os valores ajustáveis que determinam como um modelo processa informação), o que o torna pequeno o suficiente para rodar em hardware limitado — a empresa demonstrou o modelo funcionando em um Jetson Nano (um computador pequeno e barato feito para rodar IA em dispositivos sem conexão constante com a internet). Apesar do tamanho reduzido, o modelo supera concorrentes até cinco vezes maiores em testes de compreensão de vídeo, segundo dados divulgados pela Hugging Face. A empresa disponibilizou o modelo com pesos abertos (o que significa que qualquer um pode baixar, usar e modificar o código sem pagar licenças), acompanhado de instruções para adaptá-lo a tarefas específicas.

A arquitetura do SmolVLM2 combina um modelo de linguagem (LLM, sigla para large language model, sistemas treinados para entender e gerar texto) com um codificador de visão que processa imagens frame a frame. Para vídeos, o modelo recebe uma sequência de até 80 frames (quadros individuais de um vídeo) e usa um sistema de atenção temporal (mecanismo que permite ao modelo relacionar informações de diferentes momentos no tempo) para entender movimento e mudanças ao longo da sequência. Esse desenho permite que o modelo responda perguntas como "o que a pessoa está fazendo no vídeo" ou "quantos objetos aparecem na cena", tarefas que exigem compreensão de contexto além de uma imagem isolada.

A Hugging Face treinou o modelo em uma mistura de dados públicos de imagens, vídeos anotados e pares de pergunta-resposta extraídos de conjuntos de dados abertos. O treinamento incluiu uma etapa de fine-tuning (ajuste fino, processo em que um modelo pré-treinado é adaptado para tarefas específicas) com instruções multimodais, o que permite ao modelo seguir comandos que misturam texto e elementos visuais. A empresa não divulgou o custo total do treinamento, mas afirmou que o processo usou GPUs A100 (chips especializados em cálculos de IA, fabricados pela Nvidia) por cerca de uma semana.

O modelo já está disponível para download na plataforma Hugging Face e pode ser usado gratuitamente em projetos comerciais e acadêmicos. A empresa disponibilizou também uma versão otimizada para rodar em navegadores via WebGPU (uma tecnologia que permite executar código de IA diretamente no navegador, usando a placa de vídeo do computador), o que significa que desenvolvedores podem integrar o SmolVLM2 em aplicações web sem exigir instalação de software. Entre os casos de uso mencionados pela Hugging Face estão análise de vídeos de segurança, assistentes virtuais que entendem o contexto visual de uma videochamada e ferramentas de acessibilidade que descrevem o conteúdo de vídeos para pessoas com deficiência visual.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA