Modelo de IA compacto agora entende vídeos e roda em celulares sem internet
A Hugging Face lançou o SmolVLM2, um modelo de visão computacional que processa imagens e vídeos em dispositivos comuns, sem precisar de servidores nem conexão online.
A Hugging Face lançou o SmolVLM2, um modelo de visão computacional (IA que entende imagens e vídeos) com 2 bilhões de parâmetros, capaz de processar vídeos e responder perguntas sobre eles rodando em celulares, computadores pessoais e dispositivos pequenos, sem precisar de internet ou servidores na nuvem.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou o SmolVLM2, um modelo de visão computacional (sistemas de IA que entendem imagens e vídeos) projetado para rodar em dispositivos comuns como celulares, computadores pessoais e até câmeras de segurança, sem depender de servidores na nuvem. A novidade central é a capacidade de processar vídeos: o modelo consegue responder perguntas sobre o que acontece em uma sequência de frames, entender o contexto temporal e descrever ações, algo que versões anteriores de modelos compactos não faziam.
O SmolVLM2 tem apenas 2 bilhões de parâmetros (os valores ajustáveis que determinam como um modelo processa informação), o que o torna pequeno o suficiente para rodar em hardware limitado — a empresa demonstrou o modelo funcionando em um Jetson Nano (um computador pequeno e barato feito para rodar IA em dispositivos sem conexão constante com a internet). Apesar do tamanho reduzido, o modelo supera concorrentes até cinco vezes maiores em testes de compreensão de vídeo, segundo dados divulgados pela Hugging Face. A empresa disponibilizou o modelo com pesos abertos (o que significa que qualquer um pode baixar, usar e modificar o código sem pagar licenças), acompanhado de instruções para adaptá-lo a tarefas específicas.
A arquitetura do SmolVLM2 combina um modelo de linguagem (LLM, sigla para large language model, sistemas treinados para entender e gerar texto) com um codificador de visão que processa imagens frame a frame. Para vídeos, o modelo recebe uma sequência de até 80 frames (quadros individuais de um vídeo) e usa um sistema de atenção temporal (mecanismo que permite ao modelo relacionar informações de diferentes momentos no tempo) para entender movimento e mudanças ao longo da sequência. Esse desenho permite que o modelo responda perguntas como "o que a pessoa está fazendo no vídeo" ou "quantos objetos aparecem na cena", tarefas que exigem compreensão de contexto além de uma imagem isolada.
A Hugging Face treinou o modelo em uma mistura de dados públicos de imagens, vídeos anotados e pares de pergunta-resposta extraídos de conjuntos de dados abertos. O treinamento incluiu uma etapa de fine-tuning (ajuste fino, processo em que um modelo pré-treinado é adaptado para tarefas específicas) com instruções multimodais, o que permite ao modelo seguir comandos que misturam texto e elementos visuais. A empresa não divulgou o custo total do treinamento, mas afirmou que o processo usou GPUs A100 (chips especializados em cálculos de IA, fabricados pela Nvidia) por cerca de uma semana.
O modelo já está disponível para download na plataforma Hugging Face e pode ser usado gratuitamente em projetos comerciais e acadêmicos. A empresa disponibilizou também uma versão otimizada para rodar em navegadores via WebGPU (uma tecnologia que permite executar código de IA diretamente no navegador, usando a placa de vídeo do computador), o que significa que desenvolvedores podem integrar o SmolVLM2 em aplicações web sem exigir instalação de software. Entre os casos de uso mencionados pela Hugging Face estão análise de vídeos de segurança, assistentes virtuais que entendem o contexto visual de uma videochamada e ferramentas de acessibilidade que descrevem o conteúdo de vídeos para pessoas com deficiência visual.


