Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog3 min

Liquid AI lança modelo experimental que acelera respostas visuais em até 3x

A startup criou uma versão do LFM2.5-VL que usa decodificação especulativa para gerar respostas mais rápidas em celulares e GPUs, sem perder qualidade.

Por Redação3 min
Em resumo

A Liquid AI lançou um rascunhador DSpark (draft model — rede neural menor que adivinha as próximas palavras) para o modelo de visão e linguagem LFM2.5-VL-3B. Ele usa decodificação especulativa (técnica que gera várias palavras de uma vez e depois confere) para acelerar respostas em até 3 vezes em celulares e 2,7 vezes em GPUs, adicionando apenas 280 milhões de parâmetros ao modelo original.

Compartilhar
Liquid AI lança modelo experimental que acelera respostas visuais em até 3x
Modelos de IA · Hugging Face Blog

A Liquid AI (startup americana de inteligência artificial fundada por pesquisadores do MIT) lançou nesta segunda-feira uma versão experimental do seu modelo de visão e linguagem LFM2.5-VL-3B que funciona até três vezes mais rápido em dispositivos móveis e 2,7 vezes mais rápido em GPUs de datacenter (chips gráficos usados em servidores de nuvem). O ganho vem de uma técnica chamada decodificação especulativa (speculative decoding, em inglês — um método que faz o modelo "chutar" várias palavras de uma vez e depois conferir se estavam certas, economizando tempo) implementada através de um rascunhador DSpark.

O modelo funciona assim: enquanto o modelo principal (chamado de "target") gera uma resposta palavra por palavra, o rascunhador (draft model — uma rede neural menor e mais rápida) tenta adivinhar as próximas oito ou nove palavras de uma vez, capturando informações das camadas internas do modelo maior. O modelo principal depois verifica se as sugestões estão corretas. Como o rascunhador acerta boa parte das vezes, o processo todo fica mais rápido. A técnica já existia para modelos de texto puro, mas esta é a primeira vez que a Liquid AI a aplica a um modelo que processa tanto imagens quanto texto.

O rascunhador tem 280 milhões de parâmetros (números ajustáveis que determinam como uma rede neural se comporta) — apenas 8,9% a mais que o modelo original de 3 bilhões. Isso significa que ele ocupa pouca memória extra no celular ou computador. A Liquid testou o sistema em seis tipos diferentes de tarefas visuais, desde responder perguntas sobre imagens até interpretar gráficos e manter conversas com várias trocas. Em um chip M5 Max da Apple, a velocidade de geração de texto aumentou entre 2,3 e 3,13 vezes, dependendo da tarefa; o tempo total de resposta (incluindo o processamento da imagem) melhorou entre 1,56 e 2,62 vezes.

A limitação principal da técnica é que ela só acelera a geração de texto, não o processamento inicial da imagem. Em modelos de visão e linguagem, a rede neural primeiro passa a foto por um codificador de visão (vision encoder — a parte do modelo que transforma pixels em representações numéricas), depois processa centenas de "tokens visuais" (pedaços de informação extraídos da imagem) junto com o texto da pergunta. Esse trabalho inicial ainda leva tempo, principalmente em celulares, onde há menos poder de processamento que em servidores. Por isso, mesmo com o texto três vezes mais rápido, o ganho total fica em torno de duas vezes — uma ilustração da lei de Amdahl (princípio da computação que diz que a aceleração total de um sistema é limitada pela parte que não foi otimizada).

O modelo já tem suporte de lançamento para três ferramentas populares entre desenvolvedores: llama.cpp (software que roda modelos de IA localmente em computadores e celulares), MLX-VLM (framework da Apple para rodar modelos de visão em chips da marca) e SGLang (plataforma para servir modelos de linguagem em produção). A Liquid disponibilizou o rascunhador no Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) em dois formatos prontos para uso: Safetensors e GGUF. A empresa mantém os pesos abertos (open-weight — qualquer pessoa pode baixar os parâmetros do modelo e usá-los sem restrições), o que permite que desenvolvedores adaptem o sistema para suas próprias necessidades.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA