
Liquid AI lança modelo experimental que acelera respostas visuais em até 3x
A startup criou uma versão do LFM2.5-VL que usa decodificação especulativa para gerar respostas mais rápidas em celulares e GPUs, sem perder qualidade.
Notícias.
Inteligência Artificial
Inteligência Artificial para Gente de Verdade · ES / PT-BR

A startup criou uma versão do LFM2.5-VL que usa decodificação especulativa para gerar respostas mais rápidas em celulares e GPUs, sem perder qualidade.

A plataforma agora permite rodar modelos de inteligência artificial usando servidores de 17 empresas diferentes, comparar preços e trocar de fornecedor sem reescrever código.

A fabricante de chips afirma que seu Groq 3 LPX processa 3.400 tokens por segundo, mas precisa de pelo menos 64 aceleradores para atingir esse desempenho, enquanto a rival Cerebras usa apenas um ou dois.

A parceria traz os modelos de linguagem da Cohere para a infraestrutura de inferência da Hugging Face, permitindo que desenvolvedores usem a tecnologia diretamente pela plataforma.

A parceria integra os aceleradores de IA da Intel ao TGI, ferramenta popular para servir modelos de linguagem em produção, prometendo alternativa às GPUs da Nvidia

A empresa desenvolveu um método que separa o processamento de modelos de difusão em duas partes, reduzindo custos de servidor em até 60% sem perder qualidade.

O Jalapeño, chip de inferência da OpenAI, mostrou ser mais eficiente que o Blackwell da Nvidia em latência e consumo de energia ao executar modelos de linguagem como o DeepSeek R1

Modelos de inteligência artificial 50 vezes mais rápidos exigem sistemas de segurança autônomos, não apenas monitoramento humano, segundo especialista da empresa.

A parceria permite que desenvolvedores usem centenas de modelos de linguagem e imagem pagando apenas pelo que processam, sem configurar servidores próprios.

Plataforma simplifica deploy de modelos de linguagem com vLLM, permitindo que desenvolvedores subam servidores em minutos sem configurar infraestrutura.

Parceria entre Hugging Face e a equipe do vLLM promete rodar modelos de linguagem até duas vezes mais rápido, mantendo a compatibilidade com milhares de modelos já existentes.

A plataforma de inferência rápida para desenvolvedores passa a compartilhar seus modelos otimizados no repositório mais popular de IA do mundo.

Hyperbolic, Nebius AI Studio e Novita agora oferecem acesso serverless a modelos de linguagem e imagem direto pela plataforma.
Usamos cookies de análise (Google Analytics) para entender quais artigos interessam. Só são ativadas se você aceitar. Saiba mais sobre privacidade