Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog2 min

O que o modelo Qwen 3 ensina sobre como treinar assistentes de IA

A forma como a Qwen estrutura conversas com seu novo modelo revela quatro lições práticas para quem está construindo chatbots e agentes de inteligência artificial

Por Redação2 min
Em resumo

O Qwen 3 (modelo de linguagem da Alibaba) ensina quatro práticas para construir assistentes de IA: separar claramente papéis de sistema, usuário e assistente; criar um canal específico para chamar ferramentas externas; controlar quanto histórico de conversa incluir; e marcar explicitamente onde cada mensagem termina, evitando respostas confusas ou infinitas.

Compartilhar
O que o modelo Qwen 3 ensina sobre como treinar assistentes de IA
Modelos de IA · Hugging Face Blog

A Alibaba lançou recentemente a série Qwen 3 (uma família de modelos de linguagem de código aberto, criados pela gigante chinesa de comércio eletrônico), e segundo informou a Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), a maneira como esses modelos organizam conversas traz pelo menos quatro lições importantes para quem desenvolve assistentes baseados em IA. O diferencial está no que os técnicos chamam de "chat template" (a estrutura que diz ao modelo como interpretar e formatar mensagens entre usuário e assistente), e a implementação do Qwen 3 mostra na prática como pequenas escolhas técnicas fazem diferença na qualidade das respostas.

A primeira lição é sobre separação clara de papéis. O Qwen 3 usa marcadores distintos para diferenciar mensagens do sistema (instruções de comportamento que o modelo deve seguir), do usuário (quem faz perguntas) e do assistente (o próprio modelo). Isso parece óbvio, mas muitos modelos anteriores misturavam esses papéis ou usavam marcadores ambíguos, o que confundia o modelo sobre quem estava falando e causava respostas fora de contexto. A estrutura do Qwen 3 deixa isso explícito desde o início, usando tags simples como "<|im_start|>system" e "<|im_start|>user".

A segunda lição envolve o tratamento de ferramentas externas. Modelos modernos de IA frequentemente precisam chamar funções específicas — como buscar informações atualizadas, fazer cálculos ou acessar bancos de dados — em vez de simplesmente gerar texto. O Qwen 3 reserva um papel específico chamado "tool" nas conversas, permitindo que o modelo saiba exatamente quando deve invocar uma ferramenta externa e como interpretar o resultado que ela retorna. Isso evita que o modelo tente adivinhar respostas que ele deveria buscar em uma fonte confiável.

A terceira lição diz respeito ao controle de histórico. O template do Qwen 3 permite que desenvolvedores escolham quantas mensagens anteriores incluir no contexto da conversa, algo crítico quando se trabalha com modelos que têm limite de tokens (as unidades mínimas de texto que o modelo processa — grosso modo, pedaços de palavras). Manter muito histórico consome recursos e deixa o modelo lento; manter pouco faz o assistente perder o fio da conversa. O Qwen 3 facilita esse equilíbrio ao estruturar cada troca de mensagens como um bloco independente que pode ser incluído ou descartado conforme a necessidade.

Por fim, a quarta lição trata da finalização explícita de mensagens. O Qwen 3 usa um marcador específico ("<|im_end|>") para sinalizar o fim de cada mensagem, o que parece trivial mas evita um problema comum: o modelo continuar gerando texto indefinidamente ou misturar respostas de diferentes turnos da conversa. Esse controle fino sobre onde cada mensagem termina melhora tanto a eficiência quanto a coerência das respostas. Embora o Qwen 3 não seja o primeiro modelo a adotar essas práticas, a Hugging Face destaca que sua implementação é particularmente clara e bem documentada, servindo como referência para quem está começando a trabalhar com modelos de linguagem.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA