Llama Guard 4: novo modelo de moderação de conteúdo da Meta chega à Hugging Face
Ferramenta de código aberto detecta riscos em conversas com assistentes de IA e promete funcionar melhor em português e outros idiomas além do inglês
O Llama Guard 4 é um modelo de inteligência artificial desenvolvido pela Meta para identificar conteúdo problemático em conversas com assistentes virtuais. Ele detecta 14 tipos de risco, de discurso de ódio a instruções ilegais, funciona em vários idiomas (incluindo português) e está disponível gratuitamente na Hugging Face.

A Meta lançou o Llama Guard 4, um modelo de inteligência artificial dedicado a moderar conversas entre pessoas e assistentes virtuais, segundo informou a Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados). A ferramenta analisa tanto o que o usuário escreve quanto o que o chatbot responde, identificando conteúdo potencialmente problemático — de discurso de ódio e desinformação a instruções para atividades ilegais.
O modelo é baseado no Llama 3.3 70B (um modelo de linguagem grande, ou LLM, treinado para entender e gerar texto) e pode rodar tanto em servidores na nuvem quanto em computadores locais. Diferente de versões anteriores, que funcionavam bem principalmente em inglês, o Llama Guard 4 foi treinado para detectar problemas em conversas escritas em vários idiomas, incluindo português, espanhol, francês, alemão, italiano, hindi e tailandês.
A ferramenta classifica os riscos em 14 categorias, de conteúdo sexual envolvendo crianças a instruções para fabricar armas ou hackear sistemas. Segundo a Meta, o modelo superou alternativas como o Llama Guard 3 e o Aegis Guard Defensive nos testes de precisão realizados pela empresa — embora ela não tenha detalhado publicamente a metodologia completa desses testes.
O Llama Guard 4 está disponível na Hugging Face com uma licença de código aberto (o que significa que qualquer desenvolvedor pode baixar, modificar e usar o modelo sem pagar). A Meta oferece também uma versão ajustada especificamente para o chatbot Claude, da Anthropic, e disponibiliza um conjunto de dados sintéticos (dados gerados artificialmente, não tirados de conversas reais) para quem quiser treinar versões personalizadas do modelo.


