Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog3 min

Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade

A Hugging Face criou um modelo de linguagem especializado no dialeto dos Emirados Árabes Unidos, que entende não só as palavras, mas a cultura e o contexto por trás delas

Por Redação3 min
Em resumo

O Falcon-Emirati-7B é um modelo de linguagem criado pela Hugging Face especializado em árabe emiradense, um dialeto do Golfo Pérsico. Ele foi treinado para entender não só vocabulário e gramática do dialeto, mas também o contexto cultural por trás de expressões, provérbios e poesia emiradenses, alcançando 84,83% de acerto no benchmark Alyah.

Compartilhar
Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade
Modelos de IA · Hugging Face Blog

O árabe é, na prática, uma família de línguas que compartilham o mesmo nome. O árabe padrão moderno é o que você lê em jornais e livros didáticos, mas raramente é como as pessoas conversam no dia a dia. Nos Emirados Árabes Unidos, as conversas cotidianas, o humor e as histórias acontecem em árabe emiradense, um dialeto do Golfo com vocabulário próprio, ritmo próprio e uma cultura inteira entrelaçada nele. A poesia emiradense, especialmente a nabati (poesia popular beduína), junto com provérbios e anedotas, carrega significados que não sobrevivem a uma tradução literal, palavra por palavra. Um modelo de IA que conhece apenas o árabe padrão pode traduzir cada palavra de uma frase emiradense e ainda assim perder completamente o que ela quer dizer de verdade.

Essa lacuna é exatamente o que o Falcon-Emirati-7B foi construído para fechar, segundo informou a Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) em sua publicação oficial. É um modelo especializado em dialeto, construído em cima do Falcon-H1-Arabic (um modelo de linguagem já treinado em árabe), feito para entender e gerar árabe emiradense do jeito que um falante nativo falaria: com o vocabulário certo, o tom certo e o contexto cultural por trás.

Adaptar um modelo de árabe geral para um dialeto específico é mais difícil do que parece. O emiradense é principalmente um dialeto falado — aparece muito menos em textos online do que o árabe padrão ou outros dialetos do Golfo e do Levante, então há bem menos material escrito para treinar um modelo. Além disso, o significado muitas vezes não é literal: expressões idiomáticas, provérbios e referências poéticas dependem de contexto cultural compartilhado, não do vocabulário de superfície. E não existe um manual estabelecido de como fazer isso: quanto dado dialetal é suficiente, como misturá-lo com árabe padrão, ou em qual etapa do treinamento isso importa mais. Por isso, segundo a equipe, boa parte do trabalho foi tentativa e erro: testando diferentes misturas de dados e estratégias de treinamento, usando tanto julgamento humano quanto pontuações automáticas para descobrir o que realmente funcionava.

A equipe construiu um pipeline de dados específico para o emiradense com três fontes complementares. Primeiro, textos autênticos de sites e fóruns emiradenses escritos nativamente no dialeto, não traduzidos do árabe padrão — a fonte da verdade sobre como emiradenses realmente escrevem e falam online. Segundo, material em árabe padrão especificamente sobre cultura, herança e identidade emiradense: artigos sobre costumes locais, valores, história e normas sociais. Isso não ensina o modelo a escrever em dialeto, mas ensina sobre o que está sendo falado quando o assunto é emiradense. Terceiro, dados sintéticos (gerados por IA), guiados por glossários e regras de estilo construídos especificamente para vocabulário e gramática emiradenses — uma forma de cobrir tópicos do dia a dia que textos autênticos sozinhos não cobriam, mas com restrições rígidas para que o resultado soasse genuinamente emiradense.

O Falcon-Emirati-7B alcançou 84,83% de acerto no Alyah (الياه, "Estrela do Norte"), um benchmark (conjunto de testes padrão) criado especificamente para avaliar capacidade de IA em dialeto emiradense. São 1.173 questões de múltipla escolha coletadas manualmente de falantes nativos emiradenses, cobrindo desde cumprimentos e etiqueta do cotidiano até linguagem figurativa, conhecimento de patrimônio cultural e poesia emiradense — as categorias onde dialeto e cultura mais importam e onde modelos genéricos de árabe costumam falhar. A pontuação do Falcon-Emirati ficou acima de todos os outros modelos árabes e multilíngues comparados, incluindo vários modelos muitas vezes maiores em número de parâmetros (os valores internos que o modelo ajusta durante o treinamento). Falantes nativos também revisaram as respostas do modelo diretamente, julgando não só se estavam corretas, mas se soavam naturais — o tom, a adequação cultural, as coisas que uma métrica automática não captura mas que um ouvido nativo percebe na hora.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA