Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog1 min

Nvidia cria dataset de IA com 10 mil personas indianas para treinar modelos locais

Conjunto de dados sintéticos representa diversidade cultural, linguística e socioeconômica da Índia para desenvolvimento de IA soberana.

Por Redação1 min
Compartilhar
Nvidia cria dataset de IA com 10 mil personas indianas para treinar modelos locais
Pesquisa · Hugging Face Blog

A Nvidia lançou o Nemotron-Personas-India, um dataset (conjunto de dados usado para treinar modelos de IA) com 10 mil personas sintéticas que representam a diversidade da Índia. O material inclui variações de idioma, região, contexto socioeconômico e background cultural, e está disponível gratuitamente no Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados). A ideia é permitir que empresas e governos indianos treinem seus próprios modelos de linguagem sem depender de dados produzidos no exterior.

Cada persona inclui informações detalhadas como profissão, nível educacional, idade, idioma nativo e estado de origem. O dataset cobre 22 idiomas oficiais da Índia e 28 estados, além de diferentes faixas etárias e níveis de renda. Segundo a Nvidia, a diversidade é essencial para evitar que modelos de IA reproduzam apenas a perspectiva de grupos majoritários ou de regiões específicas do país.

Os dados foram gerados sinteticamente — ou seja, criados por outro modelo de IA, não coletados de pessoas reais — usando o Nemotron-4 340B Instruct (um modelo de linguagem grande, ou LLM, desenvolvido pela própria Nvidia). A empresa validou as personas com especialistas indianos em cultura e linguística para garantir que refletem adequadamente a realidade local, incluindo nuances regionais e variações no uso de cada idioma.

O lançamento faz parte de uma estratégia mais ampla chamada IA soberana, que defende que cada país ou região deve ter capacidade de desenvolver modelos próprios, treinados com dados locais e adaptados às suas necessidades. A Nvidia já oferece datasets semelhantes para outros mercados e vê a Índia como um dos principais alvos dessa abordagem, dado o tamanho da população, a diversidade linguística e o crescimento do setor de tecnologia no país.

Fonte original
Hugging Face Blog
Mais em · Pesquisa