Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog1 min

Hugging Face simplifica como modelos de IA entendem texto

Plataforma reformulou a maneira como seus modelos dividem palavras em pedaços menores, tornando o processo mais transparente e fácil de personalizar.

Por Redação1 min
Compartilhar
Hugging Face simplifica como modelos de IA entendem texto
Ferramentas · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou uma reformulação completa no sistema de tokenização (o processo pelo qual um modelo de inteligência artificial divide textos em pedaços menores para conseguir processá-los) usado em seus Transformers (uma arquitetura de modelo muito popular para tarefas de linguagem). Segundo a empresa, a versão 5 torna o código mais simples, claro e modular, facilitando a vida de quem desenvolve ou adapta modelos de linguagem.

Na prática, tokenização é o primeiro passo para que um modelo entenda texto: palavras são fragmentadas em unidades básicas, chamadas tokens, que podem ser palavras inteiras, pedaços de palavras ou até caracteres individuais. A forma como isso é feito afeta diretamente a eficiência e a qualidade das respostas do modelo. Até agora, a implementação da Hugging Face cresceu de forma orgânica ao longo dos anos, acumulando complexidade e dificultando ajustes.

A nova versão separa melhor as responsabilidades: o código que processa o texto antes da tokenização (pré-processamento) ficou mais isolado, assim como as etapas de treinamento e aplicação de vocabulários. Isso significa que pesquisadores e empresas podem trocar apenas as partes que precisam modificar, sem mexer no sistema todo — útil especialmente para quem trabalha com idiomas menos comuns ou domínios técnicos específicos, como medicina ou direito.

A mudança também inclui melhorias na documentação e nos testes automatizados, reduzindo a chance de erros ao adaptar tokenizadores (os componentes que fazem a divisão em tokens) para novos casos de uso. A Hugging Face espera que a atualização facilite a entrada de novos colaboradores no projeto e acelere o desenvolvimento de modelos mais especializados. A versão já está disponível na biblioteca Transformers, que é código aberto e pode ser baixada gratuitamente.

Fonte original
Hugging Face Blog
Mais em · Ferramentas