Nova técnica permite treinar modelos de IA com textos de um milhão de palavras de uma só vez
Hugging Face apresenta método que distribui o processamento de contextos gigantescos entre várias GPUs, abrindo caminho para IAs que entendem documentos inteiros.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e usam modelos de inteligência artificial) anunciou uma técnica chamada Ulysses Sequence Parallelism que permite treinar modelos de linguagem com contextos de até um milhão de tokens (pedaços de texto que equivalem, grosso modo, a três quartos de uma palavra cada). Para ter ideia do que isso significa: um romance inteiro costuma ter entre 80 mil e 120 mil tokens — ou seja, a técnica permite que um modelo processe vários livros de uma vez só antes de dar uma resposta.
O problema que a Ulysses resolve é simples: quanto maior o texto que você quer que uma IA entenda de uma vez (o chamado "contexto"), mais memória e poder de processamento ela exige. Modelos atuais travam ou ficam lentos demais quando o contexto passa de algumas dezenas de milhares de tokens. A solução proposta divide esse contexto gigantesco entre várias GPUs (os chips especializados que fazem os cálculos da IA) de um jeito inteligente: cada GPU processa um pedaço do texto, mas todas trocam informações entre si para que o modelo continue "enxergando" o texto inteiro.
A técnica usa algo chamado ring attention (atenção em anel), um método em que as GPUs ficam organizadas em círculo e vão passando partes do texto umas para as outras enquanto trabalham. Isso evita que uma única GPU precise guardar o texto todo na memória. Segundo a Hugging Face, o Ulysses consegue escalar de forma quase linear: se você dobra o número de GPUs, o contexto que consegue processar também dobra, sem perder muito desempenho.
A técnica já está disponível como código aberto e foi testada com modelos de até 7 bilhões de parâmetros (os "pesos" internos que definem como a IA funciona). Entre as aplicações práticas, estão a análise de contratos jurídicos imensos, a leitura de bases de código inteiras de uma empresa ou a compreensão de prontuários médicos completos de um paciente. Até agora, modelos comerciais costumam se limitar a contextos de 32 mil a 200 mil tokens — o Ulysses empurra esse limite muito além, mas ainda exige uma infraestrutura cara de várias GPUs trabalhando juntas.


