PUBLICIDADE

SoL-Pi: NVIDIA, NTU e MIT cortam quase metade do tráfego de tokens em agentes de codificação sem perder desempenho

22/09/2026
10 visualizações
4 min de leitura
Imagem principal do post

NVIDIA, NTU e MIT lançam SoL-Pi, conjunto de mecanismos que reduz tráfego de tokens em agentes de codificação

Pesquisadores da NVIDIA, em parceria com a Universidade Tecnológica de Nanyang e o MIT, divulgaram o SoL-Pi, um conjunto de quatro mecanismos de eficiência projetados para o agente de codificação de código aberto Pi. A proposta surgiu de ciclos automatizados de pesquisa conduzidos por uma inteligência artificial na camada de harness, o componente intermediário que gerencia chamadas de ferramentas, contexto, observações e delegações de um agente.

Imagem complementar

O trabalho parte de uma constatação simples: agentes de codificação atuais funcionam por horas, e cada edição, execução de teste ou leitura de log alimenta o contexto do modelo. Isso gera um volume elevado de tokens processados. Os pesquisadores buscaram reduzir justamente essa quantidade, em vez de apenas otimizar kernels, quantização ou o preço por token.

PUBLICIDADE

No benchmark EdgeBench, composto por 51 tarefas, o SoL-Pi reduziu o tráfego de tokens registrados entre 44,7% e 49,0% em comparação ao Pi original, com queda aproximada de 33% no custo de API. Os escores de desempenho permaneceram próximos aos do Pi tanto no modelo GPT-5.6 Sol quanto no Opus 5.

A descoberta dos quatro mecanismos não foi feita manualmente. Um agente de pesquisa observou rastros de execução de uma versão base do Pi e propôs alterações no harness, testando cada uma delas. O escopo da busca foi amplo: 152 direções propostas, distribuídas em seis famílias — contexto, progresso, ferramentas, delegação, prompt e política, além de melhoria e verificação. Ao todo, foram utilizados 535 ambientes executáveis, sendo 495 construídos a partir de pares de issues e pull requests do GitHub e 40 tarefas sintéticas com verificadores executáveis. A busca envolveu mais de 3 mil execuções e mais de 60 mil interações entre agente e ambiente.

Cada ciclo de busca funcionou de forma isolada, com regras de aceitação fixadas antes do início e que não podiam ser alteradas pelo otimizador. Toda métrica de capacidade precisava permanecer dentro de uma tolerância pré-declarada, e o candidato só era aceito se melhorasse pelo menos uma métrica de eficiência. O EdgeBench foi mantido fora da busca, com 11 tarefas usadas para aceitação unidirecional de candidatos congelados e 40 para avaliação final.

Os quatro mecanismos que sobreviveram ao processo foram batizados de Action Fusion, Online Context Compact, ObservationPack e Evidence-Preserving Reducer. O Action Fusion combina em uma única solicitação a edição de um arquivo e o comando subsequente de teste ou execução, devolvendo os dois resultados em uma observação só, o que elimina uma rodada extra de comunicação. O Online Context Compact acompanha o progresso do plano e estima quantas requisições ainda restam, acionando a compactação nativa do Pi quando a economia projetada compensa o custo de reescrever o cache de prompt.

Já o ObservationPack armazena localmente as saídas de ferramentas maiores que 10 KiB e as envia completas nas duas primeiras requisições seguintes ao provedor, exibindo ao modelo apenas um identificador estável, o tamanho original e um pequeno trecho das linhas iniciais e finais. O Evidence-Preserving Reducer envia logs de build e teste com pelo menos 4 KiB a um modelo mais barato, o GPT-5.6 Luna em modo high, que produz um recibo compacto. Um verificador determinístico confere o esquema, o hash da fonte, o status de saída, citações exatas e o tamanho. O sistema retorna ao log original caso a validação não seja bem-sucedida, haja suspeita de credenciais ou o recibo não seja menor que o original.

Nos testes, o SoL-Pi preservou 94,3% do escore do Pi no Opus 5, com queda de 44,7% no tráfego de tokens e 33,5% no custo de API. No GPT-5.6 Sol, manteve 93,7% do escore, com redução de 49,0% nos tokens e 33,2% no custo. A configuração de melhor desempenho em cada backend usou apenas o mecanismo mais eficaz: ObservationPack no GPT-5.6 Sol e Action Fusion no Opus 5, elevando os escores em 5,3% e 12,8% acima do Pi, respectivamente.

Além do EdgeBench, os pesquisadores testaram o sistema em outras avaliações. No Terminal-Bench 4, com 63 tarefas apenas de CPU, o SoL-Pi resolveu 15 tarefas, contra 18 do Codex e do Pi, mas reduziu o custo total em 26,3% na comparação com o Pi. Na IMO 2026, com verificação em Lean 4, o SoL-Pi passou em três dos seis problemas, igualando o Pi com o menor custo por problema resolvido. O Codex passou em cinco.

A versão disponível é uma extensão do Pi sob licença MIT, publicada no GitHub sob o nome NVlabs e compatível com o Pi 0.85.1 e Node.js 22.19 ou superior, sem necessidade de alterar a instalação original. Os próprios pesquisadores classificam a transferência entre modelos como preliminar, já que os mecanismos foram ativados com menos frequência no Opus 5, possivelmente porque a busca utilizou apenas trajetórias do GPT-5.6 Sol.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!