Pular para o conteúdo
Zenteck
Últimas
Automação

Nvidia SoL-Pi: Como cortar custos de tokens em agentes de IA

Por Alex da Cruz2 min de leitura0 comentário
nvidia-sol-pi-cortar-custos-tokens-agentes-ia
A

Alex da Cruz

Alex da Cruz é desenvolvedor full-stack em São Paulo. Trabalha com React, TypeScript e automação, e usa inteligência artificial no dia a dia para resolver problemas reais de código e de operação — não como demonstração. Já tocou uma operação de e-commerce de ponta a ponta e hoje constrói e mantém o pipeline de automação por trás deste blog. Escreve aqui sobre o que testa de fato.

Ver perfil →

Executar agentes de IA autônomos por longos períodos faz com que o consumo de tokens dispare rapidamente à medida que previsões viram longas correntes de raciocínio. Segundo pesquisadores da Nvidia, o desperdício muitas vezes não está no modelo em si, mas na camada de controle que gerencia como o agente interage com o ambiente.

Quais mecanismos o SoL-Pi usa para eliminar o desperdício?

A equipe da Nvidia desenvolveu um sistema automatizado que analisa execuções anteriores e implementa quatro estratégias de otimização na estrutura de controle:

  • Action Fusion: Une duas etapas consecutivas, como uma edição de código seguida de um teste, eliminando uma chamada inteira ao modelo de linguagem.
  • Online Context Compact: Limpa o contexto acumulado após cada etapa de planejamento sem perder informações essenciais.
  • ObservationPack: Arquiva saídas longas de ferramentas e insere um resumo curto nas etapas seguintes.
  • Evidence-Preserving Reducer: Envia logs extensos de erro para um modelo mais barato que resume os achados principais, verificando se nenhuma pista crítica foi perdida.

A variante mais eficiente que combina essas quatro abordagens consome 49% menos tokens e mantém 93,7% da pontuação original no benchmark EdgeBench.

Qual é a economia financeira prática para equipes?

Em termos práticos, o custo de uma bateria de testes caiu de US$ 1.339 para US$ 894. Os autores estimam uma economia de US$ 8,75 a US$ 13,50 por hora em comparação com os harnesses nativos do Codex e do Claude Code.

Ainda assim, existem concessões operacionais. Contextos mais curtos podem reduzir o aproveitamento do cache de prompts, e os ganhos variam conforme a complexidade do benchmark escolhido para a tarefa.

Fontes

  1. Nvidia's SoL-Pi system cuts coding agent token usage nearly in half by optimizing the harness — the-decoder.com

Perguntas frequentes

O que faz o sistema SoL-Pi da Nvidia?
O SoL-Pi otimiza automaticamente a camada de controle entre o modelo de IA e seu ambiente de trabalho, reduzindo o uso de tokens em até 49%.
Quanto é possível economizar com o SoL-Pi?
A estimativa aponta uma economia de US$ 8,75 a US$ 13,50 por hora em relação aos harnesses padrão do Codex e do Claude Code.
Há perda de desempenho ao comprimir o contexto?
A variante eficiente mantém cerca de 93,7% da pontuação original nos testes, embora reduções drásticas de contexto possam afetar o uso de cache de prompts.