Nvidia SoL-Pi: Como cortar custos de tokens em agentes de IA

Alex da Cruz
Alex da Cruz é desenvolvedor full-stack em São Paulo. Trabalha com React, TypeScript e automação, e usa inteligência artificial no dia a dia para resolver problemas reais de código e de operação — não como demonstração. Já tocou uma operação de e-commerce de ponta a ponta e hoje constrói e mantém o pipeline de automação por trás deste blog. Escreve aqui sobre o que testa de fato.
Executar agentes de IA autônomos por longos períodos faz com que o consumo de tokens dispare rapidamente à medida que previsões viram longas correntes de raciocínio. Segundo pesquisadores da Nvidia, o desperdício muitas vezes não está no modelo em si, mas na camada de controle que gerencia como o agente interage com o ambiente.
Quais mecanismos o SoL-Pi usa para eliminar o desperdício?
A equipe da Nvidia desenvolveu um sistema automatizado que analisa execuções anteriores e implementa quatro estratégias de otimização na estrutura de controle:
- Action Fusion: Une duas etapas consecutivas, como uma edição de código seguida de um teste, eliminando uma chamada inteira ao modelo de linguagem.
- Online Context Compact: Limpa o contexto acumulado após cada etapa de planejamento sem perder informações essenciais.
- ObservationPack: Arquiva saídas longas de ferramentas e insere um resumo curto nas etapas seguintes.
- Evidence-Preserving Reducer: Envia logs extensos de erro para um modelo mais barato que resume os achados principais, verificando se nenhuma pista crítica foi perdida.
A variante mais eficiente que combina essas quatro abordagens consome 49% menos tokens e mantém 93,7% da pontuação original no benchmark EdgeBench.
Qual é a economia financeira prática para equipes?
Em termos práticos, o custo de uma bateria de testes caiu de US$ 1.339 para US$ 894. Os autores estimam uma economia de US$ 8,75 a US$ 13,50 por hora em comparação com os harnesses nativos do Codex e do Claude Code.
Ainda assim, existem concessões operacionais. Contextos mais curtos podem reduzir o aproveitamento do cache de prompts, e os ganhos variam conforme a complexidade do benchmark escolhido para a tarefa.
Fontes
Perguntas frequentes
- O que faz o sistema SoL-Pi da Nvidia?
- O SoL-Pi otimiza automaticamente a camada de controle entre o modelo de IA e seu ambiente de trabalho, reduzindo o uso de tokens em até 49%.
- Quanto é possível economizar com o SoL-Pi?
- A estimativa aponta uma economia de US$ 8,75 a US$ 13,50 por hora em relação aos harnesses padrão do Codex e do Claude Code.
- Há perda de desempenho ao comprimir o contexto?
- A variante eficiente mantém cerca de 93,7% da pontuação original nos testes, embora reduções drásticas de contexto possam afetar o uso de cache de prompts.
Comentários
0 comentário
Seja o primeiro a comentar.
Continue Lendo

Manus 2.0: controle móvel, edição de vídeo e agentes
Manus 2.0 adiciona controle remoto via celular, edição de vídeo, hospedagem de jogos e reduz custos operacionais em 32 por cento.

Shopify libera checkout para agentes de IA no navegador
A Shopify agora permite que agentes de IA no navegador concluam compras no checkout usando ferramentas estruturadas do WebMCP.

Meta Muse: Computador Ubuntu na nuvem para cada usuário
O agente Muse da Meta fornece um computador Ubuntu Linux completo na nuvem para cada usuário, combinando autonomia técnica e isolamento.