MCP Fusion/Reference/Economia de tokens

Economia de tokens

Pergunte à IA sobre a Vinkius

Como o MCP Fusion reduz a conta de contexto: descrições TOON, limites de resposta, _select, agrupamento e compactação FSM, além do profiler que classifica o risco de inflação antes do deploy.

Cada nome de tool, descrição e schema é contexto pelo qual o modelo paga em cada turno de planejamento. Cada campo de resposta é contexto pelo qual ele paga em cada observação. O MCP Fusion trata ambos como um orçamento, com recursos que gastam de forma deliberada e um profiler que encontra os vazamentos.

Descrições: TOON

.toonDescription() substitui a descrição em prosa por uma forma tabular delimitada por pipes, gerada a partir do schema da ação:

billing actions|desc|required
get_invoice|Retrieve an invoice by ID|id
refund|Refund an invoice|id,amount_cents
list_invoices|List the tenant invoices|-

O agente lê uma tabela usando aproximadamente metade dos tokens da mesma informação em frases. Ela é gerada a partir do schema, portanto não pode divergir: mude um campo obrigatório e a tabela muda.

Respostas: limit, select, grupos

Três alavancas, em ordem de impacto:

.agentLimit(max) limita uma coleção e, quando a trunca, injeta um primeiro bloco corretivo:

📊 Summary: Dataset truncated. 50 shown, 4200 hidden. Use filters to narrow results.

O modelo recebe a informação do que aconteceu e do que fazer, em vez de raciocinar silenciosamente sobre uma lista parcial.

.enableSelect() adiciona um argumento _select cujo enum é a união dos campos do schema raiz. O bloco de dados envia apenas os campos solicitados, enquanto blocos de UI e regras continuam vendo o objeto completo. Um modelo amplo de invoice se torna uma resposta de cinco campos quando a pergunta era pequena.

Agrupamento troca o tamanho do schema pela quantidade de nomes: um namespace de doze ações vira uma tool com um discriminador, e o menu diminui de acordo. Consulte Exposição de tools.

.toonSuccess(data) aplica a mesma codificação tabular a uma resposta de coleção uniforme, colapsando chaves repetidas em uma única linha de cabeçalho.

Compactação FSM

Um conector vinculado a estado pode enviar uma compactDescription() enquanto a máquina está no estado inicial e revelar a descrição completa depois. O menu que o agente lê no início do workflow é menor que aquele lido onde vivem as ações de risco. Consulte Gating de estado FSM.

O profiler

O framework fornece um analisador estático porque a inflação da resposta fica invisível até a conta chegar. profileResponse divide uma resposta em blocos de payload e overhead, calcula overheadRatio e classifica o risco:

EstimativaRisco
até ~1000 tokensbaixo
até ~4000médio
até ~8000alto
acima dissocrítico

com alertas como COGNITIVE OVERLOAD, HIGH TOKEN DENSITY e OVERHEAD WARNING, com teto padrão de overhead em torno de 30% da resposta. O mesmo módulo classifica o risco de inflação estático de uma tool a partir do schema: uma coleção sem limite com mais de dez campos é crítica, uma coleção sem limite sozinha é alta e mais de vinte campos é média. Essa classificação é gravada no lockfile de capacidades, o que faz uma regressão de inflação falhar no CI em vez de ser enviada silenciosamente. Consulte Contratos.

As estimativas de tokens usam a heurística padrão de aproximadamente um token por 3,5 caracteres em texto semelhante a JSON. Ela é precisa o bastante para comparar variantes e nunca é apresentada como uma contagem do provedor.

Ordem das operações do orçamento

  1. Agrupe ações para manter o menu pequeno
  2. Ative _select para entidades amplas
  3. Defina .agentLimit() em toda coleção
  4. Use .toonDescription() e .toonSuccess() para formas uniformes
  5. Compacte descrições nos estados FSM que não precisam da história completa
  6. Execute o profiler no CI e trate uma escalada de risco como regressão

Próximos passos