MCP Fusion/Reference/Economia de tokens
Economia de tokens
Como o MCP Fusion reduz a conta de contexto: descrições TOON, limites de resposta, _select, agrupamento e compactação FSM, além do profiler que classifica o risco de inflação antes do deploy.
Cada nome de tool, descrição e schema é contexto pelo qual o modelo paga em cada turno de planejamento. Cada campo de resposta é contexto pelo qual ele paga em cada observação. O MCP Fusion trata ambos como um orçamento, com recursos que gastam de forma deliberada e um profiler que encontra os vazamentos.
Descrições: TOON
.toonDescription() substitui a descrição em prosa por uma forma tabular delimitada por pipes, gerada a partir do schema da ação:
billing actions|desc|required
get_invoice|Retrieve an invoice by ID|id
refund|Refund an invoice|id,amount_cents
list_invoices|List the tenant invoices|-O agente lê uma tabela usando aproximadamente metade dos tokens da mesma informação em frases. Ela é gerada a partir do schema, portanto não pode divergir: mude um campo obrigatório e a tabela muda.
Respostas: limit, select, grupos
Três alavancas, em ordem de impacto:
.agentLimit(max) limita uma coleção e, quando a trunca, injeta um primeiro bloco corretivo:
📊 Summary: Dataset truncated. 50 shown, 4200 hidden. Use filters to narrow results.O modelo recebe a informação do que aconteceu e do que fazer, em vez de raciocinar silenciosamente sobre uma lista parcial.
.enableSelect() adiciona um argumento _select cujo enum é a união dos campos do schema raiz. O bloco de dados envia apenas os campos solicitados, enquanto blocos de UI e regras continuam vendo o objeto completo. Um modelo amplo de invoice se torna uma resposta de cinco campos quando a pergunta era pequena.
Agrupamento troca o tamanho do schema pela quantidade de nomes: um namespace de doze ações vira uma tool com um discriminador, e o menu diminui de acordo. Consulte Exposição de tools.
.toonSuccess(data) aplica a mesma codificação tabular a uma resposta de coleção uniforme, colapsando chaves repetidas em uma única linha de cabeçalho.
Compactação FSM
Um conector vinculado a estado pode enviar uma compactDescription() enquanto a máquina está no estado inicial e revelar a descrição completa depois. O menu que o agente lê no início do workflow é menor que aquele lido onde vivem as ações de risco. Consulte Gating de estado FSM.
O profiler
O framework fornece um analisador estático porque a inflação da resposta fica invisível até a conta chegar. profileResponse divide uma resposta em blocos de payload e overhead, calcula overheadRatio e classifica o risco:
| Estimativa | Risco |
|---|---|
| até ~1000 tokens | baixo |
| até ~4000 | médio |
| até ~8000 | alto |
| acima disso | crítico |
com alertas como COGNITIVE OVERLOAD, HIGH TOKEN DENSITY e OVERHEAD WARNING, com teto padrão de overhead em torno de 30% da resposta. O mesmo módulo classifica o risco de inflação estático de uma tool a partir do schema: uma coleção sem limite com mais de dez campos é crítica, uma coleção sem limite sozinha é alta e mais de vinte campos é média. Essa classificação é gravada no lockfile de capacidades, o que faz uma regressão de inflação falhar no CI em vez de ser enviada silenciosamente. Consulte Contratos.
As estimativas de tokens usam a heurística padrão de aproximadamente um token por 3,5 caracteres em texto semelhante a JSON. Ela é precisa o bastante para comparar variantes e nunca é apresentada como uma contagem do provedor.
Ordem das operações do orçamento
- Agrupe ações para manter o menu pequeno
- Ative
_selectpara entidades amplas - Defina
.agentLimit()em toda coleção - Use
.toonDescription()e.toonSuccess()para formas uniformes - Compacte descrições nos estados FSM que não precisam da história completa
- Execute o profiler no CI e trate uma escalada de risco como regressão
Próximos passos
- Formato de wire: quanto custa cada bloco
- Contratos: o lockfile que fixa o orçamento
- Exposição de tools: mecânica de agrupamento
