Cloud/AI Governance/FinOps Guard
FinOps Guard
O guarda de custos da sua frota: limite respostas de array, comprima schemas de ferramentas, defina sua taxa de atribuição de custo e deixe as políticas te devolverem dinheiro a cada request antes que o orçamento sinta.
FinOps Guard é o lado de políticas da história do dinheiro. AI Spend mostra o que você gastou; esta tela decide quanto você gasta a seguir. A regra dela, nas palavras do console: "Apply response and payload controls before requests reach your budget limits."

Cost Guard
Apply response and payload controls before requests reach your budget limits.
Truncates array responses after this many items
Toon Compression
Compress tool descriptions to reduce token overhead from schema definitions.
Cost attribution rate
Estimated cost per 1M tokens (USD), used to calculate spending in analytics.
These defaults are inherited by new servers. Each server can override these settings individually from its detail page.
O mockup é o editor real: arraste ou clique no slider, ligue o Toon Compression, mude a taxa. Os padrões são os do console: 50 itens, compressão desligada, $3 por milhão de tokens.
Max Array Items: o teto de orçamento para respostas gordas
O slider controla um número de impacto desproporcional: "Truncates array responses after this many items." Uma API upstream que responde uma busca com 400 linhas passa a responder 50 (ou o que você definir), limitado de 5 a 500 com dez marcas. Tudo além do teto nunca chega ao modelo, então nunca te custa tokens, e a resposta continua rápida. Este é o mecanismo por trás do contador Cost Saved que AI Spend e Security Posture exibem: cada truncamento que este slider autoriza é dinheiro de volta.
Toon Compression: schemas menores, mesmas ferramentas
Um switch com trabalho preciso: "Compress tool descriptions to reduce token overhead from schema definitions." Todo conector expõe suas ferramentas com definições de schema, e esses schemas viajam no contexto a cada chamada. A compressão encolhe esse overhead mantendo as ferramentas chamáveis; para frotas com muitos conectores é um desconto permanente em cada request.
Cost attribution rate: precifique seu tráfego do seu jeito
O campo numérico define a "Estimated cost per 1M tokens (USD), used to calculate spending in analytics." O padrão é $3.00; se o preço do seu modelo for outro, defina o seu e cada figura em dólares dos Reports (Estimated Cost, FinOps Savings, Cost per Request, FinOps ROI) converte para a sua economia. O slider e a taxa salvam enquanto você ajusta; não existe botão de salvar para esquecer.
Herança: padrões agora, exceções depois
O console fecha com a regra que mantém isso gerenciável em escala: "These defaults are inherited by new servers. Each server can override these settings individually from its detail page." Defina a linha de base da frota uma vez aqui e sobreponha por Connector só onde os números justificam. O rodapé leva à documentação de FinOps do console para as regras profundas.