Cloud/AI Governance/FinOps-Wächter

FinOps-Wächter

Frag die KI über Vinkius

The cost guard of your fleet: cap array responses, compress tool schemas, set your cost attribution rate and let the policies pay you back on every request before your budget notices.

FinOps Guard ist die Richtlinien-Seite der Geldgeschichte. AI Spend zeigt, was Sie ausgegeben haben; dieser Bildschirm entscheidet, wie viel Sie danach ausgeben. Seine Regel, in den Worten der Konsole: "Apply response and payload controls before requests reach your budget limits."

R

Cost Guard

Apply response and payload controls before requests reach your budget limits.

Max Array Items50 items
5
55
105
155
205
255
305
355
405
500

Truncates array responses after this many items

Toon Compression

Compress tool descriptions to reduce token overhead from schema definitions.

Cost attribution rate

Estimated cost per 1M tokens (USD), used to calculate spending in analytics.

These defaults are inherited by new servers. Each server can override these settings individually from its detail page.

Documentation
FinOps Guard, live. The real cost editor: drag the Max Array Items slider across its ten ticks, flip Toon Compression and set your cost attribution rate. Console defaults, as shipped.

Das Mockup ist der echte Editor: Ziehen Sie den Slider oder klicken Sie ihn an, schalten Sie Toon Compression um, ändern Sie die Rate. Die Standardwerte sind die der Konsole: 50 Items, Kompression aus, $3 pro Million Tokens.

Max Array Items: das Budget-Limit für dicke Antworten

Der Slider steuert eine Zahl mit überproportionaler Wirkung: "Truncates array responses after this many items." Eine Upstream-API, die eine Suche mit 400 Zeilen beantwortet, antwortet künftig mit 50 (oder dem, was Sie festlegen), begrenzt von 5 bis 500 mit zehn Markierungen. Alles über dem Limit erreicht das Modell nie und kostet Sie also nie Tokens, und die Antwort bleibt schnell. Das ist der Mechanismus hinter dem Cost Saved-Zähler, den AI Spend und Security Posture anzeigen: Jede Trunkierung, die dieser Slider autorisiert, ist Geld zurück.

Toon Compression: kleinere Schemas, dieselben Tools

Ein Switch mit einer präzisen Aufgabe: "Compress tool descriptions to reduce token overhead from schema definitions." Jeder Connector exponiert seine Tools mit Schemadefinitionen, und diese Schemas reisen bei jedem Aufruf im Kontext mit. Die Kompression verkleinert diesen Overhead und hält die Tools aufrufbar; für Flotten mit vielen Connectors ist das ein dauerhafter Rabatt auf jeden einzelnen Request.

Cost attribution rate: bepreisen Sie Ihren Traffic auf Ihre Weise

Das Zahlenfeld legt die "Estimated cost per 1M tokens (USD), used to calculate spending in analytics." fest. Der Standardwert ist $3.00; weicht der Preis Ihres Modells ab, setzen Sie Ihren eigenen, und jede Dollarzahl in den Reports (Estimated Cost, FinOps Savings, Cost per Request, FinOps ROI) rechnet auf Ihre Wirtschaftlichkeit um. Slider und Rate speichern sich beim Anpassen von selbst; kein Save-Button, den man vergessen kann.

Vererbung: Standardwerte jetzt, Ausnahmen später

Die Konsole schließt mit der Regel, die das im großen Maßstab beherrschbar hält: "These defaults are inherited by new servers. Each server can override these settings individually from its detail page." Legen Sie die Flotten-Baseline hier einmal fest und überschreiben Sie pro Connector nur dort, wo die Zahlen es rechtfertigen. Der Footer verlinkt die FinOps-Dokumentation der Konsole für die tiefen Regeln.