Cloud/AI Governance/Confiabilidad de Herramientas
Confiabilidad de Herramientas
Cada herramienta que tu IA puede llamar, con nota: las más lentas ranqueadas con sus picos, las que fallan divididas en causas Agent, Upstream y Vinkius, y una matriz de latencia contra fallo de toda la superficie.
Una flota puede estar sana mientras una herramienta arrastra cada conversación por el barro en silencio. Tool Reliability es la pantalla que acaba con las conjeturas: cada herramienta que tus agentes pueden llamar, ranqueada dos veces, por lentitud y por fallo, con cada fallo atribuido a una causa. La línea de la propia consola: "See which tools are slowing everything down and which ones are failing silently. Ranked, diagnosed, and ready for you to act on."

Tool Reliability
See which tools are slowing everything down and which ones are failing silently. Ranked, diagnosed, and ready for you to act on.
Slowest Tools
Avg latency (amber) · max spike (red)Most Failing Tools
Stacked by Agent / Upstream / VinkiusHealth Matrix
Latency × Failure rate · bubble = call volumeSlowest Tools Detail
| Tool | Calls | API | Total | Max | Rate |
|---|---|---|---|---|---|
| search_documents | 412 | 512ms | 823ms | 1682ms | 2.2% |
| create_issue | 386 | 448ms | 761ms | 1503ms | 1.8% |
| list_channels | 341 | 401ms | 704ms | 1412ms | 1.5% |
| get_user_profile | 298 | 372ms | 655ms | 1341ms | 1% |
| send_notification | 264 | 338ms | 592ms | 1204ms | 0.8% |
| update_task | 231 | 305ms | 531ms | 1086ms | 1.7% |
| query_database | 208 | 271ms | 478ms | 967ms | 0.5% |
| upload_file | 187 | 238ms | 413ms | 854ms | 1.1% |
| delete_record | 156 | 205ms | 352ms | 728ms | 0.6% |
| sync_calendar | 124 | 168ms | 297ms | 601ms | 0% |
Most Failing Tools Detail
| Tool | Calls | Errors | Agent | Upstream | Rate |
|---|---|---|---|---|---|
| search_documents | 412 | 28 | 20 | 7 | 6.8% |
| create_issue | 386 | 24 | 17 | 6 | 6.2% |
| list_channels | 341 | 19 | 13 | 5 | 5.6% |
| get_user_profile | 298 | 15 | 10 | 4 | 4.9% |
| send_notification | 264 | 11 | 8 | 3 | 4.1% |
| update_task | 231 | 9 | 6 | 2 | 3.9% |
| query_database | 208 | 7 | 5 | 2 | 3.4% |
| upload_file | 187 | 5 | 3 | 1 | 2.7% |
| delete_record | 156 | 3 | 2 | 1 | 1.9% |
| sync_calendar | 124 | 0 | 0 | 0 | 0% |
El mockup se ejecuta con el Sample Data de la consola. En un plan de pago la misma pantalla califica tus herramientas en vivo, por organización.
Los cuatro contadores
- Tool Calls con la tasa de éxito derivada: la salud de toda la superficie de herramientas en un número.
- Unique Tools activas en el período, así sabes cuán ancha es la superficie evaluada.
- Avg Latency con la división de siempre: la parte esmeralda es la API upstream, la parte ámbar es el overhead de Vinkius. La lentitud de una herramienta casi nunca es el proxy.
- Total Errors, en rojo en cuanto existen, con la división en tres debajo: Agent (4xx, culpa de quien llama), Upstream (5xx, el proveedor) y Vinkius (lanzado por el propio proxy).
Los dos rankings
Slowest Tools ordena las herramientas por latencia media, y cada barra lleva su pico máximo como un punto rojo: una herramienta puede promediar 300ms y aun así superar un segundo a las 2 de la madrugada, y este gráfico se niega a esconderlo. Esta es la lista para llevar a quien sea dueño del Connector.
Most Failing Tools ordena por recuento de errores, y cada barra está apilada por causa: ámbar para errores de Agent, rojo para Upstream, violeta para Vinkius. La pila te dice de quién es el problema antes incluso de abrir la tabla. Una herramienta que falla sobre todo en errores de Agent suele significar un problema de scope o de parámetros del lado de quien llama; sobre todo Upstream significa que el proveedor es inestable; cualquier porción violeta significa que el proxy interceptó algo y lo dijo.
La Health Matrix
El tercer gráfico traza cada herramienta como una burbuja: latencia en un eje, tasa de fallo en el otro, el tamaño de la burbuja es el volumen de llamadas. La esquina superior derecha es la zona de peligro, una herramienta lenta que falla a menudo; una burbuja grande ahí es tu próximo incidente, y la matriz es donde lo ves formarse.
Las dos tablas de detalle
Slowest Tools Detail da a cada herramienta lenta sus llamadas, la división de latencia API / Overhead / Total y el pico máximo. Most Failing Tools Detail da a cada herramienta que falla su recuento y tasa de errores, repartidos en las columnas Agent / Upstream / Vinkius, así el diagnóstico llega junto con el número. Las dos tablas son clicables hasta el detalle de la herramienta, y los dos estados vacíos son los de la propia consola: "No tool performance data recorded in this period." y "No tool error data recorded in this period."
Del síntoma al dueño
El enlace Details de la Tool Health Matrix de Mission Control te deja aquí. Desde una herramienta que falla, la siguiente parada es Request Failures para ver los requests reales que se rompieron, y la configuración de Connector Policy es donde una herramienta abusada repetidamente pasa a ser limitada. Esta pantalla convierte "la IA va lenta" en: esta herramienta, este servidor, esta latencia, esta causa, este dueño.