Broker / Code asincrone
inference-broker
In coda (alta+bassa)
--
queued
Worker attivi
--
high + low
Spill cloud
--
% job → *-cloud
Job falliti
--
% sul totale
Profondità code (queued) — alta vs bassa
Throughput & spill (job/min)
Gateway LiteLLM
on-prem primario · cloud overflow
Requests / min
--
tutti gli alias
p95 latency
--
richiesta totale
Fallback rate
--
primario → cloud
Error rate
--
5xx + timeout
Backend & target
Last refresh: -- | Auto-refresh: 30s |
Datasource: Prometheus astra7031