Skip to main content
GET
See the Metrics guide for more info.

Path Parameters

string
required
The unique identifier for your organization (e.g., org_abc123)

Response

Returns metrics in Prometheus text-based exposition format.

Available Metrics

The following metrics are available on an opt-in basis. Contact your Cerebras account representative to enable specific metrics for your organization.

Endpoint Health

gauge
Status of inference endpointValues:
  • -1 = Error calculating status
  • 0 = Down
  • 1 = Up

Request Metrics

gauge
Total request count (all HTTP codes) in the last complete minute
gauge
Total successful requests (HTTP 200) in the last complete minute
gauge
Total failed requests by HTTP code in the last complete minute

Token Metrics

gauge
Total input tokens for successful requests in the last complete minute
gauge
Total output tokens for successful requests in the last complete minute
gauge
Total input tokens read from cache for successful requests in the last complete minute
gauge
Ratio of input tokens read from cache, to total input tokens, for successful requests in the last complete minute

Latency Metrics

gauge
Queue time percentiles in seconds for successful requests (avg/p50/p90/p95/p99) (e.g. time a request spends waiting for resources at runtime)
gauge
End-to-end API latency percentiles in seconds for successful requests (avg/p50/p90/p95/p99). Includes overall latency from requests received at the API gateway to the response output from API gateway, inclusive of latency_generation_seconds.
gauge
Time To First Token percentiles in seconds for successful requests (avg/p50/p90/p95/p99)
gauge
Time per output tokens percentiles (avg/p50/p90/p95/p99), excluding time to first token, averaged across successful requests
gauge
Time to generate all output tokens (e.g. time from last prompt to last output token) percentiles in seconds for successful requests (avg/p50/p90/p95/p99)

Error Codes

For information about possible error responses, see the Error Codes documentation.