Cloud Platform
Manage your globally distributed AI cloud infrastructure.
Model Deployments
4
all
active
scaling
deploying
idle
failed
| Name | Model | Cluster | Replicas | GPU Alloc | Autoscale | Latency (p50/p99) | RPM | Tokens Today | Cost Today | Status | Endpoint |
|---|---|---|---|---|---|---|---|---|---|---|---|
| deepseek-v4-pro-prod | DeepSeek V4 Pro | prod-inference-us | 3 (2-8) | 4 | latency @ 200 | 142ms / 387ms | 1.2K | 48.7M | $34.09 | active | https://prod-us.osi-cloud.internal:8443/v1/deepseek-v4-pro |
| kimi-k3-longctx | Kimi K3 (1M Context) | prod-inference-us | 2 (1-4) | 2 | queue_depth @ 10 | 310ms / 890ms | 320 | 12.4M | $7.44 | active | https://prod-us.osi-cloud.internal:8443/v1/kimi-k3 |
| deepseek-v4-flash-eu | DeepSeek V4.1 Flash | prod-inference-eu | 2 (1-6) | 2 | utilization @ 75 | 68ms / 195ms | 2.1K | 31.2M | $4.99 | active | https://prod-eu.osi-cloud.internal:8443/v1/deepseek-v4-flash |
| qwen-coder-staging | Qwen 2.5 Coder 32B | staging-dev | 1 (0-2) | 1 | latency @ 300 | 0ms / 0ms | 0 | 0 | $0.00 | idle | https://staging.osi-cloud.internal:8443/v1/qwen-coder |