| Model routing |
| Coinbase |
Routing + caching + lean context windows |
Eliminated hard caps by relying on usage visibility instead |
| OpenAI (ChatGPT) |
Auto model switching built into GPT-5 |
Product routes simpler tasks to lighter models automatically |
| OpenRouter |
Preference-based routing (cost vs quality slider) |
~33% of traffic to Gemini Flash Lite vs ~10% to GPT-5.5 |
| Palantir Evolve |
Prompt rewriting + routing + deduplication |
97% cost cut on one customer task (GPT-5.1 → GPT-5.4 Nano) |
| McCarthy Building |
Palantir Evolve (model shift) |
60% drop in token use this quarter |
| Arcee AI |
DIY router using DeepSeek V4 Flash |
Cheap model picks which model to use — comparable to commercial routers |
| Visibility & controls |
| Smartsheet |
Dedicated FinOps team + dashboards |
Automated alerts before teams hit limits; real-time dept/manager breakdown |
| Meta |
AI Gateway dashboard + shift to MetaCode |
Team- and individual-level budgets; automatic spike alerts |
| Qualcomm |
Hard caps + show-back + on-prem hardware |
Engineering capped; lighter tasks run on own hardware at lower cost |
| Uber |
Hard annual budgets + consumption monitoring |
Resolved surprise overages from third-party API spend |