基礎設施與開發工具
AI推理成本被拆分的時代,誰來決定路由
發布日期: 2026-05-23
要解決的問題
AI服務團隊推理成本占營收的30~60%,卻沒有任何單一儀表板能告訴他們每次請求應送往哪個模型、哪個晶片、哪個區域才最便宜。
為什麼是現在
Cerebras上市標誌著推理晶片真正多元化。從此以後,路由決策比廠商選擇更能影響成本結構。
推薦人才
有LLM API生產維運經驗的工程師,加上做過AWS或GCP成本分析工具的人
問題是什麼
AI服務營運團隊目前同時面對兩個問題。第一,推論成本已占營收的30~60%。第二,「將請求發往何處」的選擇已超越OpenAI對Anthropic的二選一。Cerebras上市後,Groq、SambaNova、Nvidia Inference Cloud、Together AI、Fireworks AI等選項爆炸性成長,同一模型在不同後端的延遲、成本與吞吐量都不同。
現有API閘道採靜態路由。低流量時期制定的規則在高峰期仍延用。然而單價按小時變動,晶片供應不穩定,而路由決策仍由人工每季手動調整。
為什麼是現在
Cerebras 660億美元的市值不僅是IPO成功,更是資本市場對「推論晶片多元化」的驗證。OpenAI、G42、MBZUAI、AWS已同時採用Cerebras。Anthropic、Google也將自研晶片(TPU、Trainium)對外開放。6個月內,路由決策將成為成本控制的最大槓桿。
另一個訊號:OpenAI在依賴Cerebras的同時自建資料中心。即使是全球最大的LLM公司也不會依賴單一供應商。小型團隊更需要工具來抽象多供應商營運的複雜度。
怎麼構建
flowchart LR
A[應用請求] --> B[路由SDK]
B --> C{策略引擎}
C -->|成本優先| D[Cerebras]
C -->|低延遲| E[Groq]
C -->|品質保證| F[Anthropic Claude]
C -->|批次任務| G[OpenAI Batch]
D & E & F & G --> H[可觀測層]
H --> I[成本與品質儀表板]
I --> C
MVP由三個元件構成:
- OpenAI相容SDK: 現有程式碼僅需替換一行即可接入路由層。
client = OpenAI()→client = MultiRouter() - 策略引擎: 根據請求元資料(模型、max_tokens、延遲預算、SLA等級)與即時單價表選擇後端。初期採規則驅動,資料累積後過渡到ML預測。
- 可觀測層: 依請求記錄實際延遲、成本與品質評分(透過eval API)。每季自動產生報表。
定價: 每100萬token路由$0.05~$0.10(底層支出的1~5%)。對月支出超過10萬美元的團隊ROI明確。
成功條件
- 核心假設: 後端之間價格差維持在30%以上。若Cerebras與Groq的早期積極定價持續,即可成立。
- 驗證方式: 5個Beta客戶免費試用一個月,後續按節省金額的20%收取佣金。若3個客戶月節省超過5000美元,市場就存在。
- 主要風險: 主流LLM廠商發布統一路由API並吸收此層。但避免單一供應商鎖定的需求,本質上屬於不同市場。
一起打造
查看合作人才