跳到正文
StartupXO 創業點子 · 新聞 · 人才
選單

快速連結

語言設定

基礎設施與開發工具

AI推理成本被拆分的時代,誰來決定路由

發布日期: 2026-05-23

LLMOpsinferencecost-optimizationmulti-vendorobservability

要解決的問題

AI服務團隊推理成本占營收的30~60%,卻沒有任何單一儀表板能告訴他們每次請求應送往哪個模型、哪個晶片、哪個區域才最便宜。

為什麼是現在

Cerebras上市標誌著推理晶片真正多元化。從此以後,路由決策比廠商選擇更能影響成本結構。

推薦人才

有LLM API生產維運經驗的工程師,加上做過AWS或GCP成本分析工具的人

問題是什麼

AI服務營運團隊目前同時面對兩個問題。第一,推論成本已占營收的30~60%。第二,「將請求發往何處」的選擇已超越OpenAI對Anthropic的二選一。Cerebras上市後,Groq、SambaNova、Nvidia Inference Cloud、Together AI、Fireworks AI等選項爆炸性成長,同一模型在不同後端的延遲、成本與吞吐量都不同。

現有API閘道採靜態路由。低流量時期制定的規則在高峰期仍延用。然而單價按小時變動,晶片供應不穩定,而路由決策仍由人工每季手動調整。

為什麼是現在

Cerebras 660億美元的市值不僅是IPO成功,更是資本市場對「推論晶片多元化」的驗證。OpenAI、G42、MBZUAI、AWS已同時採用Cerebras。Anthropic、Google也將自研晶片(TPU、Trainium)對外開放。6個月內,路由決策將成為成本控制的最大槓桿。

另一個訊號:OpenAI在依賴Cerebras的同時自建資料中心。即使是全球最大的LLM公司也不會依賴單一供應商。小型團隊更需要工具來抽象多供應商營運的複雜度。

怎麼構建

flowchart LR
    A[應用請求] --> B[路由SDK]
    B --> C{策略引擎}
    C -->|成本優先| D[Cerebras]
    C -->|低延遲| E[Groq]
    C -->|品質保證| F[Anthropic Claude]
    C -->|批次任務| G[OpenAI Batch]
    D & E & F & G --> H[可觀測層]
    H --> I[成本與品質儀表板]
    I --> C

MVP由三個元件構成:

  1. OpenAI相容SDK: 現有程式碼僅需替換一行即可接入路由層。client = OpenAI()client = MultiRouter()
  2. 策略引擎: 根據請求元資料(模型、max_tokens、延遲預算、SLA等級)與即時單價表選擇後端。初期採規則驅動,資料累積後過渡到ML預測。
  3. 可觀測層: 依請求記錄實際延遲、成本與品質評分(透過eval API)。每季自動產生報表。

定價: 每100萬token路由$0.05~$0.10(底層支出的1~5%)。對月支出超過10萬美元的團隊ROI明確。

成功條件

  • 核心假設: 後端之間價格差維持在30%以上。若Cerebras與Groq的早期積極定價持續,即可成立。
  • 驗證方式: 5個Beta客戶免費試用一個月,後續按節省金額的20%收取佣金。若3個客戶月節省超過5000美元,市場就存在。
  • 主要風險: 主流LLM廠商發布統一路由API並吸收此層。但避免單一供應商鎖定的需求,本質上屬於不同市場。