基础设施与开发工具
AI推理成本被拆分的时代,谁来决定路由
发布日期: 2026-05-23
要解决的问题
AI服务团队推理成本占营收的30~60%,却没有任何单一看板能告诉他们每次请求应送往哪个模型、哪个芯片、哪个区域才最便宜。
为什么是现在
Cerebras上市标志着推理芯片真正多元化。从今往后,路由决策比厂商选择更能影响成本结构。
推荐人才
有LLM API生产运维经验的工程师,加上做过AWS或GCP成本分析工具的人
问题是什么
AI服务运营团队目前同时面对两个问题。第一,推理成本已占到营收的30~60%。第二,“将请求发往何处”的选择已超越了简单的OpenAI对Anthropic二选一。Cerebras上市后,Groq、SambaNova、Nvidia Inference Cloud、Together AI、Fireworks AI等选项爆发,同一模型在不同后端的延迟、成本与吞吐量都存在差异。
现有API网关静态处理路由。低流量时期制定的规则在高流量时期仍在沿用。然而单价按小时变动,芯片供应不稳定,而路由决策仍由人工每季度一次手动调整。
为什么是现在
Cerebras 660亿美元的市值不仅是IPO成功,而是资本市场对”推理芯片多元化”的验证。OpenAI、G42、MBZUAI、AWS已在同时使用Cerebras。Anthropic、Google也将自研芯片(TPU、Trainium)向外开放。6个月内,路由决策将成为成本控制的最大杠杆。
另一个信号:OpenAI依赖Cerebras的同时自建数据中心。即便是全球最大的LLM公司,也不会依赖单一供应商。小型团队更需要工具来抽象掉多供应商运营的复杂性。
怎么构建
flowchart LR
A[应用请求] --> B[路由SDK]
B --> C{策略引擎}
C -->|成本优先| D[Cerebras]
C -->|低延迟| E[Groq]
C -->|质量保证| F[Anthropic Claude]
C -->|批量任务| G[OpenAI Batch]
D & E & F & G --> H[可观测层]
H --> I[成本与质量看板]
I --> C
MVP由三个组件构成:
- OpenAI兼容SDK: 现有代码仅需替换一行即可接入路由层。
client = OpenAI()→client = MultiRouter() - 策略引擎: 根据请求元数据(模型、max_tokens、延迟预算、SLA等级)与实时单价表选择后端。早期采用规则驱动,数据积累后过渡到ML预测。
- 可观测层: 按请求记录实际延迟、成本与质量评分(通过eval API)。每季度自动生成报表。
定价: 每100万token路由$0.05~$0.10(底层支出的1~5%)。对月支出超过10万美元的团队ROI明确。
成功条件
- 核心假设: 后端之间价格差保持在30%以上。若Cerebras与Groq的早期激进定价持续,即可成立。
- 验证方式: 5个Beta客户免费试用一个月,后续按节省金额的20%收取佣金。若3个客户月节省超过5000美元,市场就存在。
- 主要风险: 主流LLM厂商发布统一路由API并吸收此层。但避免单一供应商锁定的需求,本质上属于不同的市场。
一起打造
查看合作人才