开发工具·基础设施
推理能力为何没有现货市场,把闲置 GPU 卖出去的机制
发布日期: 2026-07-09
要解决的问题
大模型推理按代币计价,但每个供应商各自定死价格,拥有闲置 GPU 的一方和想便宜买入的一方之间没有市场可对接。
为什么是现在
开放权重模型普及后,同一模型在众多供应商上运行,其输出代币成为可替换的商品,MCP 又让智能体能自行买入最便宜的推理。
推荐人才
做过推理基础设施、结算与订单簿撮合,对质量验证和信任设计有感觉的人
问题在哪
大模型推理早已按代币计价:每百万输入代币多少钱,每百万输出代币多少钱。可这个价格是各供应商各自定死的挂牌价。OpenAI 报一个数,阿里云百炼报另一个数,中间没有一个按实时价把它们接起来的市场。
浪费在两头同时堆积。一头是闲置的 GPU。自建服务器、租来的实例、训练结束后空转的显卡,每时每刻都在丢弃多余的推理能力。另一头是跑大批量任务的买方。文档分类、数据抽取、摘要这类对延迟不敏感、量又大的活,照挂牌价付费单位成本很重。明明有愿意低价出让闲置能力的卖方,也有想便宜买入的买方,却缺一个把两者撮合定价的现货市场。GPU 小时有现货市场,偏偏推理的产物代币没有。
为何是现在
三件事同时对上了。第一,代币价格已是标准单位。每百万代币多少钱是行业通用的尺子,能把不同供应商放到同一把尺上比较。第二,开放权重模型普及后,同一模型在多家供应商上运行方式完全一致。于是出现了可替换的商品:不是品牌,而是”这个模型的输出代币”。第三,智能体能自行采购。事实上 mtok.market 率先做出了这个形态:非托管、卖方自托管,在 Base 链上以 USDC 按块结算,用实际成交的中位数作为现货价,并通过 MCP 让智能体直接接入。
宏观趋势也指向这里。上海期货交易所、CME、ICE 等都在设计 GPU 算力期货,公开讨论把代币当作黄金或石油那样交易(TechCrunch、arXiv)。凡是讨论期货的市场,通常底下先立起现货。
flowchart LR
A[闲置推理能力<br/>空转 GPU 自建服务器] --> B[现货订单簿<br/>按模型报价]
C[批量推理需求<br/>分类 抽取 摘要] --> B
B --> D[验证与结算<br/>非托管]
D --> E[比挂牌价便宜<br/>闲置能力变现]
如何构建
关键是从一个狭窄、可替换的商品切入。比如某个开放模型的输出代币,其中又只做对延迟不敏感的异步批量任务。卖方把闲置能力挂在实时价上,买方从订单簿里挑最便宜的一批。结算保持非托管,让平台不碰资金和密钥。降低支付摩擦是早期流动性的关键。
最难的一块是验证。要确认卖方确实跑了指定模型,没有偷偷换成便宜模型。可以抽样重跑来比对结果,或者要求信誉分和抵押金,叠加一层信任机制。收入自然是在撮合成交量上抽一层薄手续费。别一上来就抢实时对话推理,先攻价格敏感、能容忍延迟的批量任务更现实。
成功条件
两个假设必须成立。第一,买方要接受”任何跑这个模型的卖方”,而不是认准某个品牌。批量和非实时任务里这成立,但延迟和稳定性至上的生产流量里很难。第二,要能低成本证明交付的代币是真的。若验证成本高过省下的钱,市场立不起来。两点都解开,流动性飞轮就转起来:卖方越多越能比挂牌价便宜,越便宜越引来买方,买方越多越吸引卖方。谁先转动这个轮子,谁就握住推理市场的基准价。
相关内容
一起打造
查看合作人才