StartupXO
語言設定

Language

開發工具·基礎設施

推論能力為何沒有現貨市場,把閒置 GPU 賣出去的機制

發布日期: 2026-07-09

推論市場GPU現貨市場代幣經濟基礎設施

要解決的問題

大型語言模型推論按代幣計價,但每家供應商各自把價格定死,擁有閒置 GPU 的一方和想便宜買入的一方之間沒有市場可對接。

為什麼是現在

開放權重模型普及後,同一模型在眾多供應商上執行,其輸出代幣成為可替換的商品,MCP 又讓代理人能自行買入最便宜的推論。

推薦人才

做過推論基礎設施、結算與訂單簿撮合,對品質驗證與信任設計有直覺的人

問題在哪

大型語言模型推論早已按代幣計價:每百萬輸入代幣多少錢,每百萬輸出代幣多少錢。可這個價格是各供應商各自定死的掛牌價。OpenAI 報一個數,另一家雲端平台報另一個數,中間沒有一個按即時價把它們接起來的市場。

浪費在兩頭同時堆積。一頭是閒置的 GPU。自建伺服器、租來的執行個體、訓練結束後空轉的顯示卡,每時每刻都在丟棄多餘的推論能力。另一頭是跑大批次任務的買方。文件分類、資料擷取、摘要這類對延遲不敏感、量又大的活,照掛牌價付費單位成本很重。明明有願意低價出讓閒置能力的賣方,也有想便宜買入的買方,卻缺一個把兩者撮合定價的現貨市場。GPU 小時有現貨市場,偏偏推論的產物代幣沒有。

為何是現在

三件事同時對上了。第一,代幣價格已是標準單位。每百萬代幣多少錢是業界通用的尺,能把不同供應商放到同一把尺上比較。第二,開放權重模型普及後,同一模型在多家供應商上執行方式完全一致。於是出現了可替換的商品:不是品牌,而是「這個模型的輸出代幣」。第三,代理人能自行採購。事實上 mtok.market 率先做出了這個形態:非託管、賣方自行託管,在 Base 鏈上以 USDC 按塊結算,用實際成交的中位數作為現貨價,並透過 MCP 讓代理人直接接入。

宏觀趨勢也指向這裡。上海期貨交易所、CME、ICE 等都在設計 GPU 算力期貨,公開討論把代幣當作黃金或石油那樣交易(TechCruncharXiv)。凡是討論期貨的市場,通常底下先立起現貨。

flowchart LR
  A[閒置推論能力<br/>空轉 GPU 自建伺服器] --> B[現貨訂單簿<br/>依模型報價]
  C[批次推論需求<br/>分類 擷取 摘要] --> B
  B --> D[驗證與結算<br/>非託管]
  D --> E[比掛牌價便宜<br/>閒置能力變現]

如何打造

關鍵是從一個狹窄、可替換的商品切入。比如某個開放模型的輸出代幣,其中又只做對延遲不敏感的非同步批次任務。賣方把閒置能力掛在即時價上,買方從訂單簿裡挑最便宜的一批。結算保持非託管,讓平台不碰資金和金鑰。降低支付摩擦是早期流動性的關鍵。

最難的一塊是驗證。要確認賣方確實跑了指定模型,沒有偷偷換成便宜模型。可以抽樣重跑來比對結果,或者要求信譽分和抵押金,疊加一層信任機制。收入自然是在撮合成交量上抽一層薄手續費。別一上來就搶即時對話推論,先攻價格敏感、能容忍延遲的批次任務更務實。

成功條件

兩個假設必須成立。第一,買方要接受「任何跑這個模型的賣方」,而不是認準某個品牌。批次和非即時任務裡這成立,但延遲和穩定性至上的正式流量裡很難。第二,要能低成本證明交付的代幣是真的。若驗證成本高過省下的錢,市場立不起來。兩點都解開,流動性飛輪就轉起來:賣方越多越能比掛牌價便宜,越便宜越引來買方,買方越多越吸引賣方。誰先轉動這個輪子,誰就握住推論市場的基準價。