StartupXO
语言设置

Language

开发工具·基础设施

GPU 买得到,电买不到:数据中心电力瓶颈留下的工具空白

发布日期: 2026-07-19

数据中心电力AI基础设施能源软件调度

要解决的问题

AI 数据中心的约束已经从算力转移到电力,但实时计量用电、协助采购、按电力信号搬动工作负载的软件层几乎是空白。

为什么是现在

爱尔兰的数据中心已经吃掉全国 23% 的电力,而电力可视化与调度工具市场仍处早期,能把电网数据和 GPU 编排接起来的团队有机会定义标准。

推荐人才

既碰过电力市场(批发电价·需求响应)又做过 Kubernetes 级工作负载编排,并且清楚电网数据有多脏的人

问题是什么

爱尔兰统计局算过一笔账:2025 年该国数据中心消耗了全国计量电力的 23%(RTE),超过所有城市家庭加起来的 18%,十年前这个数字还只是 5%。数据中心用电一年涨了 10%,达到 7,663 GWh,其余所有用户加起来只涨 2%(Data Center Dynamics)。The Atlantic 给 AI 数据中心下的判断是:这已经不是 IT,是重工业(The Atlantic)。可软件没有跟上这场转变。GPU 花钱总能到货,电网接入却要排队好几年。切分算力的编排工具从 Kubernetes 到 Slurm 摆满货架,把电力当作一级资源来计量和分配的那一层,至今还靠电子表格和基建团队的手感在转。能按任务说清”这个训练烧了多少度电、那个时段电价多少”的团队,少之又少。

为什么是现在

高盛预计美国数据中心电力需求将从 2025 年的 31 GW 跳到 2026 年的 41 GW、2027 年的 66 GW(Goldman Sachs)。还有估算认为云与 AI 基础设施的资本开支到 2027 年会逼近每年 1.5 万亿美元(Yahoo Finance)。钱和芯片都到位了,缺的是电子。瓶颈换了位置。训练和批量推理这类推迟几小时也无妨的负载占比不小,但把它们挪到低电价或绿电富余时段的决策,大多还靠人肉,甚至根本没人做。中国的”东数西算”工程把算力枢纽往西部电力富集区搬,阿里云、腾讯这些云厂商在西部批量建数据中心,本质上是同一个判断:电在哪里,算力就该去哪里。当搬迁发生在国家工程层面,单个集群内部的”按电调度”就更显得原始。电力越稀缺,能证明”每兆瓦吞吐”的运营方在扩容审批和购电谈判里越占便宜。测量者获胜的格局刚刚成形,标准工具还没有主人。

flowchart LR
  A[电网与电价数据] --> C[电力可视化层]
  B[GPU 工作负载队列] --> C
  C --> D[感知电力的调度器]
  D --> E[挪到低价低碳时段]
  E --> F[每兆瓦吞吐报告]

怎么构建

楔子是计量。把机柜和集群级的电力遥测接上电价套餐与批发价格源,按任务展示”这次训练烧了多少电费、如果六小时后再跑会省多少”。部署轻,电费账单天然帮你验证数字,销售周期短。第二步是调度:让团队给可推迟的任务打标签,再做一个叠在 Kubernetes 或 Slurm 之上的调度器,按电价、碳强度、电网拥堵信号挪动执行窗口。走到这里,第三层就开了:采购。帮集群报名需求响应项目拿削峰补偿,把实测数据带进购电协议谈判。收费按托管兆瓦订阅,再叠加经核实节省额的分成。别去碰超大规模云厂商,他们会自建。从电费直接砸在损益表上、却没有专职能源团队的地方切入:中型 GPU 云、托管机房运营商,以及刚开始自己养集群的企业 AI 平台团队。

用图看清结构

电力只是更大成本方程里的一个输入。DeepThought 图谱推理经济学逐节点拆解了推理成本如何左右 AI 的利润率。