StartupXO
语言设置

Language

AI·开发工具

7MB模型在浏览器CPU上5ms跑完,在无服务器推理之上能造的产品

发布日期: 2026-07-07

端侧AI浏览器推理WASM隐私优先边缘AI

要解决的问题

语义搜索或意图分类这类基础AI功能,今天也得把每一次请求送到服务器API,于是加了延迟,堆起令牌成本,把用户数据送出设备,离线时干脆停摆。

为什么是现在

一个7MB的嵌入模型已被证明能在浏览器CPU上5ms跑完。把相当一部分推理压回设备本身、不用GPU也不用服务器的门,刚刚打开。

推荐人才

精通WASM与浏览器性能优化的前端工程师,懂小模型量化与蒸馏的ML工程师,以及会拿隐私和离线当卖点的产品直觉。

问题是什么

Hacker News的Show HN上出现的Ternlight,精准戳中了要害。一个7MB的嵌入模型靠WebAssembly在浏览器CPU上完整运行,单次调用约5ms,服务器调用为零。它输出384维向量,衡量文本之间的语义相近程度。它暴露的不是一个工具,而是一块空白。今天要给Web产品加上语义搜索、意图分类、FAQ匹配、个性化,多数团队都把每一次输入往返到服务器的嵌入API。每一次往返都压上网络延迟,用得越多令牌成本越堆越高,用户敲进去的文字离开设备落到别人的服务器上,一到飞行模式或公司内网,功能整个停摆。最常见的AI功能,却压在最重的基础设施之上。

为什么是现在

两条曲线刚刚交叉。一条是模型变得足够小。Ternlight用Mamba系结构加二值权重,不做浮点运算,小到能出5MB的迷你版。另一条是浏览器运行时成熟了:WASM已经跑出可用速度,WebGPU在后面托底。这里再叠上第三股力量。云推理单价正被开放权重压垮,而端侧不是压低单价,而是直接归零。再加上让数据不离开设备的隐私合规压力。超轻量的端侧推理,正站在个人demo即将固化成标准产品层的那块空白上。

怎么构建

把嵌入压回浏览器,连向量索引也放在本地。用户输入,模型在浏览器内取出向量,在本地索引里算相似度,一次网络都不走就返回结果。产品面很宽:浏览器扩展式语义搜索,离线笔记与文档应用的即时搜索,数据绝不外传的隐私优先FAQ机器人,客户端表单自动分类,无服务器的边缘个性化。工具面也实在:端侧嵌入SDK,浏览器本地向量库,小模型的量化与蒸馏流水线。

flowchart LR
  A[用户输入] --> B[浏览器内模型, CPU上的WASM]
  B --> C[端侧向量索引]
  C --> D[约5ms排好序的结果]
  B --> E[无服务器, 私密, 离线]

入口要窄。从瞄准单一嵌入型工作负载(比如文档搜索)的拖入式SDK起步,一行装好,再叠上本地向量库与分类、排序,最后靠框架集成铺开。收费上,开发者SDK按席位或用量计,做成成品的终端产品再叠订阅。

成功条件

第一,包体积预算。首屏多加的几MB不能把用户赶走,所以要靠懒加载和回访缓存,保证第二次起零网络。第二,诚实的质量边界。小模型不如前沿嵌入精准,把端侧够用的工作负载和服务器更胜一筹的工作负载分开来卖,信任才立得住。第三,窄窄的楔子。别去追整个端侧AI,谁先在一个工作负载上证明”这个本地更好”,谁才拿到进下一格的资格。