正文

推理算力市场崛起:开源模型驱动下的AI基础设施金融化

编辑:Gyeri-crypto发布时间:12小时前

智能能力加速商品化,推理市场结构初现

随着开源大模型性能迅速逼近甚至在部分场景超越闭源模型,AI智能能力正经历快速商品化。自2025年1月以来,开源模型调用量激增350倍,推动一个无需许可、高度竞争的推理算力市场成型。该市场结构可类比传统金融市场:Token买方(如Cursor、Lovable及各类企业)、Token卖方(如Fireworks、Baseten、Together AI)以及撮合平台(如OpenRouter)共同构成核心生态。

7otguX5hl0PaHCJOGiIWrjmwI829ddN7OrGrXcfy.jpeg 3OAqAh8FnHAyVhd8hz3YoYyTvkbpV63AWAqNcgij.jpeg

杰文斯悖论显现:成本节省催生更大Token需求

企业转向开源模型所节省的成本并未减少支出,反而被重新投入以生成更多Token,印证了“杰文斯悖论”。OpenRouter数据显示,其平台上周调度的Token总量已达2025年1月的125倍,其中开源模型流量占比从27%跃升至75%。这一趋势同步推高了中短期GPU租赁需求,Ornn H100算力指数覆盖范围内,利用率与价格均大幅攀升。

ltZnERdB9bR22cj6pDr1crZ2c54OflYhdbUxYbJf.jpeg ahvsgbzQP3NlAUgYIJeGdO72mcxg9HeLMepGhdkG.jpeg

市场微观结构:三方角色与利润逻辑

Token买方通过高效调度、负载重构与采购专业化压降成本。例如Coinbase将请求切换至开源模型后,AI总支出下降90%;Lindy全面采用DeepSeek节省数百万美元。撮合平台如OpenRouter收取5.5%服务费,未来或引入订单流付费(PFOF)模式向卖方收费。而推理服务商则如同做市商,以GPU小时为“库存”,赚取Token售价与生产成本之间的价差。

uShkIz0qvYCKtSVnzjZcnHOM0vusbrXZE5DoIBEb.jpeg FUAQhnge8H0k3Bn0938p0bfQlw00NbVdDu6oIty1.jpeg

技术优化构筑短期壁垒,但优势快速扩散

推理服务商通过模型量化(FP4/INT4)、KV缓存、推测解码、预填充/解码分离及MoE专家并行等技术提升Token产出率(R)。例如DeepSeek V4 Flash模型输出Token报价较2025年初下降8倍,而同期H100算力价格上涨17%。然而,这些优化成果迅速通过vLLM、SGLang等开源引擎扩散,技术红利窗口缩短至1–2个月。服务商转而依赖资源调度与金融工具维持竞争力。

Wbt6Gj2JR7L2dV7OVBo8FDlZyTHpvi9yBkXpQwb4.jpeg sAj06Ccyedo0Fn2AXExcbrMCGzYulzHpTw4FpG3c.jpeg

GPU算力期货:对冲高波动成本的关键工具

由于Token本身难以标准化且生命周期短暂,风险对冲需下沉至底层生产要素——GPU算力小时。当前H100算力现货年化波动率达130%,极端时达312%。服务商通过算力期货锁定成本,将毛利公式中的变量c转化为确定值F₀+f。在正向市场(Contango)中提前锁定远期低价,在反向市场(Backwardation)中获取展期收益,从而稳定主营业务毛利率。尽管存在基差风险与用量预测偏差,算力期货已成为推理服务商不可或缺的金融基础设施。

Z2R6qUHubOWzb47XgsEODeiCfEgfGyTZGdnjgN9W.jpeg VZHMdSPShcr3RZFohqFUM4QgmqcT2VhZuaclrAnh.jpeg