导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

推理算力市场微观结构研究:Token交易如何模仿做市商与交易所

随着开源模型性能逼近前沿闭源模型,智能能力正在快速商品化。自2025年1月以来,调用规模暴涨350倍,开源模型推理服务无需准入许可,一个充分竞争的推理算力市场正在形成。Galaxy Digital最新研究指出,推理市场的结构与传统交易场所有着惊人的相似性:Token买方如同交易者,推理服务商如同做市商,而OpenRouter等撮合平台则扮演着交易所的角色。

7otguX5hl0PaHCJOGiIWrjmwI829ddN7OrGrXcfy.jpeg3OAqAh8FnHAyVhd8hz3YoYyTvkbpV63AWAqNcgij.jpeg

杰文斯悖论正在上演:企业切换至开源模型所节省的成本,会再度投入用于生成更多Token。OpenRouter数据显示,上周平台路由调度的Token总量达到2025年1月的125倍,其中开源模型流量占比从此前27%提升至75%。

ltZnERdB9bR22cj6pDr1crZ2c54OflYhdbUxYbJf.jpegahvsgbzQP3NlAUgYIJeGdO72mcxg9HeLMepGhdkG.jpeg

过去三个月,推理服务商、GPU算力租赁交易平台及流量调度平台的风险投资热度急剧升温。

cYv8knJlZKxwvgH1jfkjZf386GckmeUpEpfH6h1l.jpeg

推理市场结构:Token买方、卖方与撮合平台

推理业务存在三类核心参与主体:Token买方、Token卖方以及交易撮合平台。

uShkIz0qvYCKtSVnzjZcnHOM0vusbrXZE5DoIBEb.jpeg

Token客户包括终端用户、使用Cursor的开发人员、Lovable与Harvey等应用、智能代理集群以及将API接入生产流程的企业。需求弹性分化明显:15%高价格弹性(开发者试验)、25%中等弹性(对话服务)、40%低价格弹性(企业SaaS)、5%价格无弹性(实时响应业务)。总量数据会夸大需求粘性:价格下调10%仅能带动调用量提升0.5%–0.7%。但边际Token需求弹性极高,下一阶段需求由智能代理驱动,OpenRouter超过70%的调度Token来自命令行工具与智能代理,几乎所有新增Token需求都属于弹性需求。

推理服务商(Token卖方)消耗GPU算力小时生成Token,并在撮合平台上报报价。撮合平台(如OpenRouter)对接买卖双方,收取服务费用。关键区别在于Token并非双边交易市场——Token按需生产、交付即消耗,不存在可供仓储、转售的存量,因此缺少买方报价盘,价格发现机制受限。

3wQwbKs8lQus39wMgQA87pBWWVreevdW8f652QjT.jpeg

以OpenRouter上DeepSeek V4 Pro报价为例,同一款开源模型存在18家服务商报价。现象突出:第一,Token报价集中在人为锚定价位;第二,报价区间跨度极大(0.435至1.74美元,价差4倍),量化精度信息披露不全;第三,Token市场不存在促使价格收敛的机制,仅有单边报价盘,缺乏二级市场。

QAqwfqt9vpc8vrCC6GOisModqDvp6yBQuz97uaB5.jpegzrARJ5IX457ucCjpVOC0PkGtEtRfDhdCsgu75Vh1.jpeg

微观结构:做市商逻辑与裂解价差

本文所指微观结构,聚焦Token交易底层运行机制:各参与方实际持有的标的、利润空间如何形成,以及各方账面承载的风险。

tW4b6d6n8aAcUAeHUSsQYsc7Iwkn9p8CMRezblV6.jpeg

Token买方毛利 = 使用Token创造的价值 − 采购成本。买方通过高效模型流量调度(如Coinbase调度开源模型削减90%现金支出)、业务负载重构(批量任务定价减半、缓存降低60%-80%成本)、采购流程专业化(FinOps团队管控)来压降成本。

撮合平台毛利 = 价差 + 服务费 + 衍生收入。OpenRouter在用户充值时收取5.5%服务费,若GPV达10亿美元,可实现5500万美元净收入。平台掌握终端用户体验,未来可向服务商抽取费用,类似Robinhood向Citadel收取订单流付费。但550个基点的无风险费率偏高,市场或出现低价竞争者。

推理服务商盈亏 = Token销售收入 − Token生产成本。服务商为自产Token持续报价,以GPU算力小时作为库存载体,赚取生产成本与售价之间的价差。类似炼油商的裂解价差策略:做多GPU算力小时、做空现货Token。每GPU小时毛利公式为 m = p · R · u − c,其中p为Token单价,R为每GPU小时产出Token数,u为算力利用率,c为GPU小时租赁成本。

ODTpokHoESyFvwt7DW3XIIOytc6kKxCvHX2Q1fst.jpeg

举例:GPU小时成本2.74美元,Token定价0.90美元/百万Token,输出速度1000Token/秒,满负荷时每小时收入3.24美元,价差收益+0.50美元;利用率降至50%则亏损1.12美元,盈亏平衡利用率85%。

A9EyFnlKnyOUKMQDeOa3R84PxQ0Jr0HpZafL4n3K.jpeg

注意Token单价与产出率相互制衡:更快响应意味着更小批次和更少产出,因此低延迟定价更高。服务商可通过提高定价、压降成本、提升利用率、拉高产出率来增厚利润。技术优化手段包括:模型量化(FP4相比FP8提升1.8倍产出)、前缀缓存(缓存命中率90%时GPU开销降低90%)、推测解码、预填充/解码任务分离(提升10%-30%)、MoE专家并行(吞吐增长1.5-2.5倍)。

Wbt6Gj2JR7L2dV7OVBo8FDlZyTHpvi9yBkXpQwb4.jpeg

这些优化最终会向vLLM、SGLang等开源引擎扩散,技术优势快速衰减:预填充/解码分离普及耗时11-16个月,MLA耗时3-8个月,EAGLE-3仅1-2个月。部分开源实验室允许服务商提前获取权重,换取15%-30%收益分成,类似做市商争夺IPO订单流量。

sAj06Ccyedo0Fn2AXExcbrMCGzYulzHpTw4FpG3c.jpeg

算力期货:双边交易市场

Token本身无法标准化和稳定存续,因此风险转移必须下沉到同质化的GPU算力小时。Ornn算力价格指数已用于标准化价格发现,Architect Innovation Exchange等平台提供双边流动性。算力现货年化实际波动率均值高达130%,当前达312%。当租金飙升时(2026年5月较谷底上涨101%),现货交易成本翻倍,而Token价格单调下降,未对冲的推理服务商面临亏损。

Z2R6qUHubOWzb47XgsEODeiCfEgfGyTZGdnjgN9W.jpegVZHMdSPShcr3RZFohqFUM4QgmqcT2VhZuaclrAnh.jpeg

引入对冲后,毛利公式变为 m = p·R·u − (F0 + f),其中F0为期货价格,f为资金成本。正向市场(Contango)中,买方支付持有成本;反向市场(Backwardation)中,买方获得折价收益。通过期货合约,敞口价格风险转化为确定成本,服务商仅需管理自身可控的产出率R和利用率u。

gAAE1ql7tV2VLNerwt5OkSzNTIyQ4sJSnZTOXaIj.jpegEUjRjKL49z0eH6qcIdFVj4aWpxRpIQHCOqHER0ni.jpegvz5oUEuHKxhTC9W0DQGM1qzTk923OALLf0bnppk1.jpegZwuKDWVnpc5FrMjZeDzqbELZbloDhyqwlAtuDniJ.jpeg

对冲模式仍存在基差风险、需求不确定性和合成多头敞口等局限。总体而言,推理算力市场正逐步成熟,从Token生产到算力期货的完整金融生态系统正在形成,为参与者提供了全新的风险管理和价值捕获工具。