价格曲线的另一端是成本曲线
过去几年一个稳定的观察是:同等能力档位的模型 API 价格持续下降,量级上不止一个数量级;今天的旗舰模型价格,大致相当于早几年能力更弱的模型。价格背后是成本——长期以远低于摊销成本的价格卖 API 不可能持续,所以价格战的持续性必须从成本侧解释:推理成本确实在快速下降。理解这条下降曲线由什么构成,比记住任何一次降价新闻都有价值。
一条 token 的成本结构
大模型服务的成本大致由四块构成。算力资产折旧:GPU 采购或租用的费用按年限摊销,是推理成本的绝对大头。电力与机房运维:高功率机柜的电力、散热、带宽与运维人力。峰值容量冗余:服务必须按流量峰值配置算力,而流量有明显潮汐,意味着相当比例的 GPU 在大部分时间闲置或低负载。研发摊销:一次预训练动辄以月计、以上千张卡计,这笔钱要摊到此后的推理服务里。前三项是典型的固定成本——几乎不随请求量变化,于是「摊薄」成了降本的关键词:单位 token 的成本,本质上由 GPU 利用率决定。
降本的四条技术腿
第一腿是硬件迭代。 推理是典型的访存受限负载:每生成一步,都要把权重与缓存的中间结果从显存搬进计算单元,显存带宽往往比算力峰值更能决定吞吐。新一代 GPU 的进步集中在显存容量与带宽、以及单位美元能买到的算力上,每一次硬件更替都在重置成本基线。
第二腿是推理效率。 几项关键技术值得开发者记住名字:KV Cache(把注意力计算的历史中间结果缓存起来,避免每生成一个字都重算全部上下文,是大模型推理的基石优化);连续批处理(请求随到随插入当前批次、完成即退出,不再等整批凑齐,显著提高 GPU 利用率,vLLM 等开源推理框架因它而流行);投机解码(用小模型先起草几个字,大模型一次并行验证,验证远快于生成);量化(把权重压到低精度数值格式,用少量精度损失换显存与带宽的大幅节省)。每一项都是数倍量级的吞吐改善,叠加起来就是整个行业成本曲线的陡峭下移。
第三腿是架构。 MoE(Mixture of Experts,混合专家)把一个大模型拆成多个「专家」子网络,每个 token 只激活其中一小部分参数:总参数量决定模型的知识容量,激活参数量决定单次推理的计算量。「大模型的智力、小模型的成本」因此在架构上成为可能,成为近年开源与闭源阵营共同的主流方向。
第四腿是规模化与利用率。 超大集群摊薄运维与研发的固定成本;错峰填充把白天的对话流量与夜间可以慢慢跑的离线批量任务放进同一个池子,削峰填谷。利用率每提升一点,都是接近纯利润的成本改善。
价格战为什么是理性的
把「烧钱换市场」的剧本套在大模型价格战上并不准确,更合理的解释是一个长期均衡。推理的边际成本确实在趋零的路上一路下行,降价是把技术进步传导给市场的自然结果;同时价格本身就是获客与生态绑定手段——开发者把业务流程、提示词、评测体系建立在你家模型上之后,切换成本随之上升,先占住场景比短期毛利更重要;而「垄断后再提价」的剧本很难重演,因为市场上始终存在多家供应商与持续进场的开源替代,定价权被竞争与开源的双重压力锁住。理性的推断是:价格长期下行、阶段性促销,而非恶性亏损补贴到出清。
对开发者的含义
这轮价格战给应用开发者一个重要的架构启示:不要为今天的价格做过度优化,要为「价格还会降」做设计。 具体三条。第一,模型可替换:把模型调用收敛到统一的抽象层,换模型不改业务代码。第二,避免深度绑定单一供应商的私有特性——专有插件格式、专有上下文机制用得越深,未来享受降价红利的自由度越小。第三,把成本敏感的路由做进网关:简单任务走便宜模型,便宜模型的能力随降价与升级不断上移,路由层让这份红利自动落袋。反过来,为省 token 成本而自建复杂基础设施,在成本快速下行的环境里可能很快失去意义——动手前先估计这笔优化一年后还值多少。
小结
价格战的底气来自成本曲线:硬件迭代重置基线,推理效率技术成倍提吞吐,MoE 让算力花在刀刃上,规模化把固定成本摊薄。价格是这条曲线向市场传导的结果,也叠加了获客与生态竞争的策略考量。对开发者而言,最优应对不是猜底价,而是保持模型层的可替换性,让降价红利自动流向自己的业务。
读者留言
COMMENTS 暂无还没有留言,来说第一句?