Token 涨价了,账单寄给了谁

Token 涨价了,账单寄给了谁

(本文作者为 舒泽品牌手记,钛媒体经授权发布)

文 | 舒泽品牌手记

9月17日,欧洲算力租赁商 Nebius 向客户发出年内第二封调价函:10月1日起,H100 每小时租金从 3.85 美元涨到 4.50 美元,涨幅约 17%。消息发出当天,公司股价盘前涨了超过 8%。

9月18日,智谱上线 GLM-5.3-FlashX,推理速度提到每秒 200 tokens,是上一版的 5 倍;定价同步提到上一版的 2.5 倍。当天智谱股价收涨 5.34%。

同一条产业链上还有第三份文件,没有发布会,也没有行情异动:硅基流动 6 月底递交港交所的招股书。2025 年,这家公司每卖出 1 元 Token 服务,对应的直接成本是 1.24 元。

涨价本身不是新闻——涨价顺着产业链往下传,最后停在哪一环,才是。

AI 应用内部怎么省 Token,是架构的账,需求侧自己的事。舒泽这篇要算的是另一本账:上游涨起来的成本,一层一层往下寄,谁有权拒收,谁只能签收。

先涨价的,是卖水的人

今年寄出涨价函的,远不止 Nebius 一家。

5月,Nebius 已经把部分 GPU 租金上调约 30%;9月这封是第二封,H200 涨 20%,B200 涨近 19%,B300 涨约 21%,连配套的 CPU 和内存费率也分别加了 25% 和 41%。国内一样在涨:腾讯云 4月28日公告调价,企业旗舰版涨幅约 154%,这已经是它年内第三次;阿里云 3月17日宣布 AI 算力、存储产品最高涨价 34%;美国的 CoreWeave 7月把全系 SKU 提了约 25%。

涨价函的最上游是内存厂。KB 证券 9月7日的报告里,三星和 SK 海力士的存储库存已经不足 10 天。

为什么涨,需求侧的油门踩到了底。国家数据局的口径:全国日均 Token 调用量从 2024 年初的约 1000 亿,涨到 2026 年 3 月的 140 万亿——两年多时间,涨了一千多倍。Gartner 今年 8 月的预测里,2026 年全球推理支出 233 亿美元,第一次超过训练支出的 190 亿美元——算力消耗从一次性的训练投入,变成了天天发生的运营开支。反映到总量上:中国信通院数据(经财新封面报道披露、多家券商研报引用),2026 年一季度国内 AI 算力需求同比增长 417%,有效供给只增长了 128%。

供给侧同样不宽松:KB 证券测算,存储占 AI 基建投资的比例将从 2025 年的 14% 升到 2027 年的 57%;TrendForce 的预测更激进,认为 2027 年这个比例可能到 68%。HBM4 量产消耗的晶圆是通用 DRAM 的 3 倍——产能就那么多,给了新内存,旧内存就得让路。

供需位置直接写进了合同。按券商研报的口径,Nebius 新签合同普遍要求三年预留期加 30%–40% 预付款,今年二季度约七成新合同含预付款,项目回收期从两三年缩短到 22 个月左右。旧卡也在涨:B200 量产一年半,二手残值到了采购价的 158%。

芯片厂商、租赁商、内存厂,是这一轮先涨价、也涨得最理直气壮的一批。这无关对错:每一环的上游都卡着一道短期无法复制的产能门槛;门槛在,定价权就在。

2 分钱和 30 元,住在同一个市场里

但"涨价"只能解释这个市场的一半。邬贺铨院士在 2026 中国算力大会上给过一个价格带:每百万 Token,2024 年大约 8–15 元,2025 年大约 5–10 元,2026 年的普惠模型只要 0.02 元。

同一个市场里,高端推理模型的报价是每百万 Token 10–30 元。财联社在算力大会的报道里还有另一个第三方测算:头部 API 输出价格,从 2025 年一季度到 2026 年二季度累计上涨了 80%。

便宜的还在更便宜,贵的在更贵。普惠层的成本战没有停,高端层已经开始为确定性付费。一个市场,已经裂成了两个。

高端层里动作最密的是智谱。它的涨价史可以排成一列:2月 GLM-5 发布,上调 Coding Plan 套餐和 API 价格;3月 GLM-5-Turbo 提价 20%;4月 GLM-5.1 再提 10%;9月 FlashX 直接定到上一版的 2.5 倍。

涨价这个动作本身不值钱,谁都能发函。值钱的是涨价之后客户还在不在。智谱的答案在中期财报电话会里:截至 8 月末,它的 API 定价同比提高了 101%;同期 MaaS 平台调用量较年初增长超过 40 倍,用户突破 740 万,开放平台及 API 业务毛利率升到了 24.6%。提价和放量同时发生,这条曲线才叫定价权。

需求侧的证据更直接:由 10 万张国产芯片组成的推理集群,上线即被打满。智谱近期与海内外头部云服务商签了收入分成协议,相关收入 10 月起确认,等于把模型放进别人的云里卖,按流水抽成。电话会上,年末 ARR 指引从 24 亿美元上调到 30 亿美元。

定价权也有天花板。2月 GLM-5 发布当周,需求涨了 10 倍,算力储备几天耗尽,智谱被迫停售了主力产品 Coding Plan。产能不够的时候,定价权无处行使。还有一个边界:智谱 7月和9月刚分别完成 40 亿、50 亿美元再融资(上证报口径)——定价权目前只覆盖它的 API 业务,离整个公司上岸还远。

卖 1 元 Token,成本 1 块 2 毛 4

同一张涨价账单寄到产业链中游,出现了三种签收方式。

第一种,定价权者:涨价,客户不走,股价照涨。智谱和 Nebius 都在这一层。

第二种,转嫁者:腾讯云和阿里云的调价公告都把原因写明了——"全球 AI 需求爆发、供应链涨价"。上游寄来的账单,盖个章,原样转发给下游。

第三种,自己吞的。硅基流动的招股书把这一层的账记得很全。

毛利率:2023 年 83.3%,2024 年 39.4%,2025 年 -24.0%。2025 年它的销售成本是 6863.2 万元,是当年收入 5533 万元的 124%;其中算力租赁成本 5962.7 万元,占销售成本的 86.9%——这家公司不自建数据中心,算力全靠租。公有云 MaaS 业务的毛利率是 -119%,意味着这块业务每收 1 元,直接成本超过 2 元。为拉新发放的免费 Token 代金券,对应的算力成本 5421.3 万元,是当年全部收入的 1.85 倍。

合并起来:2025 年净亏损 3.45 亿元,经营现金流 -1.72 亿元,年末账面现金 1.72 亿元,月均消耗约 1480 万元。2026 年上半年,公司靠 B/B+ 轮 12.6 亿元融资补了现金。招股书的风险章节里有一句公司自己的话:"可能无法实现盈利。"

招股书里还有一个数字:无服务器词元服务的付费客户,从 2024 年的 2455 个涨到 2025 年的 71.6 万个,不到两年翻了约 292 倍。客户确实来了,只是每一个都在亏钱。增长解决不了的问题,才是结构问题。

它的上游是大厂——算力主要租自阿里;对手也是大厂——打价格战、发补贴的,还是那几家。上游涨价比它快,下游它不敢涨。

同一张账单,对另一些有卡的公司是收入。券商研报的记录里,算力租赁商行云科技单笔订单最高增幅超过 200%,赛意信息一份算力服务合同金额 64.5 亿元,占其 2025 年营收的 311%。涨价函从芯片厂、内存厂寄出,在租赁商手里变成红利,在云厂商手里盖章转发,最后停在硅基流动这样的报表里——账单没有消失,只是被转手了。

代金券换市场是互联网时代的标准打法;大厂补贴也谈不上原罪——它客观上压低了整个行业的使用门槛,包括硅基流动自己的获客成本。但能不能拒收、能不能转嫁、还是只能签收,本身就是市场地位。

中间层还有没有活路,我给不出判断。招股书里只有斜率,没有答案。

补贴停的那天,才是定价日

给用 Token 的人和投 Token 的人,提几个问题:涨价函发了,客户的续费率动了吗?毛利率是涨价涨出来的,还是补贴退出来的?上游再涨 20%,这家公司是跟涨、硬扛,还是退出?账上的现金,撑得到下一个提价周期吗?

新玩家还在往里走。财联社 9月18日的报道里,一批港股公司开始争建"Token 工厂",把算力封装成按 Token 计费的产能对外卖。它们看到的是智谱那条提价放量的曲线,未必看到了硅基流动那本每 1 元收入配 1.24 元成本的账。同一条产业链,进门之前最好先确认自己在第几层。

三个信号,都可以公开验证。硅基流动 2026 年报的毛利率,能不能回到零以上;智谱 FlashX 的 2.5 倍定价,下次财报电话会里有没有变成收入;大厂的免费 Token 补贴,什么时候停。

前两个信号验证的是定价权。第三个验证的是价格本身:今天的很多价格出自巨头补贴,还没经过市场谈判。补贴停的那天,才是真正的定价日。