—— 开放的知识共享平台

AI最赚钱的"收费站"一夜被拆!美国五巨头砸的6000亿,谁来填坑

首页 > 头条采集 > AI最赚钱的"收费站"一夜被拆!美国五巨头砸的6000亿,谁来填坑

本文作者— —Linda|前投行分析师、财经资深媒体人

过去两年,AI行业赚钱的逻辑只有一条,模型每输出一个字,就有人付一次钱。这条逻辑撑起了五大云厂商今年超过6000亿美元的基建下注。但就在这周,一项被塞进OpenAI最新旗舰模型里的技术,第一次让“AI花了多少算力”和“AI说了多少字”对不上号。

9月3日,OpenAI正式发布GPT‑6 Astra。公司称其在网络安全、专业工作、软件工程和科学领域实现了“代际跃升”,总裁Greg Brockman表示它最终可能被视为AGI到来的标志。但真正让行业绷紧神经的,是发布前两天的一则报道。9月1日,《The Information》披露Astra使用了一种名为“循环深度”的推理技术,让模型跳出传统推理模型的线性思考方式

图源网络

OpenAI首席科学家Jakub Pachocki当晚出面灭火。他和几位OpenAI研究员批评该报道在安全研究者中引发了不必要的恐慌,称公司已限制了循环架构的使用范围,以保证模型推理仍然可读。他明确说,包括Astra在内的现有前沿模型,计算图深度在GPT‑4的两倍以内。

但同一条推文里,他留下了一句话,这句话更值得琢磨,他说思维链监控“是脆弱的,而且遗憾地在朝负面方向走,原因与架构变化无关,我很快会写文章说明。

翻译过来就是,这次没越线,但线本身正在移动。所谓“线”,是行业默认的一条安全底线,AI的思考过程必须能被人读懂,因为这是目前监督AI是否“想歪”的主要手段。Pachocki的意思是,Astra没有突破这条线,但即便不动架构,人类读懂AI思维链的能力也在衰退,只是原因他暂时没说。

AI把草稿纸收起来了

过去两年,AI解难题靠的是“思维链”,把思考过程一行行写出来,写得越长想得越细,但也越费钱费时。循环深度换了一种做法:让同一组神经网络层在一个隐藏的内部状态上反复循环多次,然后才输出任何一个字。中间没有文本,token流里不留可读痕迹,所有额外推理都发生在数学激活值里,普通基于文本的安全监控根本看不到。打个比方,过去AI是边算边写草稿纸,你翻草稿纸就知道它有没有算错;现在它在脑子里算完直接报答案,草稿纸没了。

这项技术不是OpenAI发明的。学术界2025年初就发表了论文:一个35亿参数的小模型反复推演32圈,性能追上500亿参数的大模型,相当于用1/10的脑容量,靠多转几圈补回来。OpenAI是第一家把它放进旗舰产品的公司。

图源网络 Looped Transformers依靠模块循环,能在不输出文字的情况下完成内部推理

好处是效率,同样的智力,更少的字、更省的显存,代价是透明度。Redwood Research首席执行官Buck Shlegeris在消息传出后写道,他“极度担忧”,如果OpenAI进一步推进这项技术,他们将有能力大幅增加循环次数,彻底摧毁思维链的可监控性。

这个担忧OpenAI自己早就知道。一年前OpenAI自己发布的一篇论文就点名警告过循环深度架构可能破坏可监控性,共同作者里就有Pachocki本人。OpenAI不是不知道这条路有多危险,它是算过账之后决定走的。

俄罗斯人拆掉了两个AI之间的收费站

如果说Astra是让一个模型在内部少说话,那么同一周出现的Mostik,是让两个模型之间干脆不说话。

这家由俄罗斯数学家组成的初创公司,Wired记者Will Knight把它的技术形容为“机器心灵感应”。创始人Sasha Malysheva的逻辑是,既然你需要的只是前沿模型的推理,为什么它非得替你把答案生成出来?他们的办法是让模型在潜空间里交流,隐藏状态从前沿模型直接传给一个跑在你自己设备上的小模型,中间没有任何文字,两个模型都不需要微调。

图源网络

传统做法是大模型写一封信、小模型读信;Mostik的做法是把大模型的想法直接灌进小模型的脑子,信不用写了。

测试组合是7530亿参数的GLM‑5.2和40亿参数的Qwen‑3.5。这套混合系统的成本只有完整大模型的1/20,性能正好落在两个模型中间。花1/20的钱,买到一半的智力差距,对大多数商业场景来说,这笔账是划算的。

值得注意的是,Malysheva称公司在ARC‑AGI排行榜拿了第一,但“比赛还在进行中,不能细说”;Wired自己也承认报道缺乏硬细节,目前没有独立验证其方法对标既有基线的表现,也不清楚它究竟是全新技术还是知识蒸馏等既有思路的重新包装。

但它的商业指向很清楚。Mostik官网称,大模型只在关键节点贡献预填充状态,token生成留给更快更便宜的小模型;另一条路径则在独立部署的端点之间传输潜在状态,让小模型可以跑在老旧或闲置的GPU上。说白了,Mostik卖的不是模型,是“绕过大模型收费口”的方法。

如果AI不再需要说话,谁来给它算钱

这才是两件事真正的落点。

今天整个AI行业的计费逻辑只有一条:按token收费,用得越多、想得越久,付得越多。这个逻辑撑起了史上最大规模的基建下注,亚马逊、谷歌、微软、Meta、甲骨文五家2026年资本开支预计超过6000亿美元,约4500亿直接投向AI基础设施,而且越来越多靠发债填补预算与现金流的缺口。这些公司是借钱押注“AI说的字会越来越多”,而循环深度和Mostik,恰好从两头动摇这个前提。

一头是Astra,模型在内部转了很多圈,账单上却只有一行字。按token计费的前提是“输出的字数≈消耗的算力”,循环深度把这个等式拆开了。OpenAI今天可以靠限制循环次数维持现状,但一旦技术往前推,模型“越想越多、越说越少”,按字收费就会系统性地低估成本。到那时,token就像按通话时长计费的年代遇上了微信语音,计量单位本身过时了

另一头是Mostik,模型之间不再交换文字,原本要花钱的中间token直接归零。而且,它把大模型降级成“推理供应商”,把生成环节交给用户自己的便宜硬件,大模型厂商最赚钱的那部分流量被截走了。Astra让token变得不准,Mostik让token变得不必要。

行业已经在往“按结果收费”和“按算力收费”摸索。这两项技术不会立刻改写账单,但有一件事已经确定,token不会是AI经济的最终计量单位,就像“分钟”不是通信业的最终计量单位一样。

写在最后

OpenAI这次踩了一脚刹车,但连它的首席科学家都承认,趋势是明显的。当AI真正学会在人类看不懂的地方思考和协作,我们可能得到更便宜、更准确的答案,失去的是追问“它为什么这么想”的能力。

Astra在模型内部沉默地思考,Mostik让两个模型沉默地协作,这两件事发生在同一周。上一次一项技术让整个行业的收费单位失效,是互联网让内容免费的那一年。这一次,轮到了AI的思考。#头条精选-薪火计划#