大模型商业演进 · #8
两年跌到 0.5%,AI 开始争夺物理世界
GPT-4 的报价三年后被 DeepSeek V4 Flash 压到两百分之一,Gemini 3.6 Flash 光靠效率提升就能把实际任务成本再砍掉六成——语言智能这一层的议价权正在消失。同一时间,资本、顶尖人才和行业话语权成规模涌向另外两层:能预测物理世界如何演化的世界模型,和能把判断变成受控动作的物理智能(physical AI)。本文用最新的模型报价和计算方式,给出判断这场迁移的思考框架,并回答迁移之后稀缺与边缘会落在哪里。
TL;DR
语言智能的护城河建立在两个条件上:互联网文本可以被规模化抓取,参数越大能力越强。这两个条件在 2026 年已经耗尽——以 2023 年 GPT-4 每百万 token 30/60 美元为基准,DeepSeek V4 Flash 已降到 0.14/0.28 美元,降幅约 99.5%;就算是旗舰款 Claude Opus 5 和 GPT-5.6 Sol,输入价也降了 83%。牌价之外,任务成本降得更快:Gemini 3.6 Flash 官方牌价只降了 17%,但在长链路任务上的实际成本降幅高达 65%,因为模型同时学会了用更少的思考步骤把事情做完。语言智能这一层正在变成地板,且旗舰款和经济款的降价速度并不同步——先垮的是中间层和经济款。与此同时,NVIDIA、Google DeepMind、World Labs、Physical Intelligence、Figure AI 与中国的 BAAI 阵营都在把资本和叙事重心转向另外两层:世界模型(预测物理世界如何演化,可拆成渲染、模拟、规划三种能力)和物理智能(physical AI,把判断转成机器人可执行的受控动作)。迁移能够成立,是因为物理世界的数据不能像文本一样被互联网抓取,只能靠真实交互重新生成——这重建了先发者的数据壁垒。但方向不等于时点:物理层的资本规模仍只有基础设施层的几十分之一,数据管道和安全立法都还没跟上演示视频的速度。收束下来,新的稀缺资产有三类:能规模化生产真实物理交互数据的管道、能同时完成渲染、模拟、规划三件事的世界模型能力,以及能把预测和动作打通成一个闭环的系统整合能力。
核心论点
- 语言智能的护城河依赖两个正在耗尽的条件——互联网文本可规模化抓取、参数越大能力越强;以 2023 年 GPT-4 为基准,DeepSeek V4 Flash 降价约 99.5%,旗舰款 Claude Opus 5 / GPT-5.6 Sol 也降了 83%,标志这一层正在变成地板,且经济款比旗舰款垮得更快
- GPT-4 三年前用全市场最高报价锁定了当时的稀缺与边缘,三年后连表里报价最低的经济款都排不进去;语言智能内部已经完整跑完一轮「今天的边缘,就是明天的地板」,这是接下来迁移会在物理世界重演一次的直接证据
- 算清楚语言智能变便宜的真实速度要用两把尺子:牌价(每百万 token 的报价)和任务成本(牌价 × 完成任务实际耗费的 token 数);Gemini 3.6 Flash 牌价只降 17%,但长链路任务的实际成本降了 65%,只看牌价会低估真实降价速度
- 把「AI 竞争」拆成三层才看得清战场:语言智能(理解与生成文本)、世界模型(预测物理世界如何演化,含渲染、模拟、规划三种功能)、物理智能(physical AI,把判断转成受控物理动作)
- 迁移能够成立的机制在于数据来源不同:物理世界的动作—状态数据不能被互联网抓取,只能靠真实交互重新生成,这重建了先发者的数据壁垒
- 正例是把预测和动作打通成单一闭环的系统——如 NVIDIA Cosmos 3 与 Physical Intelligence 的机器人基座模型;负例是数据与安全立法仍是硬约束——远程操控产能有限,安全标准最早也要到 2027 年才能落地
- 收束下来的稀缺资产有三类:真实物理交互数据管道、能同时完成渲染、模拟、规划三件事的世界模型能力、把预测与动作打通成闭环的系统整合能力;方向已经清楚,量级和时点仍需分开判断
三年前,GPT-4 的 API 报价是每百万输入 token 30 美元,输出 60 美元。今天,同一张报价单上挤满了比它更强、也比它便宜得多的选项:
| 模型 | 发布方 · 定位 | 输入价($/百万 token) | 输出价($/百万 token) | 相比 GPT-4 降幅(输入) |
|---|---|---|---|---|
| GPT-4(2023-03,基准) | OpenAI · 旗舰 | $30.00 | $60.00 | —— |
| Claude Opus 5 | Anthropic · 旗舰 | $5.00 | $25.00 | ↓83% |
| GPT-5.6 Sol | OpenAI · 旗舰 | $5.00 | $30.00 | ↓83% |
| Claude Sonnet 5(标准价) | Anthropic · 主力 | $3.00 | $15.00 | ↓90% |
| Kimi K3(2026-07-16 发布) | 月之暗面 · 主力(国产开源) | $3.00 | $15.00 | ↓90% |
| GPT-5.6 Terra | OpenAI · 主力 | $2.00 | $12.00 | ↓93% |
| Gemini 3.6 Flash(2026-07-21 发布) | Google · 主力 | $1.50 | $7.50 | ↓95% |
| GLM-5.2(2026-06-16 发布) | 智谱 AI · 主力(国产开源) | $1.40 | $4.40 | ↓95% |
| DeepSeek V4 Pro | 深度求索 · 旗舰(国产开源) | $0.44 | $0.87 | ↓99% |
| GPT-5.6 Luna | OpenAI · 经济款 | $0.20 | $1.20 | ↓99% |
| DeepSeek V4 Flash | 深度求索 · 经济款 | $0.14 | $0.28 | ↓99.5% |
降幅的计算方式很直观:(基准价 − 现价)÷ 基准价。以表里降得最彻底的 DeepSeek V4 Flash 为例,输入端(30 − 0.14)÷ 30 ≈ 99.5%,输出端(60 − 0.28)÷ 60 ≈ 99.5%——这也是它常被形容为「比 GPT-4 便宜两百倍」的原因。
这张表还藏着一层容易被忽略的分化:降得最猛的是经济款,旗舰款的降幅明显更克制——GPT-5.6 Sol 的输出价比 GPT-4 只降了 50%,Claude Opus 5 降了 58%,仍然比中间价位的机型贵出一个数量级。地板在往下沉,但旗舰层的议价权还没见底。 这恰好印证了后文要讲的规律:稀缺永远追着边缘跑,先垮的是「够用就好」的中间层和经济款,最后才轮到真正的前沿能力。
「开源必然更便宜」这个假设,本身也该打个问号。DeepSeek V4 Flash 和 GLM-5.2 确实把价格压到了地板,但月之暗面 7 月发布 Kimi K3 时,并没有延续上一代 Kimi K2「超便宜打穿前沿」的路线,而是直接把报价定进了和 Claude Sonnet 5 同一个价位段——3 美元对 15 美元。国产开源模型不再自动等于廉价模型,它们也在往「按能力定价」的方向走。
光看牌价,还会低估语言智能变便宜的真实速度,因为完成同一个任务需要「想」多少步、烧多少 token,也在跟着降。想算清楚一次任务到底便宜了多少,得用两把尺子:一把是牌价(每百万 token 多少钱,好比油价),一把是任务成本(牌价 × 完成一次任务实际耗费的 token 数,好比一箱油能跑多远)。Google 发布 Gemini 3.6 Flash 时给出了两组可以对照的数字:官方牌价上,输出单价只从上一代的 9 美元降到 7.5 美元,降了 17%;但在长链路工程任务上,Google 测算的实际任务成本最多降了 65%——因为新模型同时学会了用更少的思考步骤把同一件事做完。只看牌价,会把语言智能变便宜的真实速度低估两到三倍。这一层的现状是:牌价和任务成本都在往地板探,只是旗舰款还没探到底。
这张表本身,就是一次完整的「稀缺追着边缘跑」的演示。三年前,GPT-4 用整个市场最高的报价,锁定了当时机器智能的边缘——没有更贵的选项,是因为没有更强的选项,那份 30 美元/60 美元的报价单本身就是稀缺的标价。三年后,它连表里的经济款都排不进去:报价最低的 DeepSeek V4 Flash,只要它当年报价的 0.5%,而能力早已在公开评测上全面超过了 2023 年的 GPT-4。边缘没有消失,只是搬去了别处;GPT-4 曾经占据的位置,被后来者从地板一路挤了上去。语言智能这一层内部,已经完整跑完了一轮「今天的边缘,就是明天的地板」——这正是接下来要讲的迁移,会在物理世界重演一次的根本原因。
巧合的是,同一段时间里,另一件事在同步发生:NVIDIA 把公司叙事整体转向「物理智能」(physical AI),6 月发布了训练数据量达 20 万亿 token 的 Cosmos 3;Google DeepMind 把 Genie 3 开放给订阅用户,还专门为 Waymo 定制了一套用来模拟极端路况的世界模型;李飞飞的 World Labs 在半年内融到 12.3 亿美元;Yann LeCun 离开 Meta,专门去做一种叫 JEPA 的世界模型新架构;中国的北京智源大会把主题从「大模型」换成了「世界模型」,发布了号称首个通用世界基座模型的 Physis-v0.1。机器人创业公司在 2026 年上半年拿到的融资,已经超过了 2025 年全年。
语言智能在跌价,物理世界这一层的资本和话语权却在暴涨。这不是巧合,也不是又一轮营销词汇的轮换。这篇文章要讲清楚的是:这场迁移为什么会发生、发生在哪一层,以及迁移之后,稀缺和边缘到底落在什么地方。
一、把「AI 竞争」拆成三层,才能看清战场在哪
「AI」这个词已经太庞大,庞大到没法用来判断资本和人才到底在往哪里流动。一个更有用的做法,是把它拆成三层,每层各有各的定价逻辑:
语言智能——理解和生成文本、代码、对话,输出是符号。世界模型——预测物理世界接下来会怎样变化,输出是对现实的模拟。物理智能(physical AI,也称具身智能)——把判断转成机器人、机械臂或自动驾驶系统能够执行的受控动作,输出是物理世界里真实发生的位移和接触。
「世界模型」这个词本身也在被滥用,需要再拆一层。World Labs 在 6 月发布的一篇分类文章,把它拆成三种能力:渲染器(生成好看的画面,衡量标准是视觉真实感)、模拟器(构建物体如何受力、碰撞、形变的物理模型)、规划器(在模拟的世界里决定下一步该做什么)。三种能力常被同一个词打包销售,但本质完全不同——Google DeepMind 的 Genie 3 能实时生成可探索的 3D 场景,每秒 24 帧、在几分钟内保持画面连贯,这是一台出色的渲染器,但论文里也明确说了它「没有对三维结构的显式理解」;World Labs 自己的 Marble,则同时输出可供人观赏的画面和物理引擎能直接读取的碰撞网格,这才踩进了模拟器的门槛。分不清这三种能力,就分不清一家公司到底是在做游戏内容,还是在做能支撑机器人决策的仿真环境。
这三层不是并列关系,而是一条链:语言智能负责「知道该做什么」,世界模型负责「预判做了会发生什么」,物理智能负责「把这件事真的做出来」。过去五年,资本和人才主要挤在第一层;现在,挤进第二、第三层的速度明显更快了。
二、迁移的机制:语言智能的护城河耗尽了,物理世界的还没建成
语言智能能够快速变便宜,靠的是两个条件同时成立:互联网文本可以被规模化抓取,参数规模越大、能力上限越高。这两个条件在 2026 年已经先后失效——高质量文本语料早已被主流模型抓遍,开源阵营(Llama、Mistral、DeepSeek、通义等)把能力差距压到几个百分点,行业分析普遍认为推理成本还会在未来几年继续下探。当训练数据人人可得、模型能力人人可追平,先发者能守住的价格溢价自然会蒸发。
物理世界不满足这两个条件中的任何一个。世界上并不存在一个「互联网」,收藏着机器人拧螺丝、擦桌子、在湿滑地面上保持平衡时的动作与状态同步数据——这类数据必须靠真实的物理交互才能产生,不可能靠读取网页就能生成。这正是这场迁移的因果链条:当一层的数据来源可以被互联网规模化抓取,它会被迅速拉平价格;当一层的数据只能靠真实世界交互重新生成,先发的数据积累就会重新变成壁垒。 世界模型和物理智能恰好都落在后一种情形——世界模型要学会物体的材质、形变和碰撞规律,这类带物理标注的三维数据比训练渲染器用的网络视频稀缺得多;物理智能要学会把语言目标转成关节指令,这类数据只能靠机器人在真实世界或高保真仿真里反复试错来产生。
这也划出了这套判断的适用边界:它只对结果依赖真实物理交互、并且现实约束是主要瓶颈的任务成立。纯符号世界里的工作——写文案、查资料、生成代码草稿——不会因为这场迁移重新变贵,它们会继续沿着语言智能的价格曲线一路往下走。
三、正例:谁把预测和动作打通成一个闭环
判断这场迁移是不是真在发生,比听公司怎么说更可靠的办法,是看谁真的把「预测」和「动作」焊在了一起,而不是分开卖成两条产品线。
NVIDIA 的 Cosmos 3 是目前最完整的正例。它把视觉推理、世界建模和动作生成放进同一套系统,用混合专家架构训练——这种架构把参数拆成多个专家模块,每次推理只激活其中一部分,在不牺牲能力的前提下大幅降低成本。训练语料包含近 10 亿张图片、4 亿段真实与合成视频,以及来自人类和机器人的动作数据。它的价值不在于「又一个大模型」,而在于把「机器人该往哪个方向理解世界」和「理解完之后该怎么动」压进同一次推理。NVIDIA 官方给出的说法是,这能把物理 AI 的训练评估周期从几个月压缩到几天。
Physical Intelligence 走的是另一条同样闭环的路径:把摄像头画面和机器人的历史动作一起编码成 token,喂给一个 30 亿到 50 亿参数的模型,用户给出「倒一杯拿铁」这样的自然语言目标,模型在大约 100 毫秒内预测出接下来 50 步的关节动作,并保证力度和速度落在安全范围内。这里没有「先做一个世界模型,再单独做一个执行模块」的分工,预测本身就是可执行的动作序列。
这条规则可以反过来验证:只做渲染、不接执行系统的公司,商业价值会更多留在游戏、影视和虚拟现实这类不要求物理正确性的场景;只做机器人硬件、不接世界模型能力的公司,会持续被「演示很精彩、良品率上不去」的问题卡住。真正被资本和企业客户追着买单的,是能把两端焊成一个闭环的团队——这也是 Amazon、梅赛德斯-奔驰、宝马、John Deere 这些企业买家已经从「参股观望」转向「实际部署」的那批公司。
四、边界:方向已经清楚,量级和时点还早
这套迁移判断需要一个诚实的边界,否则很容易被少数几场发布会的声量带偏。
先看量级。2026 年,四大云厂商加上甲骨文,在 AI 基础设施上的资本支出合计大约在 6300 亿到 7250 亿美元之间;同一年,全球机器人创业公司拿到的融资约 188 亿美元,其中明确归入物理智能类别的部分约 74 亿美元。也就是说,物理层的资本规模只有基础设施层的几十分之一。迁移目前体现在增速和话语权上,还没有体现在总盘子的绝对规模上。 把「资本正在加速流入」读成「物理层已经反超基础设施层」,是这场迁移最容易被人误读的一步。
再看数据瓶颈本身能不能靠砸钱解决。真人远程操控——操作员佩戴设备远程控制机器人完成动作,用来生成高保真训练数据——是目前公认质量最高的数据来源,单小时成本已经从 2024 年初的约 340 美元降到 2026 年 3 月的约 118 美元,但每个操作员每小时也只能产出 5 到 50 条数据。有公司开始想别的办法:DoorDash 在 2026 年 3 月上线了一款独立 App,付费让美国的外卖骑手戴上摄像头,拍下自己洗碗、叠衣服、整理床铺的过程,用来训练家用机器人。但据行业人士测算,机器人要做到「开箱即用」的通用能力,大概需要积累一亿小时的具身数据;一位机器人公司高管的说法更直接:给一个特定任务收集一万条数据是可行的,但给一千万个不同任务各收集一万条数据,在经济上未必成立。多砸钱能买更多硬件和工程师,却买不到本来就不存在的真实交互数据。
安全和责任框架跟得更慢。目前全球还没有一套完整覆盖人形机器人的安全标准,几项关键标准最早也要到 2027 年才会正式批准;一次机器人事故往往牵涉硬件厂商、模型开发者、系统集成商和运营企业四方,责任该由谁承担,目前在多数司法管辖区都还没有定论。这不会改变迁移的方向,但会拖慢它进入高风险场景的速度。
五、这套判断会被什么推翻
如果「竞争正在向物理智能和世界模型迁移」这个判断成立,接下来应该能观察到三件事:顶尖研究人才和资本会持续从纯语言模型项目流向具身智能和世界模型团队;真实世界交互数据的采集管道本身会变成被收购、被投资的战略资产,就像半导体晶圆厂在芯片产业链里的位置;市场会逐渐淘汰只讲渲染效果、不具备物理正确性的「世界模型」项目,只有真正能同时完成渲染、模拟、规划三件事的系统才能拿到溢价。
反过来,如果两三年后,语言模型公司的融资和人才虹吸能力没有明显减弱,「世界模型」始终只是内容生成工具的营销包装,物理层的资本规模没有持续跑赢基础设施层的增速——那么这套判断就要被推翻,重新退回到「AI 竞争仍然主要发生在语言智能内部」的原判断。
这张图里最容易被忽略的是最后一步:迁移不会让「地板」消失,只会让地板重新出现在更高的一层。世界模型里能被规模化复制的部分——比如只追求视觉效果的渲染器——迟早也会跌成地板,就像语言智能一样。真正稀缺的,永远是当下这一层里还不能被规模化复制的那部分能力。
结论:稀缺与边缘,搬进了物理世界
语言智能已经跌成地板价,这并不意味着 AI 竞争结束了,而意味着它换了一层继续打。这场迁移之所以能够成立,根子在于物理世界的数据不能像文本那样被互联网抓取——只能靠真实交互重新生成,这重新筑起了先发者的数据壁垒。方向已经清楚,但量级和时点要分开看:物理层的资本规模目前只有基础设施层的几十分之一,数据管道和安全立法都还没追上演示视频的速度。
收束下来,新的稀缺资产落在三处:能规模化生产真实物理交互数据的管道——无论是远程操控设施、企业部署合作,还是像 DoorDash 那样从存量场景里提取动作数据;能同时完成渲染、模拟、规划三件事的世界模型能力,而不是只做漂亮画面的内容生成器;能把预测和动作打通成一个闭环的系统整合能力,而不是把两端外包给不同团队再指望它们自己拼起来。
这也是「稀缺在边缘」的又一次验证:中心的「合格」会被压成地板,边缘会随能力持续外移。上一轮的边缘是专属数据和执行系统;这一轮,边缘搬进了物理世界本身。
参考信号
- 本系列前作:Agentic AI 的真实架构:LLM 是智力,Harness 是执行系统,Data 是资产 | AI 不是第七层:认知与协调正在成为可复制的生产能力 | 用好 LLM 先看懂它:看的是全局分布,压的是规律
- 延伸阅读(稀缺在边缘系列):AI 把合格变成地板:优势必须追着边缘走 | 在不相关的行业里偷窥已知未来
- 语言智能报价(均为 2026 年 8 月查证的官方页面):OpenAI, Advancing the price-performance frontier with GPT-5.6;OpenAI Developer Community, GPT-5.6 Terra/Luna 价格下调公告;Google AI for Developers, Gemini Developer API pricing;VentureBeat, Gemini 3.6 Flash 长链路任务成本降幅;Anthropic, Claude API Pricing;DeepSeek, Models & Pricing;Requesty, Z.ai GLM-5.2 API Pricing(转引 docs.z.ai 官方报价);Moonshot AI, Kimi K3 Quickstart;Gartner via HPCwire/AIwire, Gartner Forecasts 90% Drop in LLM Inference Costs by 2030
- 世界模型分类与产品:World Labs, A Functional Taxonomy of World Models;World Labs, Marble: A Multimodal World Model;Google DeepMind, Genie 3: A new frontier for world models;Google, Project Genie public launch;Waymo 定制版 Genie 3 用于自动驾驶仿真,见 WaveSpeed, Google DeepMind Genie 3;World Labs $1B 融资见 Bloomberg, AI Pioneer Fei-Fei Li's Startup World Labs Raises $1 Billion;LeCun 出走与 JEPA 路线见 Time, World Models Are AI's Next Frontier
- 物理智能平台与融资:HPCwire/AIwire, NVIDIA Launches Cosmos 3;NVIDIA Newsroom, Cosmos 3 发布稿;The Robot Report, Physical Intelligence raises $600M;Crunchbase News, Robotics Startup Venture Funding Surges 2026
- 数据瓶颈与安全立法:TechTimes, The Data Drought: Why Embodied AI Can't Just Read the Internet;BigGo Finance, Robot "ChatGPT Moment" — Three Walls;RoboticsBiz, ISO Safety Standards for Humanoid Robots 2026;German Law Journal via Cambridge Core, Reconstructing Liability Mechanism for Humanoid Robot Accidents
- 基础设施层资本支出对比:Futurum Group, AI Capex 2026: The $690B Infrastructure Sprint
- 中国世界模型阵营:Dealroom, BAAI Conference 2026;CGTN, From language AI to physical AI: 1st general world foundation model unveiled in China