大模型商业演进 · #8

两年跌到 0.5%,AI 开始争夺物理世界

GPT-4 的报价三年后被 DeepSeek V4 Flash 压到两百分之一,Gemini 3.6 Flash 光靠效率提升就能把实际任务成本再砍掉六成——语言智能这一层的议价权正在消失。同一时间,资本、顶尖人才和行业话语权成规模涌向另外两层:能预测物理世界如何演化的世界模型,和能把判断变成受控动作的物理智能(physical AI)。最新模型报价和任务成本揭示了这场迁移的动力,也让迁移之后的稀缺与边缘逐渐清晰。
张飞 · Herline 创始人

· 更新于 2026-08-19

15 分钟阅读 · 5098

阅读 转发 留言
本文目录

TL;DR

语言智能的护城河建立在两个条件上:互联网文本可以被规模化抓取,参数越大能力越强。这两个条件在 2026 年已经耗尽——以 2023 年 GPT-4 每百万 token 30/60 美元为基准,DeepSeek V4 Flash 已降到 0.14/0.28 美元,降幅约 99.5%;就算是旗舰款 Claude Opus 5 和 GPT-5.6 Sol,输入价也降了 83%。牌价之外,任务成本降得更快:Gemini 3.6 Flash 官方牌价只降了 17%,但在长链路任务上的实际成本降幅高达 65%,因为模型同时学会了用更少的思考步骤把事情做完。语言智能这一层正在变成地板,且旗舰款和经济款的降价速度并不同步——先垮的是中间层和经济款。与此同时,NVIDIA、Google DeepMind、World Labs、Physical Intelligence、Figure AI 与中国的 BAAI 阵营都在把资本和叙事重心转向另外两层:世界模型(预测物理世界如何演化,可拆成渲染、模拟、规划三种能力)和物理智能(physical AI,把判断转成机器人可执行的受控动作)。迁移能够成立,是因为物理世界的数据不能像文本一样被互联网抓取,只能靠真实交互重新生成——这重建了先发者的数据壁垒。但方向不等于时点:物理层的资本规模仍只有基础设施层的几十分之一,数据管道和安全立法都还没跟上演示视频的速度。收束下来,新的稀缺资产有三类:能规模化生产真实物理交互数据的管道、能同时完成渲染、模拟、规划三件事的世界模型能力,以及能把预测和动作打通成一个闭环的系统整合能力。

核心论点

  1. 语言智能的护城河依赖两个正在耗尽的条件——互联网文本可规模化抓取、参数越大能力越强;以 2023 年 GPT-4 为基准,DeepSeek V4 Flash 降价约 99.5%,旗舰款 Claude Opus 5 / GPT-5.6 Sol 也降了 83%,标志这一层正在变成地板,且经济款比旗舰款垮得更快
  2. GPT-4 三年前用全市场最高报价锁定了当时的稀缺与边缘,三年后连表里报价最低的经济款都排不进去;语言智能内部已经完整跑完一轮「今天的边缘,就是明天的地板」,这是接下来迁移会在物理世界重演一次的直接证据
  3. 算清楚语言智能变便宜的真实速度要用两把尺子:牌价(每百万 token 的报价)和任务成本(牌价 × 完成任务实际耗费的 token 数);Gemini 3.6 Flash 牌价只降 17%,但长链路任务的实际成本降了 65%,只看牌价会低估真实降价速度
  4. 把「AI 竞争」拆成三层才看得清战场:语言智能(理解与生成文本)、世界模型(预测物理世界如何演化,含渲染、模拟、规划三种功能)、物理智能(physical AI,把判断转成受控物理动作)
  5. 迁移能够成立的机制在于数据来源不同:物理世界的动作—状态数据不能被互联网抓取,只能靠真实交互重新生成,这重建了先发者的数据壁垒
  6. 正例是把预测和动作打通成单一闭环的系统——如 NVIDIA Cosmos 3 与 Physical Intelligence 的机器人基座模型;负例是数据与安全立法仍是硬约束——远程操控产能有限,安全标准最早也要到 2027 年才能落地
  7. 收束下来的稀缺资产有三类:真实物理交互数据管道、能同时完成渲染、模拟、规划三件事的世界模型能力、把预测与动作打通成闭环的系统整合能力;方向已经清楚,量级和时点仍需分开判断

三年前,GPT-4 的 API 报价是每百万输入 token 30 美元,输出 60 美元。今天,同一张报价单上挤满了比它更强、也比它便宜得多的选项:

模型 发布方 · 定位 输入价($/百万 token) 输出价($/百万 token) 相比 GPT-4 降幅(输入)
GPT-4(2023-03,基准) OpenAI · 旗舰 $30.00 $60.00 ——
Claude Opus 5 Anthropic · 旗舰 $5.00 $25.00 ↓83%
GPT-5.6 Sol OpenAI · 旗舰 $5.00 $30.00 ↓83%
Claude Sonnet 5(标准价) Anthropic · 主力 $3.00 $15.00 ↓90%
Kimi K3(2026-07-16 发布) 月之暗面 · 主力(国产开源) $3.00 $15.00 ↓90%
GPT-5.6 Terra OpenAI · 主力 $2.00 $12.00 ↓93%
Gemini 3.6 Flash(2026-07-21 发布) Google · 主力 $1.50 $7.50 ↓95%
GLM-5.2(2026-06-16 发布) 智谱 AI · 主力(国产开源) $1.40 $4.40 ↓95%
DeepSeek V4 Pro 深度求索 · 旗舰(国产开源) $0.44 $0.87 ↓99%
GPT-5.6 Luna OpenAI · 经济款 $0.20 $1.20 ↓99%
DeepSeek V4 Flash 深度求索 · 经济款 $0.14 $0.28 ↓99.5%

降幅的计算方式很直观:(基准价 − 现价)÷ 基准价。以表里降得最彻底的 DeepSeek V4 Flash 为例,输入端(30 − 0.14)÷ 30 ≈ 99.5%,输出端(60 − 0.28)÷ 60 ≈ 99.5%——这也是它常被形容为「比 GPT-4 便宜两百倍」的原因。

这张表还藏着一层容易被忽略的分化:降得最猛的是经济款,旗舰款的降幅明显更克制——GPT-5.6 Sol 的输出价比 GPT-4 只降了 50%,Claude Opus 5 降了 58%,仍然比中间价位的机型贵出一个数量级。地板在往下沉,但旗舰层的议价权还没见底。 稀缺始终追着边缘移动:先垮的是「够用就好」的中间层和经济款,最后才轮到真正的前沿能力。

「开源必然更便宜」这个假设,本身也该打个问号。DeepSeek V4 Flash 和 GLM-5.2 确实把价格压到了地板,但月之暗面 7 月发布 Kimi K3 时,并没有延续上一代 Kimi K2「超便宜打穿前沿」的路线,而是直接把报价定进了和 Claude Sonnet 5 同一个价位段——3 美元对 15 美元。国产开源模型不再自动等于廉价模型,它们也在往「按能力定价」的方向走。

光看牌价,还会低估语言智能变便宜的真实速度,因为完成同一个任务需要「想」多少步、烧多少 token,也在跟着降。想算清楚一次任务到底便宜了多少,得用两把尺子:一把是牌价(每百万 token 多少钱,好比油价),一把是任务成本(牌价 × 完成一次任务实际耗费的 token 数,好比一箱油能跑多远)。Google 发布 Gemini 3.6 Flash 时给出了两组可以对照的数字:官方牌价上,输出单价只从上一代的 9 美元降到 7.5 美元,降了 17%;但在长链路工程任务上,Google 测算的实际任务成本最多降了 65%——因为新模型同时学会了用更少的思考步骤把同一件事做完。只看牌价,会把语言智能变便宜的真实速度低估两到三倍。这一层的现状是:牌价和任务成本都在往地板探,只是旗舰款还没探到底。

这张表本身,就是一次完整的「稀缺追着边缘跑」的演示。三年前,GPT-4 用整个市场最高的报价,锁定了当时机器智能的边缘——没有更贵的选项,是因为没有更强的选项,那份 30 美元/60 美元的报价单本身就是稀缺的标价。三年后,它连表里的经济款都排不进去:报价最低的 DeepSeek V4 Flash,只要它当年报价的 0.5%,而能力早已在公开评测上全面超过了 2023 年的 GPT-4。边缘没有消失,只是搬去了别处;GPT-4 曾经占据的位置,被后来者从地板一路挤了上去。语言智能这一层内部,已经完整跑完了一轮「今天的边缘,就是明天的地板」。同一轮变化正在物理世界出现:标准化能力不断变成地板,稀缺转向尚未被低成本复制的数据和执行系统。

巧合的是,同一段时间里,另一件事在同步发生:NVIDIA 把公司叙事整体转向「物理智能」(physical AI),6 月发布了训练数据量达 20 万亿 token 的 Cosmos 3;Google DeepMind 把 Genie 3 开放给订阅用户,还专门为 Waymo 定制了一套用来模拟极端路况的世界模型;李飞飞的 World Labs 在半年内融到 12.3 亿美元;Yann LeCun 离开 Meta,专门去做一种叫 JEPA 的世界模型新架构;中国的北京智源大会把主题从「大模型」换成了「世界模型」,发布了号称首个通用世界基座模型的 Physis-v0.1。机器人创业公司在 2026 年上半年拿到的融资,已经超过了 2025 年全年。

语言智能在跌价,物理世界这一层的资本和话语权却在暴涨。这场迁移沿着三层发生:语言智能变成低价地板,世界模型争夺对物理变化的预测能力,物理智能争夺把判断变成受控动作的执行能力。新的稀缺,也随之转向物理数据、世界模型与系统整合。

一、把「AI 竞争」拆成三层,才能看清战场在哪

「AI」这个词已经太庞大,庞大到没法用来判断资本和人才到底在往哪里流动。一个更有用的做法,是把它拆成三层,每层各有各的定价逻辑:

语言智能——理解和生成文本、代码、对话,输出是符号。世界模型——预测物理世界接下来会怎样变化,输出是对现实的模拟。物理智能(physical AI,也称具身智能)——把判断转成机器人、机械臂或自动驾驶系统能够执行的受控动作,输出是物理世界里真实发生的位移和接触。

「世界模型」这个词本身也在被滥用,需要再拆一层。World Labs 在 6 月发布的一篇分类文章,把它拆成三种能力:渲染器(生成好看的画面,衡量标准是视觉真实感)、模拟器(构建物体如何受力、碰撞、形变的物理模型)、规划器(在模拟的世界里决定下一步该做什么)。三种能力常被同一个词打包销售,但本质完全不同——Google DeepMind 的 Genie 3 能实时生成可探索的 3D 场景,每秒 24 帧、在几分钟内保持画面连贯,这是一台出色的渲染器,但论文里也明确说了它「没有对三维结构的显式理解」;World Labs 自己的 Marble,则同时输出可供人观赏的画面和物理引擎能直接读取的碰撞网格,这才踩进了模拟器的门槛。分不清这三种能力,就分不清一家公司到底是在做游戏内容,还是在做能支撑机器人决策的仿真环境。

这三层不是并列关系,而是一条链:语言智能负责「知道该做什么」,世界模型负责「预判做了会发生什么」,物理智能负责「把这件事真的做出来」。过去五年,资本和人才主要挤在第一层;现在,挤进第二、第三层的速度明显更快了。

继续阅读完整内容

两年跌到 0.5%,AI 开始争夺物理世界

GPT-4 的报价三年后被 DeepSeek V4 Flash 压到两百分之一,Gemini 3.6 Flash 光靠效率提升就能把实际任务成本再砍掉六成——语言智能这一层的议价权正在消失。同一时间,资本、顶尖人才和行业话语权成规模涌向另外两层:能预测物理世界如何演化的世界模型,和能把判断变成受控动作的物理智能(physical AI)。最新模型报价和任务成本揭示了这场迁移的动力,也让迁移之后的稀缺与边缘逐渐清晰。

免费注册后,即可从这里继续阅读全文,无需购买会员。已有账号可直接登录。

分享 / SHARE微博

Discussion

留言0