AI论道
舒 勇
2022年,大语言模型ChatGPT的推出,掀起了全球人工智能行业的大模型发展热浪。
彼时,“参数越多、数据规模越大、算力越强,智能水平就越高”被奉为行业准则。大量资金涌入大模型领域,千亿参数成为行业标配,万卡集群成了入局门槛,业内一度形成共识:不做大模型的AI企业,会被市场淘汰。
而时至今日,行业的实际发展并未达到最初预期。千亿参数模型单次训练成本需以千万元计,推理环节算力消耗惊人;数据规模扩大300倍,模型性能仅能提升个位数百分点;全行业无一款大模型能实现AGI(通用人工智能)的落地……
一个疑问在学界和业界浮现:依托大语言模型实现超级智能,是否进了一条“死胡同”?
当下的大语言模型,本质是一个“超级语言匹配器”,靠在海量文本里摸透词语搭配的统计规律,顺着前文逐个选出概率最高的词拼接成句。它只能做到“知其然”,却做不到“知其所以然”。这就好比一个人背下了整本百科全书,却从未走出过房门。它能在文字互动里表现得如同智者,放到物理环境中却像懵懂的婴儿。
那么除了大模型之外,还有其他选择吗?答案是肯定的。
现在,已经有越来越多研究者开始探寻大模型以外的其他可行方案,并且要比我们预想的更丰富,也更深刻。
1 路径一:世界模型
纽约大学教授、图灵奖得主杨立昆一直推崇“世界模型”的发展路径,它的主要思路是:让AI在自身的“虚拟空间”里搭建出一个对应真实世界、可进行交互的动态模拟系统。它要理解物理规则,例如物体为什么会向下掉落、力如何传递、空间是怎样构成的。它需要把研究方向从“预测下一个Token”转向“预测下一个物理状态”。
美国斯坦福大学教授李飞飞提出的“空间智能”和这个思路一脉相承——智能不只是文字层面的逻辑游戏,更包含对空间的感知、想象以及推理能力。她所定义的世界模型需要拥有三种能力:生成性、多模态性、交互性。
国内也有团队在探索类似的研发方向。仝人智能科技(西安)有限公司创始人吴易明认为,与其给机器人输入大量数据,不如直接给它装上一个可感知物理空间的“大脑”,让它可以像人类一样自主认知周遭世界。该团队考量人类认知的具身特征,搭建出一套可解释的数学架构,这套方案的训练成本较低,和大模型动辄数千万美元的训练开销形成了鲜明对比。
从世界模型的角度看来,智能的本质,是要去理解真实世界的运行规律。一个仅能生成通顺语句的AI,和一个可以真正独立思考的AI,二者间的差距,很可能比我们设想的还要大得多。
2 路径二:非Transformer架构
Transformer架构这种全靠“注意力机制”的路子,自2017年被提出后,几乎占据了所有大模型的主流应用位置。但它的缺陷也很明显:它的计算复杂度呈二次方增长,生成的Token越长,对算力的要求就越高,这意味着,模型规模变大后,运算效率反而会出现下降。
当前,一批新的架构正在挑战这个垄断。美国产业界已有以RWKV为代表的新一代线性架构,它把计算复杂度从二次方降到了线性,计算量不再随内容长度暴涨,而是匀速增长,可以有效降低运行能耗。
在国内,也有研发团队在探索更贴近生物智能的技术路线。中国科学院自动化研究所团队发布的类脑脉冲大模型“瞬悉1.0”,借鉴了大脑神经元工作机制,提出新的线性计算架构。该模型仅需主流模型约2%的数据量,就能达到相当的语言理解与推理性能,且全流程可在国产GPU平台上运行,为自主可控的非Transformer架构提供了可行路径。
此外,上海岩芯数智人工智能科技有限公司自研的Yan架构大模型,以神经元选择激活为核心,是国内首个通过备案的非Transformer通用大模型,可在低功耗工控机等终端设备上流畅运行。
寻找效率更高、能耗更低、更贴近真实智能规律的新架构,是AI产业突破成本瓶颈、实现规模化落地的刚需。就像飞机的发明,并未被模仿鸟类扇动翅膀的思路所困囿,人工智能的最终产业形态,也不会止步于Transformer架构的衍生版本。
3 路径三:端侧智能
当前的大模型还有一个特征——“中心化”,所有智能都集中在云端,需要依赖规模庞大的数据中心支撑运行。
可智能真的有必要这样集中吗?
2026年美国消费电子展上,小模型+端侧AI的崛起已成为一个非常明显的趋势,从离线多语言翻译、本地化图像生成到机械臂实时控制,原本需要云端完成的复杂任务,如今在手机、笔记本电脑、智能眼镜等设备中即可本地化高效实现。
所谓端侧AI,是将经大模型“蒸馏”后的小模型“装进”手机、电脑、汽车等终端设备,使其无需依赖云端服务器,即可独立完成感知、计算、决策全流程的方案。一方面,数据无需上传,可降低隐私泄露风险;另一方面,本地推理将响应延迟压缩至毫秒级。
这条路线的底层逻辑,已有来自学界的理论支撑。清华大学计算机系副教授刘知远团队通过对数十个主流大模型的测算研究,提出“大模型密度定律”。研究显示,大模型的“能力密度”约每三个月翻一番,也就是说,每隔100天左右,就能用一半的参数量,实现此前顶尖大模型的同等性能。刘知远据此判断,未来最前沿的AI技术,会首先落地在端侧。
中国信息通信研究院2025年底发布的《数字消费蓝皮书(2025年)》预计,未来三年,我国AI手机和AIPC市场渗透率将分别突破50%和80%,车载终端也将通过集成智能座舱与智能驾驶系统实现服务升级,智能终端将走入“本地智能”时代。
可以畅想,未来的智能生态,或许不再由少数几个云端大模型主导,而是由无数运行在各类终端上的小型智能体共同组成,织成一张分散协同、无处不在的智能网络。
4 路径四:具身智能与“无须训练”的智能
大模型的核心做法是“训练”——从海量数据中学习统计规律。但这是不是唯一的方法?
目前行业的探索主要分为两条路线。一条是“直接写入底层逻辑”的路线。国内已有团队在这条路线上进行研究,期待用数学方法搭建出物理世界的精准映射,让机器天生就能理解物理常识,无需靠大量数据训练习得。
另一条则是“仿真环境试错”的路线。北京智源人工智能研究院提出的物理AI发展路径中,有一条“现实—仿真—现实”的范式——先把真实的工厂、街道、家居环境一比一还原到数字空间里,再让AI在虚拟环境里反复尝试、自主探索,学会走路、抓取、操作设备等技能,再迁移到真实世界中。这就相当于给AI建了一座“训练场”。
可见,除了从现成数据里“读”出来,智能也可以在AI和真实世界不断互动的过程中“生长”出来。
结语
回到最开始的问题:发展人工智能,就一定得用大模型吗?答案是:不一定,而且很大概率不需要。
站在更高层面来看,我们还需要重新思考一个问题:到底什么是智能?
人类智能并不是单一维度的,它既有流畅的语言表达能力,也有对空间的感知能力;既有严密的逻辑推理,也有敏锐的直觉判断;既有知识储备的积累,也有创造创新的灵感。
而未来的人工智能,核心是多元智能的融合与共同发展。人工智能会形成一个完整的生态系统,而非只存在单一的技术路线。
未来,如果有人站在智能文明的视角回看当下,也许就能发现:大模型不是发展的终点,甚至算不上起点——它只是人类探索智能本质的道路上,一段值得尊重、但终究会被超越的旅程。
真正的人工智能革命,或许不久的将来就会到来。
(作者系全国政协委员、民进中央开明画院副院长)
责编:秦雅楠、王瑞景