AI的“大合流”:从数字比特到物理原子的世界模型
听张家兴老师《世界与模型》后的学习札记
本文写于2025年11月。文中涉及产业进度、技术差距等判断,均保留当时课堂语境。
AI正在发生一场很有意思的“大合流”。
一边,是这些年越来越为人熟悉的大模型、自然语言和数字智能;另一边,是机器人、机械臂以及真实的物理世界。过去很长时间里,它们像两条各自向前的河流,如今却越来越接近。
这是我听张家兴老师《世界与模型:Bring Models into the Real World》时留下的最深印象之一。
那堂课技术密度很高,从深度学习一路讲到强化学习、自然语言、Transformer和具身智能。真正吸引我的,却不只是那些技术名词,而是它们背后反复出现的一个问题:模型怎样从数字世界走进真实世界?
听完以后,我试着把这堂课重新整理成一张自己能够理解的地图。
从数字AI到物理AI
张老师开篇谈到,AI的发展可以看到两条长期并行的线。
一条是“模型线”。从深度学习、大语言模型到越来越复杂的AI系统,主要发生在数字世界里。另一条是“机器人线”。机器必须拥有真实的身体、传感器和机械结构,并在物理环境中行动。
当两条线逐渐汇合,具身智能便进入视野。
张老师在课堂上强调,模型只有真正与现实世界发生交互,才可能进一步理解现实世界中的许多概念。比如“软”和“硬”,如果一个系统从来没有真正接触、操作过物体,它获得的理解,与一个在物理世界中不断行动并获得反馈的智能系统并不完全相同。
这里背后其实有一个很有意思的认识:智能未必只是“大脑里的计算”,身体与环境也可能参与智能本身的形成。
所以,“Bring Models into the Real World”这句话,后来成了我理解整堂课的一条主线。
所谓智能,也许首先是“组织起来的计算”
为什么大量计算最后会表现出某种“智能”?
张老师用了一个很简洁的说法:
“组织起来的计算。”
如果把AI模型想象成一个极其复杂的网络,每一个神经元只是其中很小的计算单元。真正发生变化的,不是单个计算有多神奇,而是大量计算如何被连接和组织起来。
张老师举过识别人脸的例子。网络前面的层也许先识别线条,再往后逐渐识别眼睛、鼻子等局部特征,最后形成“脸”这样更高层次的表示。
这个例子也帮助我理解了为什么“端到端”会成为现代AI的重要思路。
传统系统往往把任务拆成许多模块:先判断意图,再分析语法,再检索,再执行规则。每一个模块都经过人工设计,也意味着每一个环节都可能成为错误来源。
端到端学习则把更多内部路径交给模型本身。人提供输入、目标和反馈,模型在训练过程中调整内部参数,寻找能够更好完成任务的方式。
它改变的不只是技术架构,也是一种设计思路:过去更多是人把过程规定好;现在越来越多时候,是人规定目标,再让模型在训练中寻找实现路径。
从模仿,到探索
学习方式的变化,是这堂课另一个让我印象很深的部分。
我们最熟悉的是监督学习:给模型大量样本和标签,让它从已有数据中学习规律。这很像模仿——先有人把样子做出来,再从中学习。
强化学习则不同。
张老师用“训练小狗握手”来解释:不必先让它看一千段标准动作,而是让它不断尝试。当某个动作接近目标时给予奖励,偏离目标时则不给奖励或给予负反馈。
系统由此形成一个闭环:
尝试 → 获得反馈 → 调整策略 → 再次尝试
这让我意识到,数据并不是学习的全部。一个系统还可以通过行动、反馈和探索不断调整自己的行为。
课堂上还谈到另一种非对称现象:很多时候,判断一个结果“好不好”,比从零创造一个好结果更容易。如果能够大量生成,再通过评价和反馈进行筛选,也可能形成新的训练路径。
我后来觉得,这个认识并不只属于AI。人在很多事情上的学习其实也一样:模仿重要,但真正形成自己的能力,往往还是要经过尝试、反馈和修正。
语言为什么如此重要
这堂课里,我最感兴趣的部分之一,是张老师对自然语言的理解。
我们通常把语言看成沟通工具:我说一句话,你理解我的意思。但大模型出现以后,语言的作用显然已经超出了“沟通”。
人自己思考时,也常常借助内部语言。我们会在脑中问自己:“这个问题到底是什么?”“下一步应该怎么办?”“刚才那个判断是不是需要修正?”
张老师用“自说自听”来形容这种现象,并由此谈到语言在大模型推理、规划和任务组织中的作用。
我更愿意把它理解为:语言正在成为组织复杂行为的一种通用媒介。
到了Agent时代,这一点更加明显。规划、搜索、执行、检查等不同环节,可以借助自然语言交换信息和协调任务。语言因此从人与人之间的交流工具,进一步进入人与机器、机器与机器的协作过程。
Transformer背后的注意力机制,也可以从一个朴素的问题去理解:在已经出现的大量信息中,此刻哪些内容与当前任务更加相关?
模型处理上下文时,并不是平均对待所有信息,而是根据当前计算需要,对不同部分赋予不同程度的关注。
复杂技术背后,其实对应着一个很直观的问题:
此刻,我应该注意什么?
模型真正走进世界以后
数字世界里的模型一旦准备进入真实世界,许多原本隐藏的问题便一下子暴露出来。
代码世界相对干净,而现实世界充满噪声、摩擦、误差和延迟。
第一个问题是数据。大语言模型可以从互联网上获得巨量文本,而机器人真正与现实世界交互的数据要昂贵得多。真实动作往往需要人在现场示范、采集,一点一点积累。
第二个问题是身体。一套机械结构采集到的数据,换到另一套结构以后,不一定能够完整迁移。机器人不是只有“脑”,还有不断变化的“身体”。
第三个问题是时间。聊天模型晚几秒回答,我们通常还能接受;机器人却不同。一个杯子正在移动,你不可能让机器根据十秒以前看到的位置再伸手去抓。现实世界要求更高频、更连续的反馈。
所以,真正困难的并不是简单地把一个大模型“装进机器人”。
更大的挑战是:一个主要在数字环境中训练出来的智能系统,怎样适应现实世界的复杂、粗糙和不确定。
这可能正是从“比特”走向“原子”最难的一步。
信任、团队,以及AI走向成熟
课程最后,张老师谈到AI的可解释性。
端到端模型的很多内部过程,对人而言并不透明。我们知道输入是什么,也能看到输出,但很难完整解释其中每一步究竟为什么发生。
张老师提出了一个很有意思的观点:
“信任,不一定需要解释。”
他的意思当然不是说解释不重要,而是在提醒我们:人类社会里的信任,本来也不完全建立在“知道对方脑中每一步怎么想”之上。更多时候,我们通过一个人长期、稳定、可验证的行为,逐渐形成信任。
如果把这个思路放到AI上,可靠性、安全测试、长期表现和可验证行为,也可能成为建立信任的重要基础。
课堂最后还有一个判断,我也很有感触。
早期AI的发展经常与少数顶尖科学家的名字联系在一起。但随着系统规模越来越大,真正推动AI向前的,已经越来越依赖模型、数据、算力、工程、产品、安全等多方面的协同。
张老师把它概括为从“大师驱动”走向“团队作战”。
一个技术真正进入产业,往往意味着它开始从少数人的突破,走向组织能力、工程能力和长期协作。
张老师在当时的课堂上还谈到中美AI发展差距、中国工程化能力以及产业节奏。这些都是2025年那个时间点上的观察。今天再回头看,当然仍需要用新的事实不断检验。
这也提醒我:技术时代的很多判断,都应该保留自己的时间坐标。
从比特,到原子
张老师最后说,一个技术往往先由学术界证明价值,再进入工业界的大规模落地,中间需要时间,人们对技术的认识也会随之改变。
我后来再回头想,这堂课真正留下来的,并不是某一个技术名词,而是一条更大的线:
AI正在从数字世界里的模型,逐渐走向真实世界里的身体、行动和环境。
从比特到原子,从语言到行动,从“知道”到“进入世界”,这条路究竟会走到哪里,现在还很难回答。
这正如唐人诗中所言:
海日生残夜,江春入旧年。
新的智能时代,并不等旧的一页完全翻过,已经携着许多尚未回答的问题,慢慢进入我们的现实生活。