← 返回文章与札记

AI的“大合流”:从数字比特到物理原子的世界模型

听张家兴老师《世界与模型》后的学习札记

本文写于2025年11月。文中涉及产业进度、技术差距等判断,均保留当时课堂语境。

AI正在发生一场很有意思的“大合流”。

一边,是这些年越来越为人熟悉的大模型、自然语言和数字智能;另一边,是机器人、机械臂以及真实的物理世界。过去很长时间里,它们像两条各自向前的河流,如今却越来越接近。

这是我听张家兴老师《世界与模型:Bring Models into the Real World》时留下的最深印象之一。

那堂课技术密度很高,从深度学习一路讲到强化学习、自然语言、Transformer和具身智能。真正吸引我的,却不只是那些技术名词,而是它们背后反复出现的一个问题:模型怎样从数字世界走进真实世界?

听完以后,我试着把这堂课重新整理成一张自己能够理解的地图。

从数字AI到物理AI

张老师开篇谈到,AI的发展可以看到两条长期并行的线。

一条是“模型线”。从深度学习、大语言模型到越来越复杂的AI系统,主要发生在数字世界里。另一条是“机器人线”。机器必须拥有真实的身体、传感器和机械结构,并在物理环境中行动。

当两条线逐渐汇合,具身智能便进入视野。

张老师在课堂上强调,模型只有真正与现实世界发生交互,才可能进一步理解现实世界中的许多概念。比如“软”和“硬”,如果一个系统从来没有真正接触、操作过物体,它获得的理解,与一个在物理世界中不断行动并获得反馈的智能系统并不完全相同。

这里背后其实有一个很有意思的认识:智能未必只是“大脑里的计算”,身体与环境也可能参与智能本身的形成。

所以,“Bring Models into the Real World”这句话,后来成了我理解整堂课的一条主线。

所谓智能,也许首先是“组织起来的计算”

为什么大量计算最后会表现出某种“智能”?

张老师用了一个很简洁的说法:

“组织起来的计算。”

如果把AI模型想象成一个极其复杂的网络,每一个神经元只是其中很小的计算单元。真正发生变化的,不是单个计算有多神奇,而是大量计算如何被连接和组织起来。

张老师举过识别人脸的例子。网络前面的层也许先识别线条,再往后逐渐识别眼睛、鼻子等局部特征,最后形成“脸”这样更高层次的表示。

这个例子也帮助我理解了为什么“端到端”会成为现代AI的重要思路。

传统系统往往把任务拆成许多模块:先判断意图,再分析语法,再检索,再执行规则。每一个模块都经过人工设计,也意味着每一个环节都可能成为错误来源。

端到端学习则把更多内部路径交给模型本身。人提供输入、目标和反馈,模型在训练过程中调整内部参数,寻找能够更好完成任务的方式。

它改变的不只是技术架构,也是一种设计思路:过去更多是人把过程规定好;现在越来越多时候,是人规定目标,再让模型在训练中寻找实现路径。

从模仿,到探索

学习方式的变化,是这堂课另一个让我印象很深的部分。

我们最熟悉的是监督学习:给模型大量样本和标签,让它从已有数据中学习规律。这很像模仿——先有人把样子做出来,再从中学习。

强化学习则不同。

张老师用“训练小狗握手”来解释:不必先让它看一千段标准动作,而是让它不断尝试。当某个动作接近目标时给予奖励,偏离目标时则不给奖励或给予负反馈。

系统由此形成一个闭环:

尝试 → 获得反馈 → 调整策略 → 再次尝试

这让我意识到,数据并不是学习的全部。一个系统还可以通过行动、反馈和探索不断调整自己的行为。

课堂上还谈到另一种非对称现象:很多时候,判断一个结果“好不好”,比从零创造一个好结果更容易。如果能够大量生成,再通过评价和反馈进行筛选,也可能形成新的训练路径。

我后来觉得,这个认识并不只属于AI。人在很多事情上的学习其实也一样:模仿重要,但真正形成自己的能力,往往还是要经过尝试、反馈和修正。

语言为什么如此重要

这堂课里,我最感兴趣的部分之一,是张老师对自然语言的理解。

我们通常把语言看成沟通工具:我说一句话,你理解我的意思。但大模型出现以后,语言的作用显然已经超出了“沟通”。

人自己思考时,也常常借助内部语言。我们会在脑中问自己:“这个问题到底是什么?”“下一步应该怎么办?”“刚才那个判断是不是需要修正?”

张老师用“自说自听”来形容这种现象,并由此谈到语言在大模型推理、规划和任务组织中的作用。

我更愿意把它理解为:语言正在成为组织复杂行为的一种通用媒介。

到了Agent时代,这一点更加明显。规划、搜索、执行、检查等不同环节,可以借助自然语言交换信息和协调任务。语言因此从人与人之间的交流工具,进一步进入人与机器、机器与机器的协作过程。

Transformer背后的注意力机制,也可以从一个朴素的问题去理解:在已经出现的大量信息中,此刻哪些内容与当前任务更加相关?

模型处理上下文时,并不是平均对待所有信息,而是根据当前计算需要,对不同部分赋予不同程度的关注。

复杂技术背后,其实对应着一个很直观的问题:

此刻,我应该注意什么?

模型真正走进世界以后

数字世界里的模型一旦准备进入真实世界,许多原本隐藏的问题便一下子暴露出来。

代码世界相对干净,而现实世界充满噪声、摩擦、误差和延迟。

第一个问题是数据。大语言模型可以从互联网上获得巨量文本,而机器人真正与现实世界交互的数据要昂贵得多。真实动作往往需要人在现场示范、采集,一点一点积累。

第二个问题是身体。一套机械结构采集到的数据,换到另一套结构以后,不一定能够完整迁移。机器人不是只有“脑”,还有不断变化的“身体”。

第三个问题是时间。聊天模型晚几秒回答,我们通常还能接受;机器人却不同。一个杯子正在移动,你不可能让机器根据十秒以前看到的位置再伸手去抓。现实世界要求更高频、更连续的反馈。

所以,真正困难的并不是简单地把一个大模型“装进机器人”。

更大的挑战是:一个主要在数字环境中训练出来的智能系统,怎样适应现实世界的复杂、粗糙和不确定。

这可能正是从“比特”走向“原子”最难的一步。

信任、团队,以及AI走向成熟

课程最后,张老师谈到AI的可解释性。

端到端模型的很多内部过程,对人而言并不透明。我们知道输入是什么,也能看到输出,但很难完整解释其中每一步究竟为什么发生。

张老师提出了一个很有意思的观点:

“信任,不一定需要解释。”

他的意思当然不是说解释不重要,而是在提醒我们:人类社会里的信任,本来也不完全建立在“知道对方脑中每一步怎么想”之上。更多时候,我们通过一个人长期、稳定、可验证的行为,逐渐形成信任。

如果把这个思路放到AI上,可靠性、安全测试、长期表现和可验证行为,也可能成为建立信任的重要基础。

课堂最后还有一个判断,我也很有感触。

早期AI的发展经常与少数顶尖科学家的名字联系在一起。但随着系统规模越来越大,真正推动AI向前的,已经越来越依赖模型、数据、算力、工程、产品、安全等多方面的协同。

张老师把它概括为从“大师驱动”走向“团队作战”。

一个技术真正进入产业,往往意味着它开始从少数人的突破,走向组织能力、工程能力和长期协作。

张老师在当时的课堂上还谈到中美AI发展差距、中国工程化能力以及产业节奏。这些都是2025年那个时间点上的观察。今天再回头看,当然仍需要用新的事实不断检验。

这也提醒我:技术时代的很多判断,都应该保留自己的时间坐标。

从比特,到原子

张老师最后说,一个技术往往先由学术界证明价值,再进入工业界的大规模落地,中间需要时间,人们对技术的认识也会随之改变。

我后来再回头想,这堂课真正留下来的,并不是某一个技术名词,而是一条更大的线:

AI正在从数字世界里的模型,逐渐走向真实世界里的身体、行动和环境。

从比特到原子,从语言到行动,从“知道”到“进入世界”,这条路究竟会走到哪里,现在还很难回答。

这正如唐人诗中所言:

海日生残夜,江春入旧年。

新的智能时代,并不等旧的一页完全翻过,已经携着许多尚未回答的问题,慢慢进入我们的现实生活。