我身边不少做自动驾驶的朋友,这两年陆续开始转方向了。有人去了具身智能公司,有人转向纯AI Infra,真正从量产一线跳出来自己干的,张颖算其中一个。他之前在自动驾驶公司做量产项目,从感知、规划、控制到数据闭环都摸过一遍,现在出来做AI for Physical AI——也就是用AI去理解和操作物理世界。这个转变很有意思,不是那种“做腻了换赛道”的逃离,而是把量产自动驾驶里积累的东西,平移到一个更接近通用机器人的方向上。
这篇文章我不打算写成人物专访,因为张颖本人的信息披露有限。我更想聊的是他这次转型背后暴露出的行业逻辑:为什么自动驾驶量产一线的人,会成为Physical AI创业的主力军?Physical AI到底是什么,和自动驾驶有什么关系,又有哪些技术点值得关注,以及如果你也想往这个方向走,应该怎么切入。
1. 从自动驾驶量产到Physical AI:本质是同一个问题的迁移
1.1 自动驾驶量产到底积累了哪些核心能力
先说结论:自动驾驶量产一线和Physical AI的底层能力高度重合,甚至可以说,前者是后者最接近的“预科班”。
张颖在量产一线做的工作,大致可以分成四块:感知系统的工程化落地,也就是传感器标定、多帧融合、目标追踪这些脏活累活;规划控制算法的实车调参,别以为就是把论文里的MPC或者Lattice Planner搬上车就完事,实际要处理的是转向延迟、刹车顿挫、横风干扰这些下三路问题;数据闭环体系搭建,从车端数据采集、回传、挖掘、标注到模型迭代,这是一个完整的飞轮,做不好就谈不上“越开越聪明”;最后是面向量产的安全验证,包括仿真测试、封闭场地测试、开放道路测试的三级验证体系。
这些东西放到Physical AI里,几乎没有一项是浪费的。机器人的感知系统要识别物体、理解场景,虽然传感器形态从多个摄像头加激光雷达变成了可能是RGB-D相机加力觉传感器,但感知算法的底层逻辑是一样的。机器人的操作策略要生成轨迹,要处理动态环境,要实时反馈,这和自动驾驶里的规划控制在数学上是非常接近的——都是在高维状态空间里找一个可行的、安全的、尽量最优的路径。机器人也需要数据闭环,只是数据的形态从“路采视频+点云”变成了“操作视频+力觉记录”。机器人更需要安全验证,因为它要进入家庭、工厂、医院,直接和人对面打交道,出错的代价比自动驾驶撞护栏要严重得多。
所以张颖从自动驾驶量产一线出来做Physical AI,本质上不是跨界,是把同一套方法论从一个物理载体搬到另一个物理载体上。要说区别,最大的变化是物理交互维度增加了:车只需要在一个平面世界里移动,机器人要在一个三维世界里同时做移动和操作,自由度翻了一倍不止。
1.2 Physical AI这个概念的来龙去脉
“Physical AI”这个词,真正被圈子里大规模讨论,是因为英伟达在GTC大会上的反复强化。黄仁勋的说法是,下一个AI浪潮不是生成文字和图片,而是生成动作——让AI能够理解物理规律,并在物理世界中完成交互。他把这个方向叫做Physical AI,核心载体就是人形机器人、自动驾驶汽车、工业机械臂这些有真实物理存在的智能体。
这个概念能火起来,有三个推手。第一个推手是大语言模型给AI圈带来的范式转移,大家相信zhuān注于“下一步词元预测”的方法论,可以迁移到“下一步动作预测”上。第二个推手是具身智能技术的突破,尤其是VLA模型的出现,把视觉、语言、动作统一到一个模型里,让机器人能够理解自然语言指令并直接输出动作。第三个推手是人形机器人硬件产业链的成熟,电机、减速器、传感器这些核心零部件的成本在快速下降,让“通用机器人”从PPT变成了能跑能跳的样机。
我个人理解,Physical AI和传统机器人的本质区别在于:传统机器人是“编程出来的”,每一个动作都是工程师预先写好的流程,换个场景就失灵;Physical AI是“学出来的”,它通过大量数据学习物理世界的规律,从而获得面对新场景的泛化能力。这就像自动驾驶里,规则时代的决策树已经走到了天花板,只有数据驱动的方法才能在长尾场景里生存。
1.3 为什么张颖这类人适合做这件事
做Physical AI创业,最容易犯的错误是低估物理世界的复杂度。一个做纯大模型出身的团队,可能会以为给机器人接一个ChatGPT,它就能自己干家务了。但真上手就傻眼:光是“拿起桌上那个红色杯子”这个指令,就要解决识别杯子、估计位姿、规划抓取点、避开障碍物、施加合适力度这一连串难题,任何一个环节出了问题,整个动作就失败了。
而张颖这类从自动驾驶量产一线出来的人,对物理世界的复杂度有着刻骨铭心的认知。他们见过暴雨天里传感器的失灵,见过十字路口行人横穿时的博弈难题,见过一个小小corner case让整个测试团队加班一个月。这种经验带来的不是某个具体的技术优势,而是一种“敬畏心”——知道物理世界有多难搞,知道系统要多鲁棒才能谈得上可用,知道数据要多闭环才能让模型持续进化。
另外,量产经历还带来一个隐性优势:供应链和工程化能力。做自动驾驶量产要解决的是在有限算力、有限成本下实现可落地的性能,这种约束意识在做机器人时尤其重要。很多人做Demo时很炫,一提到量产就哑火,就是因为从来没有被成本、可靠性、生产一致性这些“俗事”教育过。张颖这类人不一样,他们知道什么叫“为一个99%场景设计系统”,什么叫“为剩下的1%场景兜底”。
2. 瞄准Physical AI:核心赛道与关键技术拆解
2.1 世界模型:让AI学会物理常识
如果说大语言模型的本质是学习语言的统计规律,那么Physical AI第一个绕不开的技术点就是世界模型。所谓世界模型,说直白一点,就是让AI对物理世界建立一个内部的、可预测的表征。你推一个杯子,它知道杯子会倒;你扔一个球,它知道球会沿抛物线飞出去;你用手挡在机器人前面,它知道不能硬往前撞。
世界模型在自动驾驶里的应用其实已经开始了,业界热门的行为预测就依赖“场景理解+多模态预测”的能力,本质上就是在车端建立一个局部世界模型。到了Physical AI里,世界模型的粒度要细得多,因为你不仅要知道“前面有一辆车在减速”,还要知道“这个抽屉的阻尼有多大,该用多大力才能拉开”。所以现在的头部团队都在做“视频生成式世界模型”——用海量视频训练模型,让模型学会物体运动的物理规律,然后在部署时用来预测动作后果,相当于给机器人装了一个“脑内模拟器”。
这个方向的创业机会在于:通用的世界模型大概率是大厂或者头部AI实验室的菜,但面向特定物理交互场景的行业世界模型,还是一片蓝海。比如医疗手术场景、精密装配场景、仓储分拣场景,每个场景都有自己独特的物理规律,谁能做出一个“懂行”的世界模型,谁就掌握了这个行业的机器人智能底座。
2.2 VLA模型:打通视觉-语言-动作的桥梁
VLA,全称Vision-Language-Action Model,是目前Physical AI领域最炙手可热的方向。它的思路是把视觉输入(摄像头看到的画面)、语言输入(人类的指令描述)、动作输出(机器人的执行轨迹)统一到一个模型架构里。换句话说,你告诉机器人“把桌上那瓶水递给我”,VLA模型会理解这句话的语义,结合摄像头画面找到那瓶水,然后输出一个具体的抓取和递送动作序列。
VLA模型的出现,把机器人的“指挥系统”和“执行系统”合二为一了。以前的方案是:先让感知模型识别物体,再让规划模块生成轨迹,最后让控制模块去执行,一条流水线下来,中间任何一环出错都会导致整体失败。VLA的路线是用一个大模型端到端地“输入感知信息,输出动作指令”,省掉了中间的很多模块,也减少了很多误差累积。
但这个方向有个很关键的现实问题:数据太缺了。文本数据互联网上有海量资源,图像数据也有差不多够用的规模,但“视觉-语言-动作”配对的数据,全世界加起来都是稀缺品。所以现在各家都在卷数据:有的用仿真环境批量生成操作数据,有的用遥操作设备让人工采集数据,还有的尝试直接从互联网视频里提取动作信息。张颖这类做过自动驾驶数据闭环的人,在这个问题上有天然优势——他们看到“缺数据”的第一反应不是焦虑,而是“那就先把采集、清洗、标注、迭代的体系搭起来”。
2.3 数据闭环与仿真验证:决定项目上限的隐形战场
我一直觉得,Physical AI领域最性感的不是算法和模型,而是数据基础设施。原因很简单:模型架构可以抄,算力可以堆,但一套能自我造血的数据闭环体系,是需要时间和工程能力慢慢磨出来的。
自动驾驶给行业留下的最大遗产,其实就是数据闭环系统。车端采集数据,筛选出有价值的场景,上传到云端,标注之后进入训练集,模型迭代后回灌到车上,再通过影子模式验证新模型的效果。这个过程,业界花了好几年才跑通,现在原封不动地迁移到机器人数据闭环上,逻辑是一样的。区别在于:车的数据是“行驶数据”,机器人的数据是“操作数据”,采集设备从“路采车”变成了“遥控臂”和“穿戴式数据采集服”。
仿真验证也一样。自动驾驶行业在仿真上花了巨大代价,CARLA、SUMMIT这些开源平台加上各自内部自研的仿真系统,目的就一个:在虚拟环境里尽可能多地测试极端场景,减少实车测试的风险和成本。到了Physical AI阶段,仿真的挑战更大:不仅要模拟视觉,还要模拟物理接触,要算接触力、摩擦力、形变,这对仿真引擎的要求高出了一个量级。现在比较热的方案是“合成数据+域随机化”,也就是在仿真环境里极尽所能地制造差异,让模型在虚拟世界里学会适应变化,再迁移到真实世界。
2.4 模型部署与边缘推理:把智能塞进物理实体
还有一个经常被忽略、但决定产品能否落地的环节:模型部署与边缘推理。自动驾驶的量产车,算力是严格受限的。一个算法模型再厉害,如果跑不到30帧每秒,就无法在高速场景中实时响应。所以自动驾驶团队里都有一批专门做模型压缩、量化、剪枝和推理加速的工程师,他们的工作就是在精度和速度之间抠出每一毫秒的延迟。
Physical AI同样面临这个问题,而且更严峻。机器人搭载的算力平台通常比汽车要弱不少,因为要考虑电池续航、散热和成本。但机器人要在更复杂的三维空间里实时决策,一个柔顺操作任务往往要求在几十毫秒内完成一次感知和规划的循环。所以Physical AI里的模型部署工程师,很可能就是未来最抢手的人才。这也是我在标题热词里看到“模型部署”“AI工程实践”“AI Infra”时特别有共鸣的原因——大家都在谈模型多聪明,却很少有人谈怎么把模型塞进一个风扇都没有的小盒子里还能稳定跑一年。
3. 从坐到动:Physical AI创业的几个可行切入点
3.1 聚焦垂直场景的模型服务商
如果你的团队没有能力从零做通用机器人,最务实的切入方式是做垂直场景的AI模型服务商。选一个物理交互复杂度适中、商业付费意愿强的领域,比如工业质检、物流分拣、农业采摘、医疗辅助,针对这个场景做好感知和决策模型,以软件方案的方式卖给机器人制造商或者集成商。这个路子的好处是轻资产,不需要自己造硬件,坏处是天花板相对有限,因为你本质上还是一个“卖模型”的公司,议价能力取决于你的模型比竞争对手好多少。
从自动驾驶出来的人做这个有天然优势,因为自动驾驶本身就是“感知+决策”模型的集合体,很多算法框架可以直接复用。甚至不用从零开始,把车端的检测模型、跟踪模型改一改输入输出格式,就能迁移到工业场景。
3.2 世界模型与仿真平台:卖水和铲子
另一个切入点是做基础设施层面的工具和平台,重点服务那些需要“理解物理世界”的团队。前面说到了仿真系统在Physical AI里的核心地位,但市面上像样的工具太少了。自动驾驶时代有CARLA、SUMMIT这些开源仿真器,而Physical AI,尤其是机器人操作这一个细分方向,还没有一个类似的开源标准。
如果能做一个高保真、易上手、支持真实物理交互的仿真平台,让机器人团队能够在虚拟环境里生成数据、训练模型、验证策略,这个方向非常值得做。收入模式可以参考自动驾驶仿真工具的发展轨迹:先开源社区版本建立生态,再卖企业版的私有化部署和数据生成服务。有人说这是“卖水卖铲子”,但在一个赛道还很早期的阶段,卖水卖铲子往往是活得最稳的方式。
3.3 数据采集与标注服务:也被低估的赛道
你可能觉得数据服务不够“高大上”,但现实是,Physical AI领域最缺的就是高质量操作数据。现在很多具身智能团队在实验室里跑得很欢,一到真实场景就趴窝,原因往往就是训练数据的覆盖度不够。所以,“构建面向Physical AI的高质量操作数据集”是一个被严重低估的创业方向。
具体做法可以是:搭建一套机器人遥操作数据采集工作站,雇佣操作员用穿戴式设备控制机器人完成各种任务,同时记录多模态数据;也可以做自动化数据增强工具,把已有的操作数据通过换背景、换物体纹理、变光照、改动力学参数等方式,生成更多样性的训练样本。这件事听起来很苦很累,但壁垒恰恰就在这里——越苦越累的活,大厂越不愿意亲自下场做,而这正是创业公司的机会。
3.4 AI Infra和部署工具链:被忽略的硬需求
机器人团队最常见的痛点是部署难。模型在GPU服务器上跑得好好的,一到机器人主板上就各种问题:算子不支持、显存不够、延迟超标、精度下降。这个痛点背后是一整套面向机器人场景的AI推理优化工具链需求:轻量化的模型转换工具、高性能的推理引擎、适配各种异构芯片的中间层。可以这么说,在自动驾驶行业,英伟达的Drive平台、地平线和一些工具链公司已经把这个需求市场教育得差不多了;机器人行业还在早期,谁先做出好用的部署工具,谁就有机会定义标准。
关于“AI编程”和“AI辅助开发”这个话题,也有观点认为,未来3-5年,Physical AI的研发效率会极大地依赖AI辅助工具。模型的代码生成、仿真场景的自动构建、数据管线的自动调优,这些都会有“AI for AI”的二次开发需要。所以如果你既懂AI又懂工程,往“AI辅助Physical AI开发工具”这个方向扎,也是一个卡位的选择。
4. 从想法到落地:想入局Physical AI的人该做什么
4.1 先分清自己想做的是哪个层次
我见过太多人一开口就说“我要做具身智能创业”,但问他聚焦在哪个环节、解决哪个具体痛点,他就沉默了。Physical AI的产业链足够长,从最底层的大模型训练、世界模型研究,到中间的仿真平台、数据服务、部署工具链,再到上层的机器人本体、场景应用,每个层次都有机会,但每个层次对团队能力的要求完全不同。
我的建议是:先想清楚自己的核心壁垒是什么。如果你擅长算法,可以扎进VLA模型或者世界模型的某一个具体模块;如果你擅长工程,可以做部署优化工具或者仿真平台;如果你擅长行业理解,可以绑定一个具体场景,比如咖啡店、药店、仓库,做场景化的机器人解决方案。最怕的是什么都想碰,结果什么都做不深。
4.2 赶紧补足这几个技术短板
不管你现在是做什么方向的,如果想切入Physical AI,我建议按优先级补齐这几个能力:
第一,3D视觉与空间感知。Physical AI和普通AI最大的区别,就是它必须理解三维空间。相机标定、点云处理、位姿估计、空间变换,这些是基本功,没有这个基础,后面所有工作都做不了。第二,运动规划与控制理论。你不需要成为控制论专家,但至少要看得懂RRT、MPC、阻抗控制这些概念,理解“生成轨迹”和“执行轨迹”之间永远有差距。第三,仿真工具链的使用。至少把Isaac Sim、MuJoCo、PyBullet其中一个玩熟,能独立搭建一个简单的机器人操作仿真环境。第四,模型部署与优化。至少要会用TensorRT、ONNX Runtime这些推理框架,理解量化、剪枝的基本原理。
4.3 动手做一两个真实的小项目
看再多的文章和视频,都不如亲手做一个项目学得快。我会建议你先做一个小型但完整的Physical AI项目,比如用一台带机械臂的移动机器人,实现一个“感知桌面物体并抓取到指定区域”的功能。这个项目虽然简单,但涵盖了感知、规划、控制、数据采集的完整链路,做完之后你对整个系统的痛点会有非常直观的感知。
做完这个基础项目,可以再往上加需求:比如让机器人根据自然语言指令完成操作,这就引入了VLA模型;比如让机器人在仿真环境里反复训练再迁移到真实环境,这就涉及仿真到现实的迁移问题。一步一步往深了做,你的技术栈自然就搭建起来了。
5. 行业观察与避坑指南
5.1 最大的坑:把大模型思维直接搬到物理世界
这几年大模型太火了,火到很多人产生了一种错觉:只要模型够大、够聪明,什么问题都能解决。但物理世界不是文本世界。在文本世界里,你让模型“编一个故事”,它编得离谱一点读者顶多觉得无聊;在物理世界里,你让机器人“倒一杯水”,倒偏了就可能烫到人。物理交互是有不可逆后果的,这种“物理事故成本”让Physical AI不能像大模型那样“先上线再修”。
所以做Physical AI,一定要建立“安全优先”的工程观。自动驾驶行业花了巨大代价才建立起来的一套方法论——冗余感知、安全兜底、功能安全等级划分、极限场景测试——到了Physical AI时代,一个都不能丢掉。这也是我为什么看好张颖这类从量产一线出来的人,因为他们的基因里已经刻着这套方法论了。
5.2 第二个坑:低估仿真到现实的差距
很多人觉得,我在仿真的环境里训练得很好,那搬到真实世界也应该没啥问题。这是新手最容易犯的错误。仿真和现实之间存在一道“现实鸿沟”:仿真的物理引擎再先进,也无法完全模拟真实的摩擦力、材质形变、传感器噪声、环境光照变化。自动驾驶行业为了解决这个问题,发明了“域随机化”——在仿真里故意把光照、纹理、物理参数随机打乱,让模型见过各种奇奇怪怪的组合,从而在真实世界里具备更强的泛化能力。这个方法在Physical AI领域同样适用,但难度更高,因为机器人的触觉、力觉反馈是现在仿真最难模拟的部分。
在做项目规划的时候,一定要把“仿真-现实迁移”的时间和成本算进去。我的经验是,一个在仿真里跑通的机器人操作策略,迁移到真实机器人上,至少还要花仿真阶段一半多的精力去调优和适配。
5.3 第三个坑:只看Demo,不看数据飞轮
我给很多创业者和投资人的建议是:看一家Physical AI公司,不要看它的Demo视频有多炫,要看它的数据飞轮跑没跑起来。一家公司的机器人如果只能在演示环境里动,说明它只是“算法表演”阶段;如果它的机器人已经在用户现场部署,并且每天都在产生新数据回传到训练系统,用新数据持续优化模型并回灌到机器人端,这才算真正进入“产品闭环”阶段。
数据飞轮的搭建,恰好是自动驾驶量产公司的强项。张颖在做的事情,大概率就是想把这个能力复制到Physical AI领域。道理很简单:谁掌握了数据闭环,谁就掌握了持续进化的能力;谁掌握了持续进化的能力,谁才有资格谈“通用”。
5.4 关于标准和安全验证:早期布局才是明智之举
我在搜索热词里看到ISO 34505:2025《自动驾驶测试场景评价与用例测试生成》这个标准被大量检索,说明圈子里的同行们对测试标准和安全验证的重视程度在快速提高。这个标准虽然是面向自动驾驶的,但它的方法论——从场景库构建、用例生成、仿真评价到实车验证——对整个Physical AI行业有极强的参考价值。
Robotaxi和自动驾驶行业这十年的惨痛教训就是:安全验证体系必须跟技术研发同步搭建,等到出事再补已经晚了。Physical AI要走进家庭、进入工厂,必然会遭遇更严格的安全监管和市场信任挑战。我的看法是,早期就把测试场景库、用例生成工具、安全评价体系这些基础设施考虑进去的团队,未来的路会走得更稳;而这些经验,恰恰是自动驾驶量产老兵们最熟悉的领域。
6. 写在后面的一些个人体会
最后说点我自己的感受。我身边很多做自动驾驶的朋友,今年多少都有点迷茫,觉得行业商业化比预期慢,技术瓶颈又很明显,资本也不再像前几年那样疯狂涌入。但我觉得,自动驾驶这十年的积累并不会白费,它给整个行业留下了一支被训练过的工程师队伍,一套成熟的方法论,一套完整的供应链体系。现在这批人去搞Physical AI,本质上是在把过去十年的经验和教训“搬砖”到一个更大的市场。
我自己也是从自动驾驶背景出发,现在关注Physical AI的创业生态。如果你恰好也在考虑转型,或者已经在做相关项目,我的建议是:不要被每天的热点带着跑,先想清楚自己在整个产业链里的位置,想清楚自己的独特优势是什么,然后选一个足够窄的切入点扎进去,把一个垂直场景打穿,再去想扩张的事。毕竟物理世界是一个比数字世界大得多的金矿,但挖矿需要耐心,也需要铁锹,前者靠心态,后者靠技术,两者缺一不可。