【行业动态】3D环境感知领域顶尖学者论文追踪(202510-202610)
2026/10/10 12:17:18
网站建设
项目流程
3D环境感知领域顶尖学者论文追踪(202510-202610) 覆盖四层结构 16 位学者的年度重点动态。关联度评级基于仓储拣选机器人业务(RGB-D 三维感知、传送带 3D 实例分割、SKU 分离、泛化抓取、反光/透明物体、密集堆叠)。
一、物理 / 几何感知(空间长什么样) Richard Newcombe(Meta Reality Labs) Generalized non-exponential Gaussian splatting(Meta) :将 3DGS 扩展到非指数透射率模型,更真实地模拟云雾、枝叶等复杂材质,渲染提速约 4 倍。关联度:中 (材质建模思路可借鉴到反光 SKU 的 splat 渲染)FLICKER(Meta & NVIDIA) :3DGS 硬件加速器,通过细粒度贡献分析实现实时渲染。关联度:中 动态:Meta Reality Labs 整体转向 3DGS 为主的物理世界捕获管线(Quest 3 上的 VR splat 渲染、全身 Gaussian 头像 SqueezeMe 72fps)。关联度:中 Marc Pollefeys(ETH / Microsoft) DROID-SLAM in the Wild(2026.03) :可微分不确定性感知 BA 的实时 RGB SLAM,动态杂乱场景下约 10 FPS,实时位姿与几何 SOTA。关联度:高 (传送带动态场景的鲁棒跟踪直接相关)OmniPoint(2026.09) :统一针孔/鱼眼/全景相机的单目米制点云框架,零样本泛化,支持内参/稀疏深度注入。关联度:高 (多相机型号统一感知的范式)Memory Over Maps(2026.03) :不做全局 3D 重建,仅存带位姿的 RGB-D 关键帧做视觉记忆,查询时用 VLM 重排 + 按需深度反投影定位目标,建索引快两个数量级。关联度:高 (免建图目标定位,对拣选场景的目标检索极具参考价值)Global SfM Meets Feedforward Reconstruction(2026.05) :经典 SfM 与前馈重建(DUSt3R 类)结合的新管线,弱纹理/低重叠场景更稳,开源。关联度:中 PolyLayout(ECCV 2026) :多房间 Manhattan 布局联合估计。关联度:低 Stefan Leutenegger(TUM Smart Robotics Lab) GSFix3D(3DV 2026) :扩散模型引导修复 3DGS 新视角的破损区域。关联度:中 SplatXtRact(RA-L 2026) :开放世界 ROI 提取 + 精修的可控 3DGS,从大场景中只重建/跟踪感兴趣区域。关联度:高 (只关注传送带目标区域的算力裁剪思路)Situated Perception(ISARC 2026) :场景级 + 物体级定位的 Spatial AI,用于移动机器人装配作业。关联度:高 GSFusion(RA-L 2024 末,组内代表作) :在线 RGB-D 建图中 3DGS 与 TSDF 融合。关联度:高 (与你们 RGB-D 稠密建图路线同源)AERO-VIS(RA-L 2026.10) :异步事件相机 VIO,机载实时。关联度:低 (事件相机思想可关注,但场景不同)Sebastian Thrun(Stanford) 创办 stealth 机器人公司 Dulo(2026.08 宣布) :定位"硬件设计基础模型",目标是 manufacturing at lightspeed,团队含 Waymo / Google Brain / SAIL 核心成员。本人方向已从 SLAM 理论转向创业,后续跟踪以公司动态为主。关联度:中 (Physical AI 赛道风向标,2026 Q1 该领域融资 $16.3B 创纪录)二、RGB-D 感知理解(深度相机怎么读世界) Dieter Fox(UW / NVIDIA Seattle Robotics Lab) PointWorld(2026.02,与李飞飞团队合著) :面向真实场景机器人操作的规模化 3D 世界模型。关联度:高 GraspGen(ICRA 2026) :扩散模型 6-DoF 抓取生成框架 + on-generator 训练,NVIDIA 拣选管线的核心工作。关联度:高 Point Bridge(2026.02) :用 3D 点表征做跨域(仿真↔真实)策略学习。关联度:高 Recurrent-Depth VLA(2026.02) :通过潜空间迭代推理实现 VLA 隐式测试时扩展计算。关联度:中 Open-World TAMP via VLM Inferred Constraints(RA-L 2026) :VLM 推断约束驱动的开放世界任务与运动规划。关联度:中 其组延续 RGB-D 透明物体深度补全、未见物体实例分割(RGB/Depth 分离利用)等长期路线。关联度:高 刘烨斌(清华) Tessellation GS(3DV 2026) :网格面片锚定的结构化 2D Gaussian,单目动态物体重建更稳,解决 3DGS 各向异性过拟合问题。关联度:中 多尺度动力学高斯序列(2026) :从随手拍单目视频做 4D 重建,物体→粒子级多尺度运动分解,可用于机器人操作数据扩展。关联度:中 DancingBox(CHI 2026 最佳论文提名,清华参与) :仅 RGB 相机 + 视觉基础模型组合(π3/SAM2/CoTracker3)实现任意物体驱动的角色动画,展示"基础模型拼装替代专用动捕系统"的工程范式。关联度:中 组内长期强项:动态场景 RGB-D 融合捕捉、人体/手部高保真重建。关联度:中 贾佳亚(已转任 HKUST 冯·诺依曼研究院院长,SmartMore 创始人) DreamOmni2(2025.10) :开源多模态指令编辑与生成基础模型,多项指标超 Google 闭源同期模型。关联度:低 InternVLA-M1(2025.10 合著) :空间引导的 VLA 通用机器人策略框架。关联度:高 (空间先验注入 VLA)动态 :2026.01 当选 ACM Fellow;SmartMore 聚焦工业智能体(机器人 + 边缘 AI 传感器 + Agent 软件),已服务 730+ 家企业,深圳智能制造工厂 2022 年起运营。关联度:高 (制造业视觉 → 工业智能体路线与你们最接近的产业样本)章国锋(浙大 / InSpatio 创始人) 创办影溯 InSpatio(2025.07) :3D 世界模型公司;InSpatio-WorldFM(2026.03 开源) :消费级 GPU 上实时推理的交互式 3D 世界模型。关联度:高 QuerySplat(2026.08 开源) :前馈式 3DGS 生成技术 + Crystal 空间相机 App。关联度:中 2026.03:5 篇 CVPR 2026 接收 ;组内延续线:SplatLoc(3DGS 视觉定位)、CG-SLAM(不确定性感知 3DGS 稠密 RGB-D SLAM)、PGSR(平面约束 GS 高保真表面重建)。关联度:高 (GS-SLAM 表面重建与你们 RGB-D 建图直接相关)Jiajun Wu(Stanford) Theory of Space(ICLR 2026,与李飞飞等) :具身空间认知评测新范式——模型须主动探索构建/修正"认知地图"。重要发现:所有前沿多模态大模型在视觉空间推理上系统性弱于文本;朝向感知接近随机、信念漂移严重。关联度:高 (说明 VLA 结合显式 3D 重建的必要性,佐证你们的技术观点)3D-Generalist(3DV 2026,与 NVIDIA) :VLM 当策略自举生成仿真就绪 3D 环境,用于基础模型预训练数据。关联度:中 机器人操作动力学模型综述(Science Robotics 2025,与苏昊等) :学习型动力学模型用于可变形物体、颗粒物、多物体交互的权威综述。关联度:高 Physical Object Understanding with a Physically Controllable World Model(CVPR 2026 Highlight) 。关联度:中 Christian Theobalt(Max Planck) EgoRelight(SIGGRAPH 2026) :单 HMD 第一视角同时做全身捕捉 + HDR 环境光估计 + 可重光照真实感头像。关联度:低 UMA(TOG 2026.09) :40 台 6K 相机多视角,2D 视频点跟踪器监督 3D 形变,超细节(纱线级纹理)人体头像。关联度:低 (2D 基础模型监督 3D 的思路可迁移)Faster 3DGS Convergence via Structure-Aware Densification(SIGGRAPH 2026) :结构感知致密化加速 3DGS 收敛。关联度:中 三、属性理解(是什么、什么材质、什么关系) 朱松纯(BIGAI / 北大) 触觉高分辨率机器手(Nature Machine Intelligence 2025) :机器人手嵌入高分辨率触觉,实现类人自适应抓取。关联度:高 (视觉抓取失败时的触觉兜底路线)Lifting Unlabeled Internet-level Data for 3D Scene Understanding(2026.05) :把无标注互联网数据提升用于 3D 场景理解。关联度:中 TEA:具身智能体原位评测(2026) : unseen 环境自动生成 8.7 万认知任务,发现 SOTA 模型基础感知差、3D 交互意识严重缺失。关联度:中 Part-level Scene Reconstruction Affords Robot Interaction(IROS)延续线 + Move to Understand 3D Scene(ICCV 2025 Highlight) :部件级重建支撑机器人交互、边走边理解 3D 场景的具身导航。关联度:高 PhyRecon(NeurIPS 2024)延续影响 :物理可信的神经场景重建(物理稳定性约束进重建损失)。关联度:高 (堆叠 SKU 稳定性判断可借鉴)苏昊(UCSD →2026.04 回国加盟复旦 ,Hillbot 联合创始人/CTO) 重大动态:2026.04 China3DV 上官宣回国 ,任复旦浩清特聘教授,领衔建设通用物理智能研究院 并出任院长(具身领域华人学者被引第一,超 14.5 万次)。关联度:高 (国内物理智能生态的关键落子,招聘/合作潜在对象)π0.7(Physical Intelligence,2026) :可转向的通用机器人基础模型,多模态上下文条件化(子目标图、任务元数据)实现零样本跨具身泛化。关联度:高 AnyHand(2026) :250 万单手 + 410 万手物交互 RGB-D 合成数据集,RGB-D 融合轻量模块即插即用。关联度:高 (RGB-D 融合机制直接可借鉴到你们图漾/海康双目融合)Scaling Cross-Embodiment World Models(IROS 2026) :用 3D 粒子集合统一人手/机器人手表征,跨具身世界模型 + 规划。关联度:中 PartField(ICCV 2025) :3D 特征场做部件分割,部件级理解的新基建。关联度:高 (与你们 SKU 部件级分离同问题域)LodeStar(2025.08) :人类演示合成数据增强做长时程灵巧操作。关联度:中 李飞飞(Stanford / World Labs) Marble 商用化(2025.11 正式发布,2026.06 全量开放) :多模态输入(文本/图像/视频/3D 布局)→ 可交互 3D 世界,同时输出 3DGS(视觉)+ 碰撞网格(物理)。Chisel 模式解耦结构与风格。关联度:高 世界模型三分法(2026.06 官方文章) :Renderer(输出像素)/ Simulator(输出状态)/ Planner(输出动作),主张 Simulator 是关键枢纽——几何+物理知识可同时投影为渲染与动作预测。关联度:高 (对判断 VLA/世界模型路线有框架价值)R2S2R 引擎(2026.07) :Real-to-Sim-to-Real 机器人策略训练评估引擎,Marble 场景导入 Isaac Sim,建仿真环境从数周缩到数小时;计划在仓库、实验室、电子装配等半结构化场景真实部署验证 。关联度:高 (与你们业务场景直接重叠)收购 SceniX(2026.07) :机器人仿真公司,创始人李昀烛;Atlas 多模态世界模型(2026.09) :以"空间上下文"替代"文本上下文",像素级精确 + 3D 重建;Spark 2.0 开源 3DGS 渲染引擎(2026.04) 。融资 :2026.02 完成 $10B?? 实为$10 亿美元 融资(Autodesk $2 亿领投),估值约 $50 亿。关联度:高 (空间智能从研究到商业部署的信号)四、感知服务操作(理解之后怎么抓) Shuran Song(Stanford REALab) 2026 年 14 篇系统性产出 ,三条主线:基础模型与策略微调 :Transformer Transformer(机器人形态与控制联合协同设计,ALOHA 轨迹误差降 70%+)、DF-ExpEnse、Gated Memory Policy。关联度:中 多感官融合与顺应控制 :Minimalist Compliance Control(RSS 2026,极简柔顺控制)、UMI-FT(野外顺应操作,预训练策略适应力反馈)、Multisensory Continual Learning(视觉受阻时靠触觉/力觉续跑)。关联度:高 (密集堆叠抓取的接触柔顺问题)数据采集与跨具身 :ModPack(可扩展双臂移动操作遥操接口)、HoMMI(RSS 2026,从人类演示学全身移动操作)、One Demo Is Worth a Thousand Trajectories(动作-视角增强)、Geometry-Aware 4D Video Generation for Robot Manipulation(ICLR 2026) 、DexMachina(ICML 2026,双臂灵巧功能重定向)。关联度:高 (遥操数据采集接口与你们手柄遥操采集直接对标)Sergey Levine(UC Berkeley / Physical Intelligence 联合创始人) Steerable Policies(RSS 2026) :VLA 用子任务/运动/像素坐标等多抽象层级的合成指令训练,解锁 VLM 高层推理对底层行为的精细控制。关联度:高 Emergence of Human-to-Robot Transfer in VLA(RSS 2026) :充分多样预训练后,人类视频→机器人技能迁移"涌现",泛化场景性能近翻倍。关联度:高 (你们遥操数据 + 互联网视频混合训练的依据)π0.7(Physical Intelligence,2026) :见苏昊条目——Levine 为 PI 联创,与苏昊组有共同产出。关联度:高 RoboReward(2026.01) :VLM 通用奖励模型,自动生成真实机器人任务奖励。关联度:中 Beyond Sight:Multi-Sensory Robot Policies :视觉/触觉/音频多感官策略。关联度:中 五、工程落地更关注 韦特嘉机器人(Ulti Robotics) 硬件的可靠性及软件的可控性 :3D 视觉算法平台、实例分割、动态权重 RGB-D 融合模型、泛化抓取、订单到人系统全部自研;相机、PLC/伺服外采后做深度二次开发。这意味着学界每开源一项突破(GraspGen、PartField、深度融合模块),都能在不被任何单一技术栈绑定的前提下快速集成验证——工程自由度是学术界所不具备的。问题域高度收敛 :学界 2025-2026 的爆发集中在动态场景 SLAM、部件级分割、扩散抓取生成、仿真数据扩充,而这些正是“电商前置仓 + 传送带 + 密集堆叠 SKU”这一个场景的全部痛点。韦特嘉不需要泛化到户外、人形、开放世界,只需在这一收敛场景里把开源底座攒成可靠性产品——竞争的本质是集成速度和现场数据规模,而不是单点算法领先。本期高关联 Top 5(按业务价值排序) 李飞飞 World Labs R2S2R + 仓库场景部署计划 ——世界模型直接瞄准半结构化仓储场景的机器人策略训练,与你们业务正面重叠,需密切跟踪其真实部署效果。苏昊回国 + PartField / AnyHand ——部件级 3D 理解与大规模 RGB-D 合成数据两手抓;其复旦通用物理智能研究院是国内最对口的学术合作/招聘生态。Pollefeys 组 Memory Over Maps ——免建图 RGB-D 关键帧记忆 + VLM 目标检索,索引构建快两个数量级,对拣选目标定位是轻量化新范式。NVIDIA/Fox 组 GraspGen + PointWorld ——扩散抓取生成 + 3D 世界模型,是拣选抓取管线的当前工业级标杆。Song 组 UMI-FT / Minimalist Compliance Control + Levine 组人类视频迁移涌现 ——密集堆叠抓取的接触柔顺与低成本数据扩展的两条可行路径。结构性观察(年度视角) 3DGS 已全面接管几何感知层 :四层学者 2025-2026 的主要产出几乎都迁移到 Gaussian 表征(SLAM、动态重建、表面重建、世界模型导出格式)。"世界模型 = 渲染器/模拟器/规划器"的分化正在发生 :李飞飞主张 Simulator 为核,杨立昆走纯隐式路线,双方是未来两年最值得看的路线之争。RGB-D + 语义大模型结合的具体形态已经清晰 :关键帧记忆 + VLM 重排(Fox/Pollefeys 线)、VLA 空间先验注入(InternVLA-M1、Steerable Policies)、触觉兜底(朱松纯、Levine 多感官)。中国学者权重显著上升 :苏昊回国、章国锋创业、贾佳亚产业落地、刘烨斌/朱松纯持续产出——国内物理智能学术-产业闭环正在成形。