☰
【行业动态】3D环境感知领域顶尖学者论文追踪(202510-202610)
2026/10/10 12:17:18 网站建设 项目流程

3D环境感知领域顶尖学者论文追踪(202510-202610)

覆盖四层结构 16 位学者的年度重点动态。关联度评级基于仓储拣选机器人业务(RGB-D 三维感知、传送带 3D 实例分割、SKU 分离、泛化抓取、反光/透明物体、密集堆叠)。


一、物理 / 几何感知(空间长什么样)

Richard Newcombe(Meta Reality Labs)

  • Generalized non-exponential Gaussian splatting(Meta):将 3DGS 扩展到非指数透射率模型,更真实地模拟云雾、枝叶等复杂材质,渲染提速约 4 倍。关联度:中(材质建模思路可借鉴到反光 SKU 的 splat 渲染)
  • FLICKER(Meta & NVIDIA):3DGS 硬件加速器,通过细粒度贡献分析实现实时渲染。关联度:中
  • 动态:Meta Reality Labs 整体转向 3DGS 为主的物理世界捕获管线(Quest 3 上的 VR splat 渲染、全身 Gaussian 头像 SqueezeMe 72fps)。关联度:中

Marc Pollefeys(ETH / Microsoft)

  • DROID-SLAM in the Wild(2026.03):可微分不确定性感知 BA 的实时 RGB SLAM,动态杂乱场景下约 10 FPS,实时位姿与几何 SOTA。关联度:高(传送带动态场景的鲁棒跟踪直接相关)
  • OmniPoint(2026.09):统一针孔/鱼眼/全景相机的单目米制点云框架,零样本泛化,支持内参/稀疏深度注入。关联度:高(多相机型号统一感知的范式)
  • Memory Over Maps(2026.03):不做全局 3D 重建,仅存带位姿的 RGB-D 关键帧做视觉记忆,查询时用 VLM 重排 + 按需深度反投影定位目标,建索引快两个数量级。关联度:高(免建图目标定位,对拣选场景的目标检索极具参考价值)
  • Global SfM Meets Feedforward Reconstruction(2026.05):经典 SfM 与前馈重建(DUSt3R 类)结合的新管线,弱纹理/低重叠场景更稳,开源。关联度:中
  • PolyLayout(ECCV 2026):多房间 Manhattan 布局联合估计。关联度:低

Stefan Leutenegger(TUM Smart Robotics Lab)

  • GSFix3D(3DV 2026):扩散模型引导修复 3DGS 新视角的破损区域。关联度:中
  • SplatXtRact(RA-L 2026):开放世界 ROI 提取 + 精修的可控 3DGS,从大场景中只重建/跟踪感兴趣区域。关联度:高(只关注传送带目标区域的算力裁剪思路)
  • Situated Perception(ISARC 2026):场景级 + 物体级定位的 Spatial AI,用于移动机器人装配作业。关联度:高
  • GSFusion(RA-L 2024 末,组内代表作):在线 RGB-D 建图中 3DGS 与 TSDF 融合。关联度:高(与你们 RGB-D 稠密建图路线同源)
  • AERO-VIS(RA-L 2026.10):异步事件相机 VIO,机载实时。关联度:低(事件相机思想可关注,但场景不同)

Sebastian Thrun(Stanford)

  • 创办 stealth 机器人公司 Dulo(2026.08 宣布):定位"硬件设计基础模型",目标是 manufacturing at lightspeed,团队含 Waymo / Google Brain / SAIL 核心成员。本人方向已从 SLAM 理论转向创业,后续跟踪以公司动态为主。关联度:中(Physical AI 赛道风向标,2026 Q1 该领域融资 $16.3B 创纪录)

二、RGB-D 感知理解(深度相机怎么读世界)

Dieter Fox(UW / NVIDIA Seattle Robotics Lab)

  • PointWorld(2026.02,与李飞飞团队合著):面向真实场景机器人操作的规模化 3D 世界模型。关联度:高
  • GraspGen(ICRA 2026):扩散模型 6-DoF 抓取生成框架 + on-generator 训练,NVIDIA 拣选管线的核心工作。关联度:高
  • Point Bridge(2026.02):用 3D 点表征做跨域(仿真↔真实)策略学习。关联度:高
  • Recurrent-Depth VLA(2026.02):通过潜空间迭代推理实现 VLA 隐式测试时扩展计算。关联度:中
  • Open-World TAMP via VLM Inferred Constraints(RA-L 2026):VLM 推断约束驱动的开放世界任务与运动规划。关联度:中
  • 其组延续 RGB-D 透明物体深度补全、未见物体实例分割(RGB/Depth 分离利用)等长期路线。关联度:高

刘烨斌(清华)

  • Tessellation GS(3DV 2026):网格面片锚定的结构化 2D Gaussian,单目动态物体重建更稳,解决 3DGS 各向异性过拟合问题。关联度:中
  • 多尺度动力学高斯序列(2026):从随手拍单目视频做 4D 重建,物体→粒子级多尺度运动分解,可用于机器人操作数据扩展。关联度:中
  • DancingBox(CHI 2026 最佳论文提名,清华参与):仅 RGB 相机 + 视觉基础模型组合(π3/SAM2/CoTracker3)实现任意物体驱动的角色动画,展示"基础模型拼装替代专用动捕系统"的工程范式。关联度:中
  • 组内长期强项:动态场景 RGB-D 融合捕捉、人体/手部高保真重建。关联度:中

贾佳亚(已转任 HKUST 冯·诺依曼研究院院长,SmartMore 创始人)

  • DreamOmni2(2025.10):开源多模态指令编辑与生成基础模型,多项指标超 Google 闭源同期模型。关联度:低
  • InternVLA-M1(2025.10 合著):空间引导的 VLA 通用机器人策略框架。关联度:高(空间先验注入 VLA)
  • 动态:2026.01 当选 ACM Fellow;SmartMore 聚焦工业智能体(机器人 + 边缘 AI 传感器 + Agent 软件),已服务 730+ 家企业,深圳智能制造工厂 2022 年起运营。关联度:高(制造业视觉 → 工业智能体路线与你们最接近的产业样本)

章国锋(浙大 / InSpatio 创始人)

  • 创办影溯 InSpatio(2025.07):3D 世界模型公司;InSpatio-WorldFM(2026.03 开源):消费级 GPU 上实时推理的交互式 3D 世界模型。关联度:高
  • QuerySplat(2026.08 开源):前馈式 3DGS 生成技术 + Crystal 空间相机 App。关联度:中
  • 2026.03:5 篇 CVPR 2026 接收;组内延续线:SplatLoc(3DGS 视觉定位)、CG-SLAM(不确定性感知 3DGS 稠密 RGB-D SLAM)、PGSR(平面约束 GS 高保真表面重建)。关联度:高(GS-SLAM 表面重建与你们 RGB-D 建图直接相关)

Jiajun Wu(Stanford)

  • Theory of Space(ICLR 2026,与李飞飞等):具身空间认知评测新范式——模型须主动探索构建/修正"认知地图"。重要发现:所有前沿多模态大模型在视觉空间推理上系统性弱于文本;朝向感知接近随机、信念漂移严重。关联度:高(说明 VLA 结合显式 3D 重建的必要性,佐证你们的技术观点)
  • 3D-Generalist(3DV 2026,与 NVIDIA):VLM 当策略自举生成仿真就绪 3D 环境,用于基础模型预训练数据。关联度:中
  • 机器人操作动力学模型综述(Science Robotics 2025,与苏昊等):学习型动力学模型用于可变形物体、颗粒物、多物体交互的权威综述。关联度:高
  • Physical Object Understanding with a Physically Controllable World Model(CVPR 2026 Highlight)。关联度:中

Christian Theobalt(Max Planck)

  • EgoRelight(SIGGRAPH 2026):单 HMD 第一视角同时做全身捕捉 + HDR 环境光估计 + 可重光照真实感头像。关联度:低
  • UMA(TOG 2026.09):40 台 6K 相机多视角,2D 视频点跟踪器监督 3D 形变,超细节(纱线级纹理)人体头像。关联度:低(2D 基础模型监督 3D 的思路可迁移)
  • Faster 3DGS Convergence via Structure-Aware Densification(SIGGRAPH 2026):结构感知致密化加速 3DGS 收敛。关联度:中

三、属性理解(是什么、什么材质、什么关系)

朱松纯(BIGAI / 北大)

  • 触觉高分辨率机器手(Nature Machine Intelligence 2025):机器人手嵌入高分辨率触觉,实现类人自适应抓取。关联度:高(视觉抓取失败时的触觉兜底路线)
  • Lifting Unlabeled Internet-level Data for 3D Scene Understanding(2026.05):把无标注互联网数据提升用于 3D 场景理解。关联度:中
  • TEA:具身智能体原位评测(2026): unseen 环境自动生成 8.7 万认知任务,发现 SOTA 模型基础感知差、3D 交互意识严重缺失。关联度:中
  • Part-level Scene Reconstruction Affords Robot Interaction(IROS)延续线 + Move to Understand 3D Scene(ICCV 2025 Highlight):部件级重建支撑机器人交互、边走边理解 3D 场景的具身导航。关联度:高
  • PhyRecon(NeurIPS 2024)延续影响:物理可信的神经场景重建(物理稳定性约束进重建损失)。关联度:高(堆叠 SKU 稳定性判断可借鉴)

苏昊(UCSD →2026.04 回国加盟复旦,Hillbot 联合创始人/CTO)

  • 重大动态:2026.04 China3DV 上官宣回国,任复旦浩清特聘教授,领衔建设通用物理智能研究院并出任院长(具身领域华人学者被引第一,超 14.5 万次)。关联度:高(国内物理智能生态的关键落子,招聘/合作潜在对象)
  • π0.7(Physical Intelligence,2026):可转向的通用机器人基础模型,多模态上下文条件化(子目标图、任务元数据)实现零样本跨具身泛化。关联度:高
  • AnyHand(2026):250 万单手 + 410 万手物交互 RGB-D 合成数据集,RGB-D 融合轻量模块即插即用。关联度:高(RGB-D 融合机制直接可借鉴到你们图漾/海康双目融合)
  • Scaling Cross-Embodiment World Models(IROS 2026):用 3D 粒子集合统一人手/机器人手表征,跨具身世界模型 + 规划。关联度:中
  • PartField(ICCV 2025):3D 特征场做部件分割,部件级理解的新基建。关联度:高(与你们 SKU 部件级分离同问题域)
  • LodeStar(2025.08):人类演示合成数据增强做长时程灵巧操作。关联度:中

李飞飞(Stanford / World Labs)

  • Marble 商用化(2025.11 正式发布,2026.06 全量开放):多模态输入(文本/图像/视频/3D 布局)→ 可交互 3D 世界,同时输出 3DGS(视觉)+ 碰撞网格(物理)。Chisel 模式解耦结构与风格。关联度:高
  • 世界模型三分法(2026.06 官方文章):Renderer(输出像素)/ Simulator(输出状态)/ Planner(输出动作),主张 Simulator 是关键枢纽——几何+物理知识可同时投影为渲染与动作预测。关联度:高(对判断 VLA/世界模型路线有框架价值)
  • R2S2R 引擎(2026.07):Real-to-Sim-to-Real 机器人策略训练评估引擎,Marble 场景导入 Isaac Sim,建仿真环境从数周缩到数小时;计划在仓库、实验室、电子装配等半结构化场景真实部署验证。关联度:高(与你们业务场景直接重叠)
  • 收购 SceniX(2026.07):机器人仿真公司,创始人李昀烛;Atlas 多模态世界模型(2026.09):以"空间上下文"替代"文本上下文",像素级精确 + 3D 重建;Spark 2.0 开源 3DGS 渲染引擎(2026.04)。
  • 融资:2026.02 完成 $10B?? 实为$10 亿美元融资(Autodesk $2 亿领投),估值约 $50 亿。关联度:高(空间智能从研究到商业部署的信号)

四、感知服务操作(理解之后怎么抓)

Shuran Song(Stanford REALab)

  • 2026 年 14 篇系统性产出,三条主线:
    • 基础模型与策略微调:Transformer Transformer(机器人形态与控制联合协同设计,ALOHA 轨迹误差降 70%+)、DF-ExpEnse、Gated Memory Policy。关联度:中
    • 多感官融合与顺应控制:Minimalist Compliance Control(RSS 2026,极简柔顺控制)、UMI-FT(野外顺应操作,预训练策略适应力反馈)、Multisensory Continual Learning(视觉受阻时靠触觉/力觉续跑)。关联度:高(密集堆叠抓取的接触柔顺问题)
    • 数据采集与跨具身:ModPack(可扩展双臂移动操作遥操接口)、HoMMI(RSS 2026,从人类演示学全身移动操作)、One Demo Is Worth a Thousand Trajectories(动作-视角增强)、Geometry-Aware 4D Video Generation for Robot Manipulation(ICLR 2026)、DexMachina(ICML 2026,双臂灵巧功能重定向)。关联度:高(遥操数据采集接口与你们手柄遥操采集直接对标)

Sergey Levine(UC Berkeley / Physical Intelligence 联合创始人)

  • Steerable Policies(RSS 2026):VLA 用子任务/运动/像素坐标等多抽象层级的合成指令训练,解锁 VLM 高层推理对底层行为的精细控制。关联度:高
  • Emergence of Human-to-Robot Transfer in VLA(RSS 2026):充分多样预训练后,人类视频→机器人技能迁移"涌现",泛化场景性能近翻倍。关联度:高(你们遥操数据 + 互联网视频混合训练的依据)
  • π0.7(Physical Intelligence,2026):见苏昊条目——Levine 为 PI 联创,与苏昊组有共同产出。关联度:高
  • RoboReward(2026.01):VLM 通用奖励模型,自动生成真实机器人任务奖励。关联度:中
  • Beyond Sight:Multi-Sensory Robot Policies:视觉/触觉/音频多感官策略。关联度:中

五、工程落地更关注

韦特嘉机器人(Ulti Robotics)

  • 硬件的可靠性及软件的可控性:3D 视觉算法平台、实例分割、动态权重 RGB-D 融合模型、泛化抓取、订单到人系统全部自研;相机、PLC/伺服外采后做深度二次开发。这意味着学界每开源一项突破(GraspGen、PartField、深度融合模块),都能在不被任何单一技术栈绑定的前提下快速集成验证——工程自由度是学术界所不具备的。
  • 问题域高度收敛:学界 2025-2026 的爆发集中在动态场景 SLAM、部件级分割、扩散抓取生成、仿真数据扩充,而这些正是“电商前置仓 + 传送带 + 密集堆叠 SKU”这一个场景的全部痛点。韦特嘉不需要泛化到户外、人形、开放世界,只需在这一收敛场景里把开源底座攒成可靠性产品——竞争的本质是集成速度和现场数据规模,而不是单点算法领先。

本期高关联 Top 5(按业务价值排序)

  1. 李飞飞 World Labs R2S2R + 仓库场景部署计划——世界模型直接瞄准半结构化仓储场景的机器人策略训练,与你们业务正面重叠,需密切跟踪其真实部署效果。
  2. 苏昊回国 + PartField / AnyHand——部件级 3D 理解与大规模 RGB-D 合成数据两手抓;其复旦通用物理智能研究院是国内最对口的学术合作/招聘生态。
  3. Pollefeys 组 Memory Over Maps——免建图 RGB-D 关键帧记忆 + VLM 目标检索,索引构建快两个数量级,对拣选目标定位是轻量化新范式。
  4. NVIDIA/Fox 组 GraspGen + PointWorld——扩散抓取生成 + 3D 世界模型,是拣选抓取管线的当前工业级标杆。
  5. Song 组 UMI-FT / Minimalist Compliance Control + Levine 组人类视频迁移涌现——密集堆叠抓取的接触柔顺与低成本数据扩展的两条可行路径。

结构性观察(年度视角)

  • 3DGS 已全面接管几何感知层:四层学者 2025-2026 的主要产出几乎都迁移到 Gaussian 表征(SLAM、动态重建、表面重建、世界模型导出格式)。
  • "世界模型 = 渲染器/模拟器/规划器"的分化正在发生:李飞飞主张 Simulator 为核,杨立昆走纯隐式路线,双方是未来两年最值得看的路线之争。
  • RGB-D + 语义大模型结合的具体形态已经清晰:关键帧记忆 + VLM 重排(Fox/Pollefeys 线)、VLA 空间先验注入(InternVLA-M1、Steerable Policies)、触觉兜底(朱松纯、Levine 多感官)。
  • 中国学者权重显著上升:苏昊回国、章国锋创业、贾佳亚产业落地、刘烨斌/朱松纯持续产出——国内物理智能学术-产业闭环正在成形。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询