吴佳俊在ECCV提出物理统一视觉听觉与触觉
2026年9月8日,欧洲计算机视觉会议在瑞典马尔默举行。9月9日的“物理环境中的具身多模态推理”分场上,斯坦福大学计算机科学助理教授吴佳俊发表演讲,讨论如何统一视觉、声音与触觉。过去两个月,他还在8月20日的IJCAI 2026获奖演讲中介绍“物理代码”,并在9月8日的机器人操作研讨会上分享原子技能发现与长程任务规划。
这次演讲将关注点从视觉向下游规划操作,转向感知端的横向融合:视觉、听觉和触觉被视为同一组物理属性在不同观测通道上的投影。塑料物体看起来、摸起来和敲击起来都应呈现相互一致的特征。面对新领域和陌生物体时,声音、触觉数据往往极少,关键问题因此不是简单堆叠模态,而是寻找能够支撑泛化的共同原则。吴佳俊提出,以几何、材质、刚度等属性建立统一坐标系,再结合基础模型完成感知。
演讲题为《Physics-Grounded Multimodal Perception:从视觉、声音到触觉的统一物理底座》。他指出,视觉、听觉和触觉虽然观测形式不同,却都由同一套底层物理规律支配;因此,多模态系统可以围绕这些属性构建共同表示,而不必只依赖直接输入Transformer融合。
在数据极少的情况下,视觉与听觉、听觉与触觉如何配合,是这条路线的出发点。传统视觉被视为逆图形学,即从观测中恢复几何、材质和运动等属性。团队进一步研究能否从视频扩散模型、视觉语言模型等基础模型中蒸馏出物体的物理知识。
代表性工作PhysDreamer发表于ECCV 2024,目标是从静态3D场景推断可变形物体的动力学属性,并预测不同动作下的响应。研究重点包括密度和刚度,尤其是杨氏模量。由于花朵等物体具有非均质结构,杨氏模量场是高维变量,且缺少密集真值标注,直接设定属性会导致不真实的仿真结果。
方法将3D高斯场景渲染后输入视频生成模型,得到参考视频;同时把外观场与待估计的物理属性场送入可微分物质点法,通过仿真、渲染和视频损失反向更新属性。后续工作又尝试分数蒸馏采样等方法,获得4D表示。该方法也适用于其他软体,真实花朵运动对比显示,其结果明显优于基线。
团队随后把研究扩展到WonderPlay,尝试从单张图像重建可动、可交互的3D场景,覆盖颗粒、流体、刚体、软体和关节物体。用户可以施加力场或风场,观察蜂蜜与蛋糕、帽子、头发和烟等对象的交互。吴佳俊认为,仅先做状态估计再进行物理仿真并不足够,因为流体与刚体交互难以快速准确模拟,且完整状态本身也很难获得。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文