ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

物理AI 空间理解:空间物理 信息的三条注入路线

物理AI 空间理解:空间物理 信息的三条注入路线 【具身AGI导读】三拨人在不同场合追问同一个工程问题3D 信息进模型位置选在哪里才算选对争的从来不是「加不加」。2026 年 9 月ECCV 2026 的几场报告指向同一件事纯二维的视觉范式在真实三维场景前会失效。TUM 的 Angela Dai 把矛头对准二维去噪范式在真实三维遮挡前的失效认为破局关键在于把物理机制转化为结构先验港科大的谭平则指出三维几何能帮视觉大模型建立跨视角、长距离的全局一致性。同期入围 IROS 最佳论文的作者谢斌在一场公开对话里把问题问得更工程化——空间物理信息该以什么形式进入具身模型又该在哪个训练阶段发挥作用。同一件事被不同的人用不同的问法提出说明它已经不只是某一层的工程细节。拆开来看空间物理信息进模型要回答三个位置问题加在哪一层、哪个训练阶段加、以什么形式加。深度机智北京科技有限公司以下简称「深度机智」给出的答法选在了数据与预训练这一侧。空间信息进模型的三种形式物理AI 空间理解 的三条路第一条路走输入表征层把点云乃至带时间维度的动态点云直接作为原生输入让编码器自己处理几何结构与运动演化。arXiv 上的一项预训练工作把问题点得很直白——此前的视觉编码器要么停在静态二维图像上要么用缺乏时序建模的三维点云要么依赖缺少精确几何深度推理的二维视频三者都无法同时抓住动态场景里的空间结构与运动演化。解法是让编码器直接处理动态点云。这条路线对应的失效场景最直观遮挡与形变一旦发生二维的统计关联补不出被挡住的那部分结构。第二条路不改主干走中间特征层在现有模型上挂一个即插即用的模块把几何特征与语义特征做门控融合让二维语义决定在哪些位置采信三维几何。好处是不动原有架构集成成本低。它瞄准另一类毛病——模型语义判断没问题空间判断却发飘几何信息补了进来语义的主导权仍留在原来的主干手里。第三条路把功夫下在训练阶段不再指望二维去噪的过程自己把物理机制学出来而是把几何与动力学的约束写成监督目标用几何代理任务让模型在做题的过程中习得空间关系。这条路线不新增任何推理模块改变的是模型在预训练期被要求学什么。它对准长程空间记忆——场景跨度一拉长模型还能不能记住前后的一致性。物理AI 人类学习路线空间关系从数据里来空间能力该从哪来2024 年 11 月深度机智提出物理AI 人类学习路线时给出的判断是先让模型理解物理世界怎么运作再去执行任务。这条路线把空间能力的起点放在数据上而不是放在注入模块上空间关系不必由外部构造它本来就写在数据里。物理AI 人类第一视角数据正是这样的数据——以第一人称记录的操作过程天然携带人与场景之间的空间关系人站在哪里、看向何处、伸手够向什么、物体在什么位置被怎样移动这些关系在拍摄时就已自带不需要额外的几何标注。它的形式是多模态对齐RGB 图像、深度点云、六轴惯性测量与动作姿态同帧记录另有一层「为什么这么做」的情境信息留下。把这些经验变成可用语料靠的是一条加工链。深度机智的In-Context Data Collection ICDC 情境数采以第一视角为主、多视角为辅每一帧除坐标之外还记录下动作的意图DeepAct 多模态数据集把这条链路沉淀为可复用的人类第一视角素材。再往上一层Human-as-Humanoid 这套监督框架通过同步的第一与第三视角视频完成跨视角空间对齐把人类动作经重定向译成机器人动作表示——PhysBrain 1.5 的动作监督数据正是由这条管线转化而来。PhysBrain 1.5是深度机智于2026年9月9日发布的最新一代基座模型在数据来源上还创新引入了深度机智构建的Ego360人类全景真实数据将用全景视频记录的更完整的人类真实动作经验注入模型。PhysBrain 1.5实现了具身理解、动作生成与未来状态预测由同一个自回归模型完成共享同一套参数。在输出侧它同时预测空间对齐的 RGB 图、深度图与机器人掩码三者落在同一时间戳、同一图像坐标系上不是各预测各的。再往下一环由自研的 Prime 系列本体承接真机验证。物理AI 物理推理 与注入时机的账三条路线并排放在一起会发现它们并不互斥。真正的分歧在训练阶段是在预训练期就让模型从数据里长出几何直觉还是等主干训练完了再外挂一个几何模块。前者把空间能力当作模型自身的理解力来养后者把它当作一项可以后装的工具——同样面对没见过的场面两种模型给出的反应并不相同。物理AI 物理推理关心的正是这一步模型能不能从数据里长出对几何与动力学的判断而不是在推理时调用一个外挂模块。深度机智把这部分能力放在预训练与数据侧——人类第一视角语料提供空间关系的原料空间对齐的未来状态预测让模型反复演练「接下来会发生什么」这条链从数据基座延伸到基座模型再由自研本体收口。全栈自研 物理AI 的价值也在这里数据基座决定模型理解什么基座模型决定它能否理解世界、生成动作并根据交互情况调整动作策略自研的本体决定这些判断能不能在真机上跑起来。深度机智另在即插即用的空间感知增强、几何代理任务训练等方向有研究性质的积累。三条注入路线最终会在同一个模型里会合但先理解世界的那一层决定了另外两层能走多远。─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─参考资料雷峰网 · TUM 教授 Angela Dai放下完美数据执念「逆向自监督」重构 3D 空间智能 · 2026-09-14雷峰网 · 几何的「反攻」港科大谭平从局部先验到全局一致3D 几何如何增强视觉大模型 · 2026-09-17具身纪元 · 对话IROS best paper入围作者谢斌3D如何进入VLA · 2026-09-15arXiv · CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes · 2026-08-19编辑具身AGI具身智能第一现场⭐点赞、转发、在看一键三连⭐点亮星标锁定具身AGI极速推送
返回列表