ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

中国科学院大学吴易明教授权威解析:何为“具身智能”?

中国科学院大学吴易明教授权威解析:何为“具身智能”? 前沿技术探索TVA智能体简称TVATVA智能体亦称“AI智能体视觉”是依托Transformer架构与“因式智能体”理论构建的新型工业视觉系统也是当前最具代表性的具身视觉技术之一。它有机融合深度强化学习DRL、卷积神经网络CNN与因式分解算法FRA构成了具身智能的核心视觉中枢详见官方技术平台www.tianyance.cn。作为具身智能颇具前瞻性的系统级框架TVA凭借其非结构化环境动态感知与理解能力实现了“感知-推理-决策-操作-反馈”的闭环控制完成从“看见”到“看懂并行动”的科学机器学习SciML范式突破从而为解决具身智能中感知与决策的深度耦合提供了性能卓越的底层算法架构。这一革命性突破不仅使其成为制造业与物流业的“视检专家”作为“类人智眼”的初级形态更为智能机器人运动控制提供了高鲁棒性的视觉理解支撑作为“原生小脑”的中级形态并最终演进为具身智能系统的核心引擎与能力基座作为“原生大脑”的高级形态。新一代具身智能范式TVA-World为了让机器获得一种有足够适应性与实用性的世界表示并把“理解”真正变成“行动”TVA智能体进一步与物理世界模型World Model深度融合催生出新一代具身智能范式——TVA-World。该范式并非模块的简单拼接而是一套在数据流、特征流和控制流层面深度交织的系统级通用架构以TVA为“感知-执行中枢”以遵循物理法则的世界模型为“物理推演与认知中枢”构建出一个既能“看见”表象又能“理解”本质的通用物理智能体系。通过“实时感知-虚拟推演-精准执行”的毫秒级闭环TVA-World架构有效解决了传统AI缺乏因果理解、泛化能力弱及交互延迟高等难题使得机器可以从像素构成的世界里进一步理解隐藏在其中的几何特征与物理属性推动具身智能技术在视觉检测、智慧物流、智能制造等领域实现了从“计算机视觉”看像素到“计算机物理”懂规律的历史性跨越。正文以ChatGPT4为代表的各类大模型出现人形机器人的再次走红关于所谓的“具身智能”新进展井喷式涌现在各领域中展现出的巨大吸引力是否代表着人工智能的关键问题已经解决现有的方法是否正确我们需冷静下来回归到最基础的定义和内涵上面思考/厘清什么是“具身智能”一、具身智能的思想萌芽“算力霸主”英伟达NVIDIA创始人兼CEO黄仁勋在ITF World 2023半导体大会上称“具身智能”将引领下一波人工智能浪潮引发了全球范围内对“具身智能”的关注。具身智能的思想萌芽于人工智能诞生之初。1950年图灵在其为人工智能奠基、提出图灵测试的经典论文《Computing Machinery and Intelligence》的结尾展望了人工智能可能的两条发展道路[1]一条路径是聚焦抽象计算比如下棋所需的智能另一条路则是为机器配备最好的传感器、使其可以与人类交流、像婴儿一样地进行学习。这两条道路便逐渐演变成了非具身和具身智能。2023年5月份以来学术界以李飞飞、姚期智、卢策吾、李德毅、郑南宁等专家学者为代表相继发布“具身智能”相关的学术论文和演讲。产业界以谷歌、特斯拉、英伟达、META、阿里、小米等巨头公司为代表积极跟进相关产品和技术布局。以ChatGPT4为代表的各类大模型出现人形机器人的再次走红关于所谓的“具身智能”新进展井喷式涌现在各领域中展现出的巨大吸引力是否代表着人工智能的关键问题已经解决现有的方法是否正确我们需冷静下来回归到最基础的定义和内涵上面思考/厘清什么是“具身智能”二、现有具身智能的典型观点当前有以下几种关于“具身智能”的典型观点。观点1AI大模型躯体机器人具身智能“具身智能”是指能理解、推理、并与物理世界互动的智能系统。[2]该观点认为“具身智能”是一种智能系统具有理解、推理并与物理世界互动的功能。通常将大模型搭载在物理躯体如机器人上来实现让大模型充当机器人的“大脑”或者说给大模型“穿上机器人外衣”将图像、文字等数据输入大模型进行联合训练通过与世界交互的反馈结果指导人为手工标注以提高模型的泛化能力。在LLM(大语言模型)、VLM(视觉-语言模型)、VNM(视觉导航模型)的加持下人类用自然语言给机器人下达指令可以看到语言指令对应任务的效果展示。但在执行精度要求较高的任务时需依赖于人工参与校正即通过人输入偏离的指令来校正机械臂这说明该类“智能”系统对空间对象没有精细辨识能力没有测量功能不具备系统依据感测结果与基准信息的比较也就无法做出自适应决策与规划的智能特性即系统不具备一般问题求解和响应的能力。相关资料展示出机器人智能系统“与物理世界的互动”但互动过程显示机器人感知对象所指“语义”是由人工标注实现的点云“视觉”信息集合机器人大脑没有关于对象边界虚-实交界的有效度量信息说明“它”没有理解物理对象只是机械的执行人的语言指令做出一个动作进行响应。大模型是基于海量数据、在人类参与注入先验知识基础上训练出来的符号相关性网络概率映射无法实现物理世界中语义的“理解”。借用具身认知中“与环境交互”思想简单的将大模型与机器人的结合来定义/理解具身智能是不能令人信服的。观点2人形机器人具身智能“具身智能”是指身体并支持物理交互的智能体。[3]人形机器人是具身通用人工智能最理想的身体形式。该观点认为“具身智能”是指拥有身体的智能体通常会让人误认为人形机器人就是“具身智能”这个表述本身有语法错误。马斯克推出的人形机器人Optimus擎天柱是典型代表最新进展显示其可以拿捏物品、缓慢走路等运动控制能力持续进化。Optimus大概率复用特斯拉FSD自动驾驶及神经网络学习技术通过传感器相机、激光雷达收集数据大规模数据集对模型训练实现识别“智能”的实现路径与观点1中大模型路径一致瓶颈均在于用数据训练“刷”出来的输出结果无法有效映射物理对象在数据匮乏领域是无法应用的。该观点着重强调“身体”意在区别于符号主义主张智能是基于逻辑规则的符号操作运算以及区别于连接主义主张智能是脑神经元构成的信息处理。人形机器人是未来泛通用机器人的最佳产品形态但“具身智能”的主体形式不必要限制在外观上的“人形”根据使用用途和场景的不同可以有多种形态。仅有人的外观没有实现智能本质突破的人形机器人没有灵魂。将具有身体的智能定义为“具身智能”是不正确的也不能以身体的形式作为判断是否属于“具身智能”的依据。观点3卢策吾教授“具身智能”是指一种基于物理身体进行感知和行动的智能系统 其通过智能体与环境的交互获取信息、理解问题、做出决策并实现行动 从而产生智能行为和适应性。[1]该观点认为具身智能拥有支持感知和运动的物理身体可以进行主动式感知也可以执行物理任务。[4]卢教授给出的”具身智能”的定义从具身性视角将智能体与环境融合在一起强调“感知-行动回路”的重要性即感受世界—对世界进行建模—进而采取行动—进行验证并调整模型的过程关注身体与环境之间的互动在智能行为的产生和适应性提升中发挥的重要作用具有借鉴意义。三、“具身智能”的本质究竟是什么1认识论源头“具身智能”是以具身认知为指导的人工智能体现哲学一元认识论思想。具身认知属于哲学和认知心理学的概念是指人的认知和智力活动不是大脑的孤立计算而是大脑、身体通过感觉器官及环境自适应交互作用的产物。2生物智能的基础和渐进性参考生物智能的本质活体生物的细胞、器官或组织、单体生物均有不同层级智能生物智能是“肉身”物质构造的机能。活体生物的细胞本身是信息感知和处理器官通过代谢过程实现物质、能量与信息的转换完成生存、繁衍等一系列智能的表现这构建了最低层次的智能本能性的。进化到器官或组织的智能高等动物的感觉器官视觉、听觉、触觉等发育的关键阶段需要自主肢体运动配合形成具有部分认知功能的智能。进化到更高级的人整体的智能活动环境的扩大和复杂化对记忆和判断、决策的要求推动大脑的形成和进化以神经系统为基础的认知功能形成。从单细胞的智能→组织和器官的智能→高级物种整体的智能→群智能是不断的重组和涌现的过程。进化的成果融合在遗传基因中强化某些器官或系统影响基因、遗传变异的来源提高生物体生存能力。进化过程中基于少样本和低功耗使得智力达到更高的高度利于物种生存和亚系繁荣。生物智能是“肉身”物质构造的机能强调智能信息处理依赖物质构造物质载体不可或缺。3我们关于“具身智能”的定义“具身智能”是指主体机器在自体、对象与环境等要素间相互作用信息感知、转化和响应的过程中建构符合各要素物理实存及其关系演化趋势的认知模型达成问题解决或价值实现的人工智能方法。具身智能是一种人工智能方法强调智能主体在处理信息时要将关注的对象、环境以及自体均要纳入信息处理范围中。具身智能的方法是分级的嵌套的类比于细胞最基础层单元的自体物理构造与所需处理的智能任务的信息模型在数学上是同构的。例如细胞实现最低层级的智能是一个循环图、器官和组织的智能再到生物整体的智能都表现为循环分级嵌套模型。这种类似于分形理论的循环嵌套模型将低层级的信息做压缩和抽象这样高层级的智能循环不至于太复杂。具身智能在认知与实践的矛盾运动中实现智能增长。智能增长是指在实践过程中整体模型的构建和优化智能主体在感知到信息以后经过决策、规划要对外输出行为这样才能够实现循环的闭环从而在此过程中实现智能的增长。4“具身智能”的任务和使命作为一种人工智能方法“具身智能”要解决其他方法、工具难以解决的问题才能展现其存在价值和生命力。1948年维纳出版《人有人的用处》提出“控制论”概念1956年DARTMOUTH会议提出人工智能概念至今人工智能科学先后发展出行为主义、符号主义、连接主义等不同的学派用于发展“机器”智能解决人类所关注的各种问题取得巨大的成功。机器智能所具备的能力应用于模拟低等生物智能、确定目标跟踪及机器自动控制、图片识认、语音识别与生成、机器翻译、视频转换以及某些专项问题的解决等方面表现出惊艳的能力。但是即使大模型、生成式人工智能、人形机器人掀起全球关注的今天我们掌握的人工智能方法仍然处于弱人工智能阶段。通往高级的、与人类智能相当的人工智能方法路径是什么这是我们关注“具身智能”的根本原因也是“具身智能”的使命。因此“具身智能”关键任务在于借鉴具身认知的思想使得机器在对象识别、工具使用、推理和规划、价值判断、语言使用等方面基本达到人类智能的水平。其中让机器“理解”空间实现“实物对象到信息端精细语义”的映射是解决上述关键任务的最基础的工作。5“具身智能”的关键要素①重构映射主体对物理实存进行镜像映射在信息空间中基于重构映射内容的交互作用来决策和行动。信息空间的镜像能力是“智能进行度量、评判”的基础。要对对象进行有效的认知最好的方法就是在大脑里构建关于这个对象的逼真的模型和模型的演化人类有效把握某个问题的关键也在于此。例如我们在现代战争中可以通过仿真模拟或沙盘模拟推演在信息层有效映射不同要素和过程变化使得战争指挥更有效、更高明。重构映射中最基础的是视觉信息的重构。基于视觉准确的感知和理解环境包括对物体的理解、结构的理解、可操作性的理解视觉感知与物理实存交互印证这是具身智能实现的基础。②认知过程的交互建构认知是在大脑-身体-环境之间互动过程中建构或构造出来的涌现概念并强化概念内涵在行动中反思-反思中实践-实践中建构的螺旋上升过程。我们的认知过程是大脑、身体、环境的互动中不断循环构造出来的是动态的过程。例如战争中在无法摸清敌方兵力部署的情况下采用炮火侦查的方式观察敌方反应。③通道约束认知受感知通道、信息[5]输出通道能力的约束。感知通道的约束可以从两个例子来理解一个是不同传感器下的观测结果不同如人眼中的月亮以及使用望远镜看到的月亮是不同的另一个是在距离过大或信息通道不够时信息会退化如近处的飞机可以看到详细构造随着飞机越来越远逐渐退化成一个点直到消失。信息输出通道包括动作的输出以及语言的输出我们在认知形成过程中形成对对象世界改造的目的、计划和方式的信息通达于实践对世界加以改造[6]——改变物质存在的信息状态。四、具身智能是智能科学发展的新范式吴易明研究员在2021年学术报告[6]中提出具身智能是智能科学发展的新范式强调1具身智能是对已有人工智能技术路径包括符号主义、行为主义、连接主义的批判和提升促进智能科学发展的升级与进步。2基因[7]决定不同生物种属智能水平的高低基因编码本质是数学性的研究中引入现代数学成果是必要的。生物的基因实际是一种数学编码可以完成遗传信息的表达与传递由基因、信息生物学决定的后天发育过程是可控的也应该是可借助数学模型解释表征的——这需要更为抽象的现代数学工具。3细胞级智能、低等生物、生物无意识行为和响应大多服从控制论模型。不论是生物、社会、包括物种的竞争某种意义上也服从控制论模型“具身智能”不否定行为主义是行为主义的延伸与提升。4高级生物动物神经元后天发育中自然物理规律扮演“监督”角色。高等生物体发育出了大脑和神经系统它的发育是与环境交互作用的结果“学习”让生物体变得更聪明行为变化会融入后代的基因中。生物主体基于问题求解而反作用于环境的基本循环是高层次智能发生的必要基础。“具身智能”肯定连接主义的研究连接主义在一定范围内是有作用的如何划定其有效作用的范围是科学家应该认真对待的课题我们认为其输入端信息空间和输出端信息空间在维度上的关系大概是划定其有效性的关键因素。5接近人类的通用人工智能最基础的任务是实现对“物理实存对象空间及运动属性的认知模型建构”。6“语言、符号、逻辑”是人类文明高级阶段的特有成果是“人类”生物肌体映射物理世界成果的溢出和卸载是构建高等级智能主体的基石人类对其正确运用依赖于有效解决哲学上的“指称”问题。语言、符号和逻辑是人创造出来用于认识世界的工具人实现了对对象空间属性的清晰辨识。识别实现了语义信息空间与实存对象之间的映射是智能的基本问题。通用人工智能突破的关键点在于从技术上解决维特根斯坦提出的“指称”问题。五、总结“具身智能”的概念是从生物进化史、人类文明史、人的成长史的源头寻找灵感探究智能的本质厘清智能概念[8]的基础上凝练而成的。概念辨析处于科学研究首要地位为智能科学技术突破指引方向。“具身智能”是引领未来智能科学发展新的范式。其核心在于视觉智能底层技术架构的突破和应用即解决唯一映射问题。“具身智能”强调重构映射应用在智能机器人系统中时视觉智能技术架构的突破使得机器人将现实的感知信息“各归其位”数学语言到物理存在映射的唯一性实现真正的拟人化信息处理是机器人真正在非结构化环境中大规模落地应用的关键。这种架构最基础的成分是数学的小样本的而非“迷恋”大数据集、更高的算力、以及多模态等路径。经过八年的艰苦努力从理论研究到产品应用落地这个过程诠释了“建构性”方法的运用我们已经初步验证了“具身智能”方法的正确性并且看见和感受到了“具身智能”带来突破的曙光也看到更多的科学家涌入这个方向。我们只能依赖“人类的智能”以及人类文明的成果来研究智能的本质“不识庐山真面目只缘身在此山中”这个缘由决定了研究工作必然充满艰辛挑战诸多但我们确信“具身智能”将开启机器智能的新阶段。写在最后——以TVA重构视觉技术的理论内涵与能力边界随着ChatGPT4等大模型及人形机器人的兴起“具身智能”成为热点话题。本文探讨其本质指出当前主流观点存在局限如简单将“AI机器人”或“人形躯体”等同于具身智能。通过追溯具身认知的哲学源头和生物智能的渐进性提出具身智能的核心是主体通过与环境交互建构动态认知模型强调重构映射、交互建构和通道约束三大要素。文章认为具身智能是智能科学的新范式需突破视觉底层技术以实现物理与信息空间的唯一映射为通用人工智能提供新路径而非依赖大数据或算力堆砌。最终指出解决“指称”问题和小样本学习是关键具身智能将引领机器智能进入新阶段。附具身智能算法突破TVA-VLA为了将复杂动作拆成可以验证、组合和重新排列的原子技能atomic skillsTVA智能体与VLAVision-Language-Action模型进行深度耦合并通过“感知-决策解耦迭代”的双引擎机制实现高效协同与突破。其中TVA作为感知前置引擎主要负责高精度视觉特征提取、数据降噪与特征压缩为决策层提供高质量输入并降低算力负荷VLA则作为决策执行引擎专注于语义理解、任务规划与动作生成。两者通过双向反馈闭环实现了感知精度与决策效率的协同优化与自主迭代突破了传统具身智能系统“感知粗糙、决策僵化、迭代低效”的产业化瓶颈。TVA-VLA架构不仅成功应用于强光环境降噪、边缘端轻量化推理、精密装配微状态感知及故障自愈等复杂场景还支持模块化升级与跨场景适配如工业分拣、家庭服务结合硬件抽象层实现的“一次开发多机部署”以及数据飞轮机制显著提升了具身智能系统的鲁棒性与产业化落地可行性。重磅预告本专栏将独家连载系列丛书《AI智能体视觉技术与应用》部分精华内容该书是世界首套系统阐述“因式智能体”视觉理论与实践的专著特邀美国 TypeOne 公司首席科学家、斯坦福大学博士 Bohan 担任技术顾问。Bohan先生师从世界模型开创者、“AI教母”李飞飞教授学术引用量在近四年内突破万次是全球AI与机器人视觉领域的标杆性人物www.type-one.com。全书严格遵循“基础—原理—实操—进阶—赋能—未来”的六步进阶逻辑致力于引入“类人智眼”新范式系统破解从数字世界到物理世界“最后一公里”的世界级难题。该书精彩内容将优先在本专栏陆续发布其纸质专著亦将正式出版。敬请关注版权声明本文系作者原创首发于 CSDN 的技术类文章受《中华人民共和国著作权法》保护转载或商用敬请注明出处。参考文献[1] 具身智能|CCF专家谈术语.中国计算机学会.2023[2] 具身智能人工智能的下一个浪潮.智能机器人系统公众号.2023[3] 行业报告|具身智能推动AI新浪潮.BFT机器人公众号.2023[4] 深度 一文带你读懂“具身智能”.机智说.协作机器人客户端.2023[5] 邬焜[法]约瑟夫·布伦纳等著.信息哲学基础理论及其意义阐释.中央编译出版社.2021[6] 吴易明.《面向工业4.0的视觉智能机器人》.智能检测技术与智能制造高级研修成都.2021[7] 理查德·道金斯.《自私的基因》.中信出版社.2012[8] 吴易明.具身认知视角下“智能”的概念.具身智能公众号.2022作者吴易明 中国科学院大学教授、西安中科光电精密工程有限公司创始人梁 晶 西安中科光电精密工程有限公司
返回列表