银河通用王鹤:AstraTennis 问世,中国具身智能迎来“质变时刻”
作者:系统管理员 发布日期:2026-08-27 浏览次数:

近日,在 2026 年世界机器人大会(WRC)银河通用机器人联合 36 氪、财新数据主办的“具身智能大模型的进化之路”分论坛上,银河通用创始人兼首席技术官、北京大学研究员王鹤发表演讲致辞。

致辞中,他认为数字 AI 从 AlphaGo 到 ChatGPT 的演进路径,为具身智能的发展提供了清晰的参照:先在特定高难度物理任务上实现“ AlphaGo 时刻”的专精突破,再找到“ GPT 范式”让模型走向通用,最终通过降低落地门槛迎来“ ChatGPT 时刻”的产业普及。他通过银河通用具身大模型的技术路线对此进行了系统性阐释:

第一步,实现具身智能的“ AlphaGo 时刻”。 王鹤认为,人形机器人需要在充分复杂的物理任务上达到人类水平,才能标志技术出现核心突破。银河通用选择网球作为验证载体——今年 3 月,银河通用全球首次实现人形机器人自主打网球,并实现与人类多拍对打,获特斯拉 CEO 埃隆·马斯克公开认可,称其标志着人形机器人“AlphaGo 时刻”的到来。同时,银河通用在灵巧手操作上同样问鼎这一时刻:以春晚“盘核桃”为代表,其灵巧手神经动力学模型(DexNDM)全球唯一实现了“转笔”从仿真到真实的部署,攻克了行业长期无法突破的密接触操作 Sim-to-Real 难题,将机器人手部灵巧性推至全新高度。

图片

第二步,从专精走向通用,关键是找到“GPT 范式”。 王鹤认为,人形机器人既需要大脑(感知、认知与决策),也需要小脑(丝滑执行与实时响应)。

大脑的 GPT 范式上,银河通用融合 VLA 与世界模型两大技术路线,于 2025 年在 ICCV 上全球首次提出“世界-动作模型”(WAM),如今已成为行业公认的下一代技术方向,其通用大脑 AstraBrain WAM 0.5 已实现跨场景、跨本体、多任务作业;

小脑的 GPT 范式上,银河通用则以 AstraBrain WBC 0.5 作答——依托20亿帧全球最大规模人类动捕数据驱动的 Scaling Law,实现未知动作的泛化与低延迟精准追踪。大脑与小脑通过脑桥连接,构成全球首个端到端集成一体的“银河星脑(AstraBrain)”具身大模型。

第三步,走向“ChatGPT 时刻”——核心是降低落地门槛。 王鹤定义了具身智能的“ChatGPT 时刻”:零样本泛化达到 70%-80% 成功率,且非专家用户也能用极简方式完成场景部署。为此,银河通用推出 WAM-TTT 测试时后训练范式——用户只需拍摄一段第一视角工作视频,无需任何标签、无需遥操,即可一键完成模型后训练并高成功率部署,让具身智能从“专家专属”走向“人人可用”。

图片

这一切迭代的背后,离不开数据飞轮的驱动。 银河通用搭建了“银河星数(AstraData)”五层金字塔数据基建:从互联网数据、人类动作数据、合成仿真数据、真机遥操数据,到真实场景回流数据,构成源源不断的技术迭代闭环。同时,银河通用积极开放二开生态,提供仿真平台、数采设备、基模与后训练管线,携手千行百业共建具身智能生态。

从“AlphaGo 时刻”到“GPT 范式”再到“ChatGPT 时刻”,银河通用正在完整走通具身智能从专精到通用再到产业化的进化之路。王鹤在演讲最后展望,一旦实现具身智能AGI,将催生“手机的量、汽车的价、大模型的增益”的万亿级市场,开启人类第四次工业革命。

以下为王鹤博士演讲全文:

尊敬的张院士,尊敬的各位学者嘉宾,非常欢迎大家莅临银河通用机器人主办的分论坛。今天我也想跟各位来宾一起探讨如何推动具身智能与人形机器人产生属于中国的核心突破时刻。

相信今天与会各位来宾都怀着一个相同目标,即“驱动具身人形机器人走向通用,达到物理智能、具身智能的 AGI”。

图片

在这条长路上我们不仅需要关注硬件本体的突破,更重要的是如何让一个机器人大小脑都走向通用,能够使机器人本体发挥出像人一样的灵活性、通用性。

今天我的报告主要介绍如何推动具身人形机器人一步一步走向通用,并把其中一些重要的里程碑一起标志出来,探讨整个领域的何去何从。

图片

走向通用的第一步,是我们要看到人形机器人在特定需要人形的充分复杂任务上做到与人类相对应的水平,这将是具身智能的 AlphaGo 时刻。

2016 年,来自 DeepMind 的机器人 AlphaGo 第一次在围棋上下赢了世界冠军,这是人工智能的里程碑时刻。我们银河通用认为网球正是实现具身智能 AlphaGo 时刻的最佳载体。

今年 3 月份,我们在全球第一次实现了人形机器人全自主打网球。网球是一个极其复杂的活动,需要机器人精准控制全身平衡,同时腕部需要很高的精准度才能使球拍碰到球,球路才能正确过网,打到敌方的关键区域得分。这样的运动并不只是小脑的平衡,还涉及到大脑决策——怎么调球、怎么得分,所以网球真的是汇集了大脑和小脑的能力,同时强调精准控制。

图片

我们在全球第一次实现了人形机器人与人类的多拍对打,一经发布便得到了全球科技媒体和科技界关注。美国特斯拉创始人马斯克回应一个独立研究员的评论,他认可这标志着人形机器人的 AlphaGo 时刻到来。包括特斯拉前自动驾驶负责人也惊叹说,第一次看这个视频的时候认为它是 AIGC 生成的,根本不是今天人形机器人能够达到的水平。

图片

银河通用打通人形机器人大小脑,能够在一个足够复杂、标志着具身智能技术出现核心突破的任务上获得国际科技界一致认可,背后是我们自研人形机器人强化学习仿真平台。

从基础的回球学习到有一定水平策略之间相互对打,我们通过上万小时的网球训练数据,使得人形机器人网球水平不断攀升。既在一定程度上与当年围棋如何超过人类有相似之处,又有高出围棋技术的特殊性,还强调不仅在仿真器里能够打的好,还能在真实世界达到可以部署的高水平,这就是跨越从虚拟到真实的鸿沟。

图片

银河通用向世界证实了像网球这类挥拍、击球都具有高度非线性的动作,在球拍、地面、球体均不能完全视作刚体的现实条件下,我们也可以让它跨越从虚拟到真实的鸿沟,验证了银河通用自研仿真平台银河星坊的世界领先性。

不只是身体的智能,人形机器人达到具身智能的 AlphaGo 时刻可能还需要手。手指灵活性可能在网球里没有完全凸显出来,今年春晚我们在跟沈腾、马丽的节目里展示了灵巧手盘核桃。

图片

有人说灵巧手盘核桃有什么了不起?它不是一段固定的轨迹,核桃每次转动之间的碰撞让手指到底分多开、合多紧,是动态变化的。如果用一个固定轨迹,盘一会儿,这个核桃要不飞出去了,要不就被你捏爆了。这样一个盘核桃能力,也是基于我们银河星坊强化学习做出来的,顺带回应了国际学界的诸多疑问——像手操作这样密接触到底能不能实现 Sim-to-Real。

银河星脑灵巧手分脑区也通过了仿真第一步强化学习,再结合真实世界的数据回流,训练出了灵巧手的神经动力学模型,使得世界范围内的灵巧手密接触操作难题能够被攻克。

这样一个盘核桃无法通过模仿学习(人类遥操灵巧手)获得数据,今天的任何遥操方式都无法实现,必须需要强化学习,而强化学习又迟迟不能实现 Sim-to-Real,直到我们实现了这个突破。

跟美国头部人形机器人公司对比,左边灵巧手开瓶盖的技能,动作不是连贯的,是抓住瓶盖一起拧开。

图片

有些人说为什么机器人学出来的技能是这样的?而不是像我们人类那样连贯使用指尖滑移?我只能给出一个学界一般性解读,这个数据有可能来自于人类遥操采集的数据,右边多指之间的密切配合,今天还不能用遥操实现。可以看出我们基于仿真强化学习实现的灵巧手操作能力,远高于依靠遥操采集数据所能达到的水平。不只是盘核桃和使用改锥,我们致力于不断突破灵巧手操作的想象力。

左边是英伟达在 2023 年展示的转笔,也被英伟达评为 2023 年英伟达十大技术突破之一。虽然第一次实现了仿真器里的转笔,但笔和手之间的多碰撞,在真机部署上非常难,有大量的 Sim-to-Real Gap,大量笔跟手之间的穿模,在真实世界是无法做到的。我们 AstraBrain Dex 在全球第一次实现了灵巧手转笔,这意味着我们全面达到了一般人可以做到的灵巧手操作能力。

图片

但这是去年的水平,今年我们在转笔上进一步放飞灵巧手,实现了更多可能性。刚刚是横着转,现在是竖着转,甚至笔能飞起来再收回。像这样水平的灵巧手操作,应当说在全世界没有任何其他研究机构和团队曾经展示过,银河通用基于银河星脑的灵巧手技术在全世界第一次实现了突破。

图片

银河通用在全身全手的控制上都在问鼎人形机器人和具身智能的 AlphaGo 时刻,最重要的问题是如何能够实现从专精的运动走向通用?如何从 AlphaGo 找到具身智能的 GPT 范式,这个范式将真正推动人形机器人走向更广阔的应用。

关键问题是什么是具身智能的 GPT 范式?人形机器人既有全身全手控制,又有更高层级的感知、认知与行动决策。我们一定是既需要人类大脑,又需要人类小脑,把大脑、小脑、脑桥连成一起,成为一个大脑大模型和小脑大模型通过脑桥实现端到端的大模型,这就是我们银河星脑的技术框架。

图片

这里我们还要分别回答大脑和小脑的 GPT 范式是什么,是否找到了。

大脑的 GPT 范式,几年以前,Google 从 RT2 开始的 VLA 一度被大家认为是人形机器人大脑的 GPT 范式,后来又有 OpenAI 所代表的世界模型,现在也是当下热点。

不论是 VLA,还是世界模型,都有它自身的局限性。VLA,一定要输出vaction,所有监督数据、训练数据都要有 action label。世界模型,是预测未来,可以不需要机器人的动作标签,用人类的数据也能训,问题是训完以后只能畅想未来,不知道该怎么做事情。

银河通用将这样两个范式融合为一,提出了 WAM(世界动作模型)。WAM 今年受到学术界共识以后,已经在很多场合被反复提及。

图片

这样一个技术是银河通用全球第一个提出来的。2025 年 3 月,我们在被 ICCV 2025 接收的文章中第一次提出了 WAM,按照投稿时间进行排序,可以发现最早一篇文章来自银河通用,我作为通讯作者。

图片

我们今天看到融合世界模型与VLA范式的做法,也是银河通用在世界范围内引领。这一范式最新工作是 AstraBrain WAM 0.5,它并不是把 RGB 完全清晰地想象出来,而是在一个把跟操作无关的光照、纹理都去掉的隐变量空间里去想象未来,这样一个隐变量动力学操作模型就是我们 AstraBrain WAM 0.5。

图片

这样一个大模型已经实现了跨场景、跨本体、多任务的作业能力。多任务,既有二指夹爪在商超里上下货,又有用它叠衣服;跨本体、跨场景,有能用机器人搬箱子,使它真正成为了一个具身智能的基础模型。

图片

这样一个基础模型背后,是仿真数据、真机数据和人类数据的融合,只有把这几种数据都融合在一起,才能发挥它们所长,把模型水平训到最好。

图片

我们今年也展示了一系列惊人结果,包括使用完全没有标签的人类手操作的这部分视频,可以让我们基模在动作预测上的损失进一步下降。这个模型只看人类第一视角干活视频,没有任何标签,就能更好地学自己该怎么操作。

图片

前几天大火的 DYNA-2 大模型讲的就是看人类视频,可以让机器人的动作预测损失更低,我们则在今年 2 月份率先向全球汇报了这样一个结果。

这个基模,耦合上我们真机强化学习技术,就可以实现抗干扰的长程任务。今年我们的展台上展示了抗干扰做早餐,大家可以在这个过程中各种移动杯子,你的手往杯子上一盖,我们机器人就不会给水杯倒水了。在这个过程中不断调整面包,它插进去,你拔出来,它要倒水,你把杯子拿走,最后摆盘,你要移动盘,机器人能够一直把任务完成。这就是在基模之上再加上真正的真实世界强化学习,就能实现长程和抗干扰。

图片

我们还将发布一个真正有突破性意义的 10 分钟级的超长程做早餐,这个技术将把切水果、做三明治、烤面包、倒水等,人类 10 分钟内能完成的活,我们全自主完成,后面我们会进一步发布真机强化学习的革命性技术。

刚刚讲的是大脑,那么小脑的范式就是接受人类或大脑的意图,并进行丝滑、柔顺的执行。我们让人类穿上动捕装置,人类做什么,我们机器人就实时跟踪做什么,这就是人形机器人的通用小脑。

图片

银河星脑全身控制 AstraBrain WBC 0.5 模型,不只可以做训练过的动作。在机器人没见过的动作中,可以看出,即便是数据库中最近邻的动作跟它有很大的差距,我们模型已经向没见过的各种动作泛化。

图片

它能支持我们远程让人形机器人做各种生活中的任务,包括喂猫,以及让人形机器人走入一些危险、繁重、有挑战性的场景,包括高动态动作,都是实时遥控的。

可以看到模型整个流畅度和精准度、低延迟这些优秀性能,使我们机器人能够丝滑被远程遥控,如去支援火灾,做各种应急安防,甚至进行消杀等等。

图片

这一模型也可以左右对比,左边是英伟达放出的通用小脑 SONIC,右边是我们银河通用的模型。完全公平情况下,由一个人下发全身运动指令,他俩同时进行跟踪,我们模型延迟,包括动作精准度,都优于英伟达的 SONIC ,甚至当人类做出一些有挑战的动作时,我们机器人还能非常稳定,而 SONIC 控制的人形机器人摔倒了,体现了我们通用小脑的稳定性和卓越性。

背后也是我们银河打造的 20 亿帧人类动捕数据驱动的 Scaling  Law,真正看到了在关节追踪误差的不断下降。20亿帧也是全球范围内规模最大的,之前最大的数据级比我们小 10 倍到 100 倍,我们在小脑上也开始了 Scaling up,大脑和小脑都是大模型,中间再通过脑桥连接。

图片

我们已经找到了大小脑 GPT 范式,下一步就是进一步扩大数据,扩大算力,让模型性能真正达到数字世界里 GPT3.5 或 ChatGPT 突破性的时刻。

首先,要定义什么是具身智能的 ChatGPT 时刻。

图片

很多人讲具身智能 ChatGPT 一直没有被很好的定义。

给一个我们银河通用的看法,数字世界的 ChatGPT 能够零样本跟大家进行文字语言交流。2022 年 ChatGPT 第一次发布时,回给你的文字大约七八成你是满意的,今天如果讲具身智能达到 ChatGPT 时刻,基本上在人类不需要专门学习相关技术的基础上,也能零样本泛化,并达到 70%-80% 的成功率。而它离 100% 成功率之间怎么弥合?它有可扩展性,可以让客户用极其简单方式能使用我们的模型,提升我们模型,服务于他的场景。

ChatGPT 拥有账号就可以使用。今天具身智能的一个痛点是需要客户是一个专家级的开发者,进行遥操数据采集和相应后训练,无疑使得具身智能即使基模达到七八成成功率,也无法让所有人都用得起,能够会用、好用。

能不能让我们的客户没有任何计算机科学、人工智能背景,也可以采集数据、可以一键上传数据、一键训练模型,最终能够在一天时间内,最长不超过一周时间内,把整个模型高成功率部署于他的场景。如果能做到,就能看到像卖 C 端产品一样卖 To B 产品,因为谁都用得起,谁都会用。

这样的革命性技术,就是具身智能 WAM-TTT 时刻。只需要人类带着相机拍摄自己干活的动作,就可以进行后训练。

图片

在这个技术里,只需要人类在他自己的工作场景里采集一段第一视角的工作视频,我们模型不需要任何标签,只基于视频预测损失进行微调,就可以迁移到用户的场景进行高成功率部署。WAM-TTT 测试时后训练范式,让我们的模型更加易于部署,让所有人都能用得起。

这仍然是一条将不断迭代的路线,让我们的技术能够更好的被所有人用起来。更好的用起来之后,就是如何让基模更加强大,基模更加强大需要更好的数据。

银河通用在走向 ChatGPT 路上,搭建了银河通用的大规模数据基础设施银河星数(AstraData)。

图片

银河星数是整个具身智能数据基建,构成了“互联网数据、人类动作数据、合成仿真数据、真机遥操数据、真机回流数据”的五层金字塔。这个五层金字塔,能够让机器人既学习语义感知能力,又学习人类操作物体的经验,模仿人类干事情,又能得到大规模可复制的仿真数据和真实世界的高精遥操数据,以及部署场景的不断回流数据,从而转起数据飞轮。

人类数据也是当下的热点,团队在 2021 年就推出了全球至今为止仍然是最大的全标签人类动作数据集 HOI4D。

图片

这是一个第一视角既有 RGB,又有 Depth,又有时间维的人类物体操作数据集。里面有所有物体几何标注、操作标注、人手动作标注,这套管线我们从 2021 年就开始搭建,当时就引入了人头戴头盔进行第一视角采集的装置,我们提前 5 年就做到了今天很多初创公司采集设备的水平。

今天我们银河通用进一步发布 Astra Set ——全新一代数据采集解决方案。

图片

包含了第一视角头式采集,以及人类可以轻便携持的 UMI 精细操作采集夹抓,整个采集方案完美适配我们今天经过不断迭代验证的大模型需求,并且具备极好的分发性和一套真正的可视化数据采集管理平台,能够线上监控上千位 UMI 采集者实时的回流数据,并给出标签、质量等一系列自动判断。

在这样一套平台下,银河通用采集到的高精度 UMI 数据达到了 50 万小时,高精度自动达标的人手操作数据达到 50 万小时,一共有 100 万小时的人类数据。

图片

在人类数据之上是我们的合成数据,这是我们银河通用一直以来引领行业的一套基建,从数据资产到仿真器和相应动作合成管线以及各种使用工具,我们在不断推进仿真器在具身智能中的广泛和深度应用。

这套核心平台也有一套引领世界的突破,比如实现了刚柔一体复杂仿真。最近甚至能让机器人灵巧手洗牌,这样复杂的细微片无穿透仿真和多接触的仿真,在全世界都是绝无仅有的,包括这些灵巧手操作背后的学习,都证明我们的仿真技术一直走在国际最领先,

图片

当然,必不可少的也有真机遥操数据。现在银河通用在6个城市(如苏州、宜宾、南京等)进行了大规模数采部署。

图片

这部分数据属于整个金字塔从顶上数的第二层,量没有合成数据和人类数据那么大,但是真正的机器人在真实世界的数据。

机器人在真实世界的数据来源于不断的我们已经部署的场景的回流,今天银河通用已经实现了在真实场景 8 万小时的真实数据回流。

图片

耦合真机遥操、人类数据和无穷无尽的仿真数据,银河星数真正能够当得起如星星一般之多“星数”这个名字,背后的数据都是经过大规模训练和不断迭代验证的数据,具有极高质量。只有有这样的能力,才能不断冲刺基模能力实现更好的零样本泛化和更好的易用性、可扩展性,让每个人都用得起。

今天银河通用也希望向更多合作伙伴开放整个银河通用二开生态,能够让大家用我们的仿真平台,用我们整套数采设备、基模、强化学习、后训练管线,来直接作用于您的场景、您的任务,让企业都能够建起自己的具身智能团队,依托银河通用整套模型、硬件、数据平台和测试管线,让人形机器人服务于你们的场景。

图片

我们也不断投身国际具身智能教育最前沿,在世界奥林匹克人工智能比赛上,我们连续两届作为大会唯一的硬件平台提供方,参与命题、参与组织,不仅服务千行百业,也培育具身智能下一代。

图片

相信携手千行百业,一起共建具身智能生态,我们将不断向具身智能 AGI 时刻迈进。

一旦能走到具身智能 AGI 时刻,相信我们将会有一个“手机的量、汽车的价、大模型的增益”的真正万亿市场,开启人类第四次工业革命。

银河通用愿与各位一同携手,一同出发。谢谢大家!

文章来源:银河通用机器人