澎湃科技聊天室|从炫技到进场打工,机器人是真能干还是看着酷?

来自 科技2025-08-05 08:31:06

【导语】人形机器人正加速从“看着酷”迈向“真能干”的新阶段。在2025世界人工智能大会(WAIC)期间,行业专家与领军企业代表围绕具身智能机器人的技术进展与应用落地展开深入探讨。从马拉松赛场到工厂流水线,人形机器人正不断突破技术边界,逐步展现其在多场景下的实际应用潜力。未来半年,随着技术水平的进一步提升与场景的持续拓展,人形机器人有望在更多领域实现商业化落地,开启智能机器时代的新篇章。

从“看着酷”到“真能干”,如今人形机器人正在加速“进场打工”。从2025年上半年开始,它们陆续经历了马拉松比赛、格斗擂台赛等运动赛事。如今,随着具身智能技术的蓬勃发展,机器人已经开始走向真实的工厂流水线。在(zài)本(běn)次(cì)2025世(shì)界(jiè)人(rén)工(gōng)智(zhì)能(néng)大(dà)会(huì)(WAIC)期(qī)间(jiān),澎(pēng)湃(pài)科(kē)技(jì)(www.thepaper.cn)与(yǔ)蚂(mǎ)蚁(yǐ)灵(líng)波(bō)科(kē)技(jì)技(jì)术(shù)副(fù)总(zǒng)裁(cái)、资(zī)深(shēn)技(jì)术(shù)专(zhuān)家(jiā)王(wáng)志(zhì)勇(yǒng)、智(zhì)元(yuán)机(jī)器(qì)人(rén)通(tōng)用(yòng)业(yè)务(wu)部(bù)副(fù)总(zǒng)裁(cái)王(wáng)闯(chuǎng)、上汽通用动力科技有限公司智能设备高级技术经理徐啸顺,深入探讨具身智能机器人如何实现从表演到落地的跨越。

以下是对谈实录:

整体技术水平提升,尤其遥操作和运动能力

澎湃科技:和去年相比,大家觉得今年大会有哪些亮点?

徐啸顺:去年大会人形机器人品牌众多,但不像今年蓬勃发展,特别令我惊讶和欣喜。今年整体展厅非常充实,比如智元把整个工厂产线搬到现场(chǎng)。以(yǐ)前(qián)这(zhè)些(xiē)机(jī)器(qì)人(rén)可(kě)能(néng)只(zhǐ)会(huì)走(zǒu)路、挥(huī)挥(huī)手(shǒu),但(dàn)现(xiàn)在(zài)搭(dā)载(zài)上(shàng)好(hǎo)的(de)大(dà)模(mó)型(xíng)和(hé)视(shì)觉(jué)能(néng)力(lì),不(bù)仅(jǐn)会(huì)走(zǒu)路,还(hái)会(huì)做(zuò)一(yī)些(xiē)复(fù)杂(zá)动(dòng)作(zuò)。

王(wáng)志(zhì)勇(yǒng):今(jīn)年(nián)有(yǒu)一(yī)个(gè)特(tè)别(bié)明(míng)显(xiǎn)的(de)感(gǎn)受(shòu),去(qù)年(nián)的(de)人形机器人只有18家左右,而今年整个H3展馆几乎被人形机器人“占领”,产业的发展速度确实让人非常惊喜。另外,作为人形机器人行业多年的观察者,可以明显感觉到技术水平整体提升,尤其在遥操作相关技术和运动能力。去年不少机器人还需要外部支架辅助,现在大部分已经可以自主行走了。

 澎湃科技:回顾上半年人形机器人的表现,你们给它的表现打多少分?

徐啸顺:要分不同应用场景,在娱乐和运动场景,人形机器人的表现8到9分(满分10分)。像马拉松项目,已经创下了世界纪录,基本只需要一两次充电或更换电池,就能跑完整个全程,这在以前是难以想象的。整体来看,进(jìn)步(bù)非(fēi)常(cháng)显(xiǎn)著(zhe)。在(zài)工(gōng)业(yè)物(wù)流(liú)等(děng)其(qí)他(tā)应(yīng)用(yòng)场(chǎng)景(jǐng),我(wǒ)给(gěi)到(dào)7分(fēn)甚(shén)至(zhì)以(yǐ)上(shàng)。

王(wáng)志(zhì)勇(yǒng):从(cóng)提(tí)供(gōng)情(qíng)绪(xù)价(jià)值(zhí)视(shì)角(jiǎo)来(lái)看(kàn),从(cóng)宇(yǔ)树(shù)机(jī)器(qì)人(rén)上(shàng)春(chūn)晚开始到现在,进步非常明显。但从另外一个角度,进场打工或执行具体任务角度来讲,可能打7分有点乐观,整体还比较早期。

王闯:我认为站在未来看,可能是60分。但在今天看,首次工厂常态化作业直播,我可以打100分。

这次在人工智能大会上(shàng)的(de)直(zhí)播(bō),我(wǒ)们(men)有(yǒu)两(liǎng)个(gè)关键词,一(yī)是(shì)具(jù)身(shēn)智(zhì)能(néng),二(èr)是(shì)常(cháng)态(tài)化(huà)。为(wèi)什(shén)么(me)两(liǎng)者(zhě)同(tóng)时(shí)达(dá)到(dào)会(huì)这(zhè)么(me)难(nán)?人(rén)形(xíng)机(jī)器(qì)人(rén)厂(chǎng)商(shāng)做(zuò)了这么多年,从来没有具身智能进入工厂常态化作业。

以前(qián)我(wǒ)们(men)看(kàn)到(dào)很(hěn)多(duō)机(jī)器(qì)人(rén)进(jìn)厂(chǎng)打(dǎ)工(gōng)演(yǎn)示(shì),周(zhōu)围(wéi)都(dōu)贴(tiē)满(mǎn)了(le)二(èr)维(wéi)码(mǎ),而(ér)且(qiě)是(shì)改(gǎi)造(zào)的(de)环(huán)境(jìng),并(bìng)不(bù)是(shì)真(zhēn)正(zhèng)意(yì)义(yì)上(shàng)的(de)工(gōng)厂(chǎng),机(jī)器(qì)人(rén)其(qí)实(shí)并(bìng)不(bù)具(jù)备(bèi)真(zhēn)正(zhèng)进(jìn)入(rù)工(gōng)厂生产线的能力。越复杂的系统出错的可能性就越多,要实现长时间稳定运行的。难度也就越大。

澎湃科技:机器人在车间工作时具体会面临哪些实际挑战?

徐啸顺:我们车间主要从事新能源汽车的生产。整体来看,工厂布局非常工整、产线和工艺流程都经过明确的规划,这其实为机器人提供了比较理想的工作环境。但即使这样,还是会有一些挑战和变化点。

像智元这类机器人产品已经具备了一定程度(dù)的(de)适(shì)应(yīng)能(néng)力(lì),例(lì)如(rú)能(néng)处(chù)理(lǐ)箱(xiāng)子(zi)摆(bǎi)放(fàng)位(wèi)置(zhì)和(hé)规(guī)格(gé)的(de)变(biàn)化(huà),这(zhè)些(xiē)都(dōu)已(yǐ)经(jīng)在(zài)它(tā)们(men)的(de)程(chéng)序(xù)中(zhōng)被(bèi)考(kǎo)虑(lǜ)进(jìn)去(qù)。

我(wǒ)们(men)认(rèn)为(wèi)近(jìn)期(qī)应(yīng)该会出现一些试运行成功的案例,未来人形机器人实现更大规模落地推广,是可预见的趋势。据我了解,今年年底或明年初,就会有一批不同场景的试用项目陆续落地,包括在车企和物流企业的多个工位中正式运行。

“具身智能行业还处于早期阶段”

澎湃科技:今年蚂蚁集团开始官宣入局布局聚生智能,请王总来透露一下目前的进展。

王志勇:简单说一下我们的进展,我们计划在今年9月会有机器人产品面世,我们研发节奏比较快,整个行业大势也在这里,我们不能等。

 澎湃科技:我也很想问问智元的王总,您感觉到现在具身智能的竞争已经开始进入白热化的阶段了吗?

王闯:现在还不到白热化的阶段,现在是万物生长的阶段。所有的从业者我都不想称为竞争对手,现在是一起去探索航道的时期。如果这个航道已经完全被挖掘出来了,只有存量竞争的时候,那时可能才是白热化。

现在还处于非常早期的阶段,还没有哪个公司敢说我的技术范式是以后永远不变的,我们只是稍微在量产和商业化的地方走得靠前,但我不认为现在到了竞争白热化的程度。

澎湃科技:你接下来会期待看到哪些应用场景的出现?

王闯:从我内心深处,包括身边很多亲朋好友问得最多的是养老。养老产品是大家最值得期待的。但我们也同时在思考,机器人真正走进家庭,对机器人的泛化性技术、执行任务的成功率、 安全性、成本要求都特别高。

我们希望机器人能先在有限场景里把任务“做好做透”。我们的目标是把机器人执行任务的成功率提升至99.9%。我们设想的技术路线是先易后难,把机器人本体规模化和成本优化好,为机器人进入家庭做准备,这一定是一个巨大的市场。

重点突破两个方向:交互智能和作业智能

澎湃科技:各位认为,对于人形机器人行业内是看热闹更多,还是应用更多一些?

徐啸顺:专业用户还是在意人形机器人的应用落地。大家可能会掐着时间节点,比如今年年底或者到明年年初(chū)先把一些应用试运行跑起来,总结问题去更好地实现技术迭代。

看热闹的话,可能会把注意力都放在大型活动上,人形机器人去表演、互动,这也有好处,可以增加产品硬件打磨。毕竟只有人形机器人出货量大了,才有可能实现降本和产业链的优化发展。

王志勇:首先,人形机器人“表演秀”为观众提供情绪价值,肯定有价值。但在我们研发路径上,还是会更关注具体落地。我们现在大部分的精力也集中在把机器人的本体技术打磨好、做扎实,然后在一些特定的场景下让它跑起来,之后在逐步泛化。这个市场很热闹,我认为行业内的人要冷静。

王闯:情绪价值和注意力经济也有价值,机器人有一部分场景是为情绪价值服务的。现在机器人的能力是在持续增长的。我们把它定义为一个本体加三个智能。

本体的成熟度现在进步非常快,运动智能也取得不错的进展。在展台上,机器人可以在现场巡馆巡展、跳舞等互动,这些都说明它的运动智能逐步完善。

但要真正让产品开发出用户价值,还需要重点突破两个方向:交互智能和作业智能。

作业智能即让机器人“干活”的能力,这是一条更长的路,而交互智能相对见效更快,能更快地让大家感受到人形机器人的价值,这只是第一步;在我看来,在机器人发展初期阶段,只要是客户愿意买单,有实际价值的功能,都值得去做。

机器人遥控操作可做业务兜底

澎湃科技:徐总你们作为应用方,你们会比较看重机器人哪方面的作业智能?

徐啸顺:对应到机器人,一方面是稳定性,不能突然有意想不到的动作和程序有突发状况;另一方面是机器人对整体的场景适配程度。

现在我们很多工作集中在消除用户或使用人员对机器人产品的理解差距。这个过程可能还有点困难。

从效率来看,现在人形机器人的效率可能会比人稍微弱也很合理。随着后续产品持续优化,机器人最终是可以达到甚至超越人工效率的。在一些高风险工位,机器人已经体现出明显优势。比如一些涉及带电作业的零部件,人形机器人上岗后,可以有效消除操作人员触电的风险。

王志勇:机器人参与表演秀提供情绪价值和机器人具体干活,这两者可以对应到人有两种激素,内啡肽和荷尔蒙。情绪价值像荷尔蒙,比较短暂。对人来讲(jiǎng),产(chǎn)生(shēng)长(zhǎng)久(jiǔ)的(de)价(jià)值(zhí)还(hái)是(shì)内(nèi)啡(fēi)肽(tài)的(de)价(jià)值(zhí),即(jí)能(néng)真(zhēn)正(zhèng)帮(bāng)助(zhù)人(rén)去(qù)解(jiě)决(jué)具(jù)体(tǐ)问(wèn)题(tí),提(tí)供(gōng)生(shēng)产(chǎn)力(lì)。

传(chuán)统(tǒng)的(de)工(gōng)业(yè)机(jī)器(qì)人(rén)在(zài)特(tè)定(dìng)场(chǎng)景(jǐng)下(xià)做(zuò)一(yī)个(gè)高(gāo)精(jīng)度(dù)的(de)工作,已经比人都高效,具身智能的重点还是在于多任务、多场景的泛化能力。这点来讲,行业内还有很多挑战。

看落地,我反而认为遥操作的技术,可以做业务兜底,另外从获取数据的角度来看,遥操作也非常有用。短期来看,遥操作技术可能是对获取数据和在真实场景落地都非常重要的一个技术。长期来看,还是把智能的能力提高。 澎湃科技:其实包括现在其他品牌的机器人在展示具体操作能力时,往往仍离不开(kāi)人(rén)工(gōng)遥(yáo)操(cāo)作(zuò)。很(hěn)多(duō)网(wǎng)友(you)也(yě)会(huì)质(zhì)疑(yí),既(jì)然(rán)还(hái)要(yào)人(rén)来(lái)操(cāo)作(zuò),那(nà)这(zhè)算(suàn)什(shén)么(me)智(zhì)能(néng)?什么时候才能真正摆脱遥操作?王闯:我们的机器人在工厂三小时的直播,全程都是机器人自主完成,后台没有任何人工干预。当然,我们也设计了兜底措施以应对极端情况。但兜底的措施并不完全依赖遥控操作。

遥控操作有两点价值:一是训练阶段对真实场景数据的要求。我们在训练环节,是需要操作数据,有一些场景需要数据驱动,需要人类教机器人怎么做,这个过程包括模仿学习和强化学习。越是精细复杂的任务,越需要更多的数据去训练。如组装类作业,仍需要真实场景中的操作数据,包括模仿学习和强化学习的过程。传感器数据的丰富度也会影响模型学习效果。

二是保障任务的稳定性。哪怕机器出错的概率只有万分之一,也不能让整条产线停摆,这个时候需要人远程遥控操作恢复。我们也想过,在某些商业场景里,遥控操作本身也有实际价值,比如在较为荒凉的地方开小卖部,以坐在办公室远程操控卖产品。

具身智能数据极度缺乏,包括触觉、深度识别

澎湃科技:经过半年的发展,机器人现在大脑和小脑成熟度分别怎么样?

王闯:我们小脑并没有用到大模型。现在我们机器人的小脑例如下肢的控制,我们用的强化学习都直接是端侧部署,并不依赖于云端的大模型。

另外,我们上肢系统也不依赖云端大模型。上肢“小脑”的运动规划也都在端侧完成。我认为目前大模型对机器人产业最大的赋能,主要体现在对环境的理解能力上。

让我惊艳的是多模态大模型的出现,它对现实世界中各种物体具备一定的理解能力,甚至有些它没见过的,也能分析。但现在大模型技术还不够成熟,机器人还做不到“看一眼就知道干什么”,也难以通过简单语言指令高效完成复杂任务。目前,带动作执行的大模型还没有出现,还没有形成既具泛化性又高成功率的通用方案。

王志勇:我认为一是模态,二是模型。

所谓模态即大模型就像人一样,有视觉、听觉、触觉、嗅觉等不同的感知能力。让具身智能有感知,传感器一定要足够多,尽可能多获取有3D深度的视觉、触觉、电子皮肤。

更关键的问题是,当模型拿到这些信息后,是否真的能驾驭好,做出好决策。有些国产车因为接收了更多模态的信息,导致内部的两套决策系统可能“打架”。比如拿到雷达信号,但没有实现有效融合,反而影响了最终判断。换句话说,模态信息越多,不一定是好事,关键是决策系统能否协同处理。

目(mù)前(qián),从(cóng)模(mó)型(xíng)角(jiǎo)度(dù)看(kàn),获(huò)得(de)具(jù)身(shēn)智(zhì)能(néng)相(xiāng)关数(shù)据(jù)仍(réng)有很大挑战。这不像自动驾驶那样相对成熟。现在连视觉都还只是初步应用,更别说触觉和其他感知,这些数据极度缺乏。

从算法技术路线来讲,其实也没有收敛。现在VLA(视觉语言动作)这条路上有好几家在(zài)探(tàn)索(suǒ),但(dàn)不(bù)像(xiàng)大(dà)模(mó)型(xíng)已(yǐ)形(xíng)成(chéng)共(gòng)识(shi)。所(suǒ)以(yǐ)有(yǒu)很多难点,路还比较长。

澎湃科技:好像多家都开始探索VLA模型路径,您能否给大家科普一下VLA模型到底是什么?

王志勇:VLA其实强调像人一样,从感知环境到自主决策并采取一定的行动。在自动驾驶领域已发展得相当不错,机器人本身VLA的模型能力还处于早期阶段。

王闯:VLA模型关键在于泛化性要求非常强。即使从未见过的场景,也能迅速做出正确的反应。它依赖大量数据构建基座能力,确保在千差万别的任务中也有成功率。

目前VLA模型的难点在于,行业内现在到底需要什么样的数据并没有形成共识,导致大家采集数据不一,此外数据量是否足够现在未有定论。这些新的数据会对VLA模型有什么影响,也暂时未知。另外从VLA模型效果来看,它与人类的泛化能力仍然有显著的差距,要实现强泛化、高成功率,这非常不容易。

还有一点必须考虑的是部署问题,模型不能无限大。真正落地时,也必须注重端侧运行能力,不能完全依赖云端。最好模型大小也是可控的,在端测功耗算力都可负担时,它最终价值才会非常大。

徐啸顺:在我们工厂环境中,质量和安全是首要考虑因素。但非专业用户很难理解模型的决策机制。这个行业里也一直在强调模型的可解释可信任可负责,包括自动驾驶也是要让模型达到可负责的程度才能完全交付。目前多模态VLA模型(视觉、语言、动作)技术尚未完全收敛,在现场部署中仍然存在一定风险。在现阶段,“能跑起来”已经很不错了,但要做到可信任可负责,可能还需要一段时间。

所以我个人认为,工业场景中更适合采用小模型或传统神经网络小模型去处理动作任务。而大模型要经历验证和完善,行业也需建立一整套评估和管理机制。

希望明年真正能做到客户直接签单

澎湃科技:这几天我注意到特斯拉在美国洛杉矶已经落地了一个无人化的服务场景,展望未来,如果我们以半年为单位来看,这类的场景会有在国内落地的可能性吗?半年之后又会有哪些变化或发展趋势? 

徐啸(xiào)顺(shùn):前(qián)不(bù)久(jiǔ),我(wǒ)们(men)也(yě)和(hé)智(zhì)元(yuán)机(jī)器(qì)人(rén)合(hé)作(zuò),做(zuò)了(le)一(yī)些(xiē)机(jī)器(qì)人(rén)的(de)场(chǎng)景(jǐng)测(cè)试(shì),比(bǐ)如(rú)用(yòng)户(hù)抽(chōu)盲(máng)盒(hé)、机(jī)器(qì)人(rén)递(dì)交(jiāo)盲(máng)盒(hé)。这(zhè)个(gè)动(dòng)作(zuò)本(běn)身(shēn)并(bìng)不(bù)复(fù)杂(zá),但(dàn)如(rú)果(guǒ)每(měi)台(tái)机(jī)器(qì)人(rén)都(dōu)能(néng)稳(wěn)定(dìng)地(de)重(zhòng)复(fù)执(zhí)行(xíng),就(jiù)具(jù)备(bèi)构(gòu)建(jiàn)“汽(qì)车(chē)餐(cān)厅(tīng)”这(zhè)类(lèi)场(chǎng)景(jǐng)的(de)基(jī)础(chǔ)。这(zhè)样(yàng)的(de)流(liú)程(chéng)可(kě)以(yǐ)被(bèi)拆(chāi)解(jiě)为(wèi)一(yī)系(xì)列(liè)可(kě)控(kòng)的(de)步(bù)骤(zhòu)。只(zhǐ)要(yào)产(chǎn)业(yè)各(gè)方(fāng)共(gòng)同(tóng)推(tuī)进(jìn),我(wǒ)相(xiāng)信(xìn)在(zài)中(zhōng)国(guó)类(lèi)似(shì)场(chǎng)景(jǐng)很(hěn)快(kuài)就(jiù)会(huì)实(shí)现(xiàn)落(luò)地(de)。

王(wáng)志(zhì)勇(yǒng):我(wǒ)不(bù)太(tài)好(hǎo)预(yù)测(cè)明(míng)年(nián)的进展,从更长远的角度来看问题,我们在场景上希望未来机器人能够走进家庭。

王闯:特斯拉一直擅长向公众传递信息,善于制造能抓住大家眼球的内容。我们看到它宣传最多的其实是机器人倒爆米花的场景,咖啡反而较少。而在今年WAIC智元机器人的展台上,我们也展示了多台机器人为观众递送可乐、饮料等互动体验。

我们希望明年,机器人能在服务场景、作业场景中展现给大家更多价值,比如提供一些吃的,或具备更复杂的作业能力。我们把2025年定义为商业化元年,很重要的任务是跟客户一起去思考哪些场景真正有价值,而不是只放演示,我希望明年客户看上了可以直接签单。