DeepMind机器人打乒乓球,正手、反手溜到飞起,全胜人类初学者

巴黎奥运会正在如火如荼地进行中,乒乓球项目备受关注。与此同时,机器人打乒乓球也取得了新突破。

刚刚,DeepMind 提出了第一个在竞技乒乓球比赛中达到人类业余选手水平的学习型机器人智能体。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

论文地址:https://arxiv.org/pdf/2408.03906

DeepMind 这个机器人打乒乓球什么水平呢?大概和人类业余选手不相上下:

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

正手反手都会:

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

对手采用多种打法,该机器人也能招架得住:

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

接不同旋转的发球:

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

不过,比赛激烈程度似乎不如公园老大爷对战。

对机器人来说,乒乓球运动需要掌握复杂的低水平技能和策略性玩法,需要长期训练。DeepMind 认为战略上次优但可以熟练地执行低水平技能可能是更好的选择。这使乒乓球与国际象棋、围棋等纯粹的战略游戏区分开来。

因此,乒乓球是提升机器人能力的一个有价值的基准,包括高速运动、实时精确和战略决策、系统设计以及与人类对手直接竞争。

对于这一点,Google DeepMind 首席科学家称赞道:「乒乓球机器人将有助于我们解决高速控制和感知问题。」

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

该研究进行了 29 场机器人与人类的乒乓球比赛,其中机器人获胜 45% (13/29)。所有人类选手都是机器人未见过的玩家,从初学者到锦标赛选手能力不等。

虽然该机器人输掉了所有与最高级别玩家的比赛,但它赢得了 100% 的与初学者的比赛,在与中级选手的对战中赢得了 55% 的比赛,展现出人类业余选手的水平。

总的来说,该研究的贡献包括:

提出一个分层和模块化的策略架构,其中包括:

低级控制器及其详细的技能描述器,这些描述器对智能体的能力进行建模并有助于弥合模拟与真实的差距;

选择低级技能的高级控制器。

实现零样本模拟到真实的技术,包括定义基于现实世界的任务分布的迭代方法,并定义自动课程(automatic curriculum)。

实时适应未见过的对手。

方法介绍

该智能体由一个低级技能库和一个高级控制器组成。低级技能库专注于乒乓球的某个特定方面,例如正手上旋球、反手瞄准或正手发球。除了包含训练策略,该研究还在线下和线上收集和存储有关每个低级技能的优势、劣势和局限性的信息。而负责协调低级技能的高级控制器会根据当前游戏统计数据、技能描述选择最佳技能。

此外,该研究还收集了少量的人类和人类对打的比赛数据,作为初始任务条件的种子,数据集包括位置、速度和旋转的信息。然后使用强化学习在模拟环境中训练智能体, 并采用一些现有技术,将策略无缝部署到真实硬件中。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

该智能体与人类一起对打以生成更多训练数据,随着机器人的持续学习,游戏标准变得越来越复杂,以此让智能体学习越来越复杂的动作。这种混合的「模拟 - 现实」循环创建了一个自动教学,使机器人的技能随着时间的推移不断提高。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

分层控制

分层控制主要包含以下部分:

乒乓球打法:高级控制器(HLC,high-level controller)首先决定使用哪种打法(正手还是反手);

调整:根据与对手比赛中的统计数据,在线维护每个 HLC 的偏好(H 值);

选择最有效的技能:HLC 根据调整后的 H 值对入围的 LLC 进行抽样;

更新:H 值和对手统计数据会持续更新,直至比赛结束。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

结果

研究者将该智能体与 29 名不同水平的乒乓选手进行了对比,选手包括初学者、中级、高级和高级 + 技能。人类选手按照标准乒乓球规则与机器人进行了三场比赛,但由于机器人无法发球,因此规则稍作修改。

面对所有对手,机器人赢得了 45% 的比赛(match)和 46% 的单局胜利(game)。按照技能水平细分,机器人赢得了与初学者的所有比赛,输掉了与高级和高级 + 选手的所有比赛,赢得了 55% 与中级选手的比赛。这表明该智能体在乒乓球回合中达到了中级人类选手的水平。

机器人打不过高级玩家的原因在于物理和技术的限制,包括反应速度,相机感应能力,旋转处理等,这是很难在模拟环境中准确建模的。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

与机器人对打,也很吸引人

研究参与者表示,他们非常享受与机器人一起对打,并在「有趣」和「吸引人」方面给予了机器人很高的评价。他们也一致表示「非常愿意」再次与机器人对打。在自由时间里,他们平均在 5 分钟的时间里与机器人玩了 4 分 06 秒。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

机器人不擅长下旋球

技能最好的参与者提到,机器人不擅长处理下旋。为了测试这一观察结果,研究人员根据球的旋转绘制了机器人的着陆率,根据结果可以看到,机器人在面对更多的下旋球时,着陆率大幅下降。这一缺陷部分是由于机器人在处理低球时,为了避免与桌子碰撞导致的,其次是实时确定球的旋转确实很难。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

参考链接:

https://sites.google.com/view/competitive-robot-table-tennis/home?utm_source&utm_medium&utm_campaign&utm_content&pli=1

本文来自微信公众号“机器之心”,36氪经授权发布。

DeepMind用AI机器人打乒乓球,战胜真人中等选手机率达55%

在机器人领域,运动技能一直是衡量机器人能力的重要试金石。

近日,谷歌 DeepMind 研究团队在乒乓球运动中取得了新进展,他们开发出了一个人工智能(AI)驱动的机械臂,能够与业余人类乒乓球选手打得有来有回。

这项研究成果的相关论文已经以预印本的形式发表。研究团队称,“这是第一个能够在人类水平上与人类进行体育运动的机器人智能体,代表了机器人学习和控制领域的一个里程碑。”

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

(来源:DeepMind)

DeepMind 的这个系统结合了 ABB 公司的 IRB 1100 工业机器人(手臂)和定制的 AI 软件。

这套系统的物理设置包括一个 6 自由度的机械手臂,安装在两条线性轨道上,使其能够自由地水平移动。还用到了高速摄像机,以用于追踪球的位置,而动作捕捉系统则能监测人类对手的球拍动作。

为了创造驱动机器人手臂的“大脑”,DeepMind 研究人员开发了一种“双层级”方法,使机器人能够打出特定的乒乓球技术,同时实时调整策略以适应每个对手的打法风格。

这种方法使得机器人无需针对每个特定玩家进行训练,就能与任何业余人类选手进行比赛。

该系统的架构结合了低级技能控制器(经过训练可执行特定乒乓球技术的神经网络策略,如正手击球、反手回球或发球回应)和高级战略决策者(一个更复杂的 AI 系统,用于分析对局状态,适应对手的风格,并选择为每个来球激活哪个低级技能策略)。

研究人员采用了一种混合方法来训练 AI 模型,在模拟物理环境中使用强化学习,同时将训练数据建立在真实世界的例子基础上。这种技术使机器人能够从大约 17500 个真实世界的乒乓球轨迹中学习。

不过,对于如此复杂的任务来说,这只是一个相对较小的数据集。

研究团队使用了一个迭代过程来完善机器人的技能。他们首先从一个小型的人类对人类的游戏数据集开始,然后让 AI 与真实对手对抗。

每场比赛都会产生关于乒乓球轨迹和人类策略的新数据,研究团队将这些数据反馈到模拟中进行进一步训练。这个过程重复了七个周期,使机器人能够不断适应水平越来越高的对手和多样化的打法风格。

到最后一轮,AI 已经从超过 14000 个回合球和 3000 个发球中学习,创建了一个乒乓球知识体系,帮助它缩小模拟和现实之间的差距。

乒乓球器比赛 DeepMind机器人打乒乓球,正手,反手溜到飞起,全胜人类初学者

(来源:DeepMind)

值得注意的是,英伟达也在进行类似的模拟物理系统实验,比如该公司的 AI 智能体 Eureka,允许 AI 模型在模拟空间而不是现实世界中快速学习控制机器人手臂。

这种方法可能会在未来大大减少训练机器人进行复杂交互所需的时间和资源。

在一项涉及 29 名参与者的研究中,这个 AI 驱动的机器人赢得了 45% 的比赛,展示了不错的业余水平实力。

值得注意的是,它对初学者取得了 100% 的胜率,对中等选手取得了 55% 的胜率,只是在面对资深对手时表现不佳。

有趣的是,即使输给机器人的玩家也表示自己很享受这种体验。研究人员指出:“在所有技能组和胜率中,玩家都认同与机器人对打是有趣的和吸引人的。” 这种积极的反应表明 AI 在体育训练和娱乐方面有着广泛的应用前景。

该系统并非没有局限性。它难以处理极快的球或高球,难以识别强烈的旋转,并且在反手球方面表现薄弱。谷歌 DeepMind 分享了一段视频,展示了机器人因难以应对快速击球而输掉一分。

研究人员指出:“为了解决阻碍机器人对快球反应时间的延迟限制,我们建议研究先进的控制算法和硬件优化。这可能包括探索预测模型来预测球的轨迹,或者在机器人的传感器和执行器之间采用更快的通信协议。”

除了打乒乓球,为这个项目开发的技术可以应用于更广泛的机器人任务,这些任务需要快速反应和适应不可预测的人类行为。从制造业到医疗保健,潜在的应用似乎很广泛。

谷歌 DeepMind 团队强调,通过进一步完善,他们相信该系统未来可能有潜力与资深乒乓球选手竞争。

DeepMind 在创造能够击败人类游戏玩家的 AI 模型方面并不陌生,包括 AlphaZero 和 AlphaGo。有了这个最新的机器人智能体,看来这家研究公司正在从游戏转向真正的运动。

围棋、国际象棋和许多电子游戏的顶尖选手已经败给了 AI,也许乒乓球将是下一个。

参考资料:

https://arstechnica.com/information-technology/2024/08/man-vs-machine-deepminds-new-robot-serves-up-a-table-tennis-triumph/

https://techcrunch.com/2024/08/08/google-deepmind-develops-a-solidly-amateur-table-tennis-robot/

运营/排版:何晨龙

相关问答

2008奥运会 乒乓球 他们用的什么球? - 188****4112 的回答 - 懂得

奥运会乒乓球用球主要有这几种:A。红双喜B。双鱼C。蝴蝶D。斯蒂卡乒乓球的最高质量球为三星球(6元一个),而奥运会正是用的双鱼三星球。但也有特制...

乒乓球 训练 训练要领?

“练武不练功,到老一场空”,乒乓球也是一样的,要想暴冲弧圈有足够的杀伤力,必须要进行科学、系统的力量训练。有四种乒乓球力量专项训练,可以使...“练武...

乒乓球 训练 怎么练习?

乒乓球训练器一般分为好几种。一种是比较常见的发球机,就是固定在球台的另一端,模拟对方有一个教练给你发各种旋转和各种速度以及各种线路的球出来。接受训练...

乒乓球 博物馆观后感?

座落在上海黄浦江西岸世博园区内的国际乒联博物馆和中国乒乓球博物馆(以下简称“乒博馆”),是首座落户上海的国际唯一性、永久性社会公共体育文化机构。15000...

求解释啊,捡 乒乓球器 的制作方法?

1、首先我们可以先用剪刀把饮料瓶的上部剪掉,将矿泉水瓶的瓶底剪掉,在瓶底部分把瓶壁剪成3厘米的片片条状,接着在矿泉水瓶口下放剪一个乒乓球可以滚出来的洞,...

乒乓球 可以做成哪些有趣的科技小制作?

制作地球仪。首先拿一个乒乓球,画上必要的经线和纬线,比如赤道,30、60度南北纬,极点、本初子午线和180经线等等。画好了地球仪的球,还要在两极极点上扎个...

悬挂式 乒乓球 训练 坏了怎么修?

简单的小毛病的话,可以自己按说明书修理一下,如果比较复杂,建议还是找购买的店家或者是商家,让他们给售后修理。也可以在此期间进行别的锻炼方式进行健身,还...

乒乓球 发球 怎么样值得购买吗?

值得。因为乒乓球是聪明人的运动,同理心是必须有的。在乒乓球运动中,大家乐趣各不相同。购买乒乓球发球器,亦是如此,有的球友是为了居家锻炼,有的是为了调...

乒乓球 的打磨 有什么用?

乒乓球的打磨器能使球旋转起来。乒乓球的打磨器能使球旋转起来。

打乒乓球 器械 力量训练哪个更减脂? - 懂得

很多人认为乒乓球不是连续的高强度运动。每次击球后都会击球。这是一种低强度的有氧运动,不利于减肥。事实上,这是因为乒乓球的基本技能不正确,导致...

标签列表