游戏王masterduel吧 关注:202,018贴子:9,355,310

核弹爆炸震惊瘫坐,原来LLM打牌已经强大了这等程度

只看楼主收藏回复

和小伙伴@扛把子魔王一起搞了将近一个月的基于强化学习的ygo agent的研究,过程中也烧了将近2000刀订阅的token,胜率打基于规则的winbot也到了60%,但始终很难解决泛化问题,长程任务奖励的信用分配问题也很难,导致一直在和一些奇奇怪怪的任务较劲,比如模型会反复攻击-取消-攻击-取消直到超时等等。
也参考github上开源的ygo agent的研究以及konami写的日文masterduel论文,但说实话,上限都不高,也就是勉强强于基于规则的winbot水平。
今天偶然试了下,直接接入gpt6-astra,把ygo规则卡牌效果直接喂给他让他直出和winbot打闪刀内战,这是第一次尝试,自然也不可能有任何后训练,本来只想着能证明下llm打牌是更好的方向,之后打算拿qwen做下rl后训练。
但没想到第一次就震惊到我了,下面发全流程和录像。


IP属地:北京1楼2026-09-10 21:03回复


    IP属地:北京来自Android客户端3楼2026-09-10 21:13
    回复
      2026-09-15 03:59:08
      广告
      不感兴趣
      开通SVIP免广告
      可以看到,gpt6在没有任何后训练和针对ygo的rl训练的前提下,自发的学会了ygo核心的规则和闪刀的技巧(我用的是老构筑,因为winbot只会这个)。
      包括对面丢g了,我方尽量不要特招。对面回合闪刀变火刀回交闪,墓地凑三魔。
      跳楼机送抓锚抓的怪,空出主要区,然后获得不能连锁的效果后再用抓锚抓对面零一解决对面。
      虎鲨拿对面灰拼水机出魔皇后出访问,其中一些很细节的链接箭头的问题也有考虑掉。
      思维链同时还考虑了如果水机被无效主区还是空着可以更优从而改变了策略。
      每一步行动都有完整的reason,真的就和人打牌一样,我们在用类似alphago类的强化学习中很难解决问题,在llm这边天然都不存在了,就是速度有点满,一局5回合打了50分钟,烧了我200刀额度的10%。


      IP属地:北京4楼2026-09-10 21:13
      收起回复
        mark,这块credit assignment我感觉非常难。实际上,我们手牌一坨,后手没有康,就会直接投降的,而bot感觉很难学到。另外想知道先后手的影响是什么什么


        IP属地:北京来自Android客户端5楼2026-09-10 21:17
        收起回复
          上面的是总结的对局流程,下面是实际模型每步看到的信息,包含了场面上的信息,可选的合法行动列表等等,以及选择的reason等等。
          也能看到prompt就是喂了ygo的规则和卡牌效果,不过我还是很难完全相信,gpt6是只靠这些前置信息就学会了并完美掌握了这么多闪刀的技巧,也可能之前有人教过被openai拿去训练了。



          IP属地:北京6楼2026-09-10 21:28
          回复
            之前搞了几周已经上千commit也训了几百个GPU时的项目基本就直接废了,当时项目里还有些遗产能复用。
            后面打算尝试用qwen27B做RL后训练试试了,不知道国模在本地能否达到类似的效果,
            不过至少指明了一条方向,llm+思维链,天然就更适合ygo这种纯文字的游戏,
            alphago/katago/muzero这条路线其实对文字类的语言游戏不太适合,虽然我们也尝试了很多把卡牌效果做embedding等尝试,但embedding不等于可解释,模型也不能天然理解卡牌的规则,所以一切只能建立在终局的奖励或者MCTS的搜索训出来的V,Q上。


            IP属地:北京8楼2026-09-10 21:33
            回复
              不明觉厉 大佬牛逼


              IP属地:湖南来自Android客户端9楼2026-09-10 21:47
              回复
                录像链接如下:https://www.bilibili.com/video/BV1K6YM69Eyv/?spm_id_from=333.1387.homepage.video_card.click&vd_source=9cfc116002196afa8d307b3339cc40fb
                感觉还不能说完美,但第一次裸出效果就是这样,再做一些agent工程以及让他自己总结一些prompt,应该对实力还会有进步。关键就是,人可以用可解释的语言去和agent沟通了,这点比传统的强化学习一直为一些莫名其妙的奖励费劲不知道强了多少


                IP属地:北京10楼2026-09-10 21:48
                回复
                  2026-09-15 03:53:08
                  广告
                  不感兴趣
                  开通SVIP免广告
                  这一个月ai在数学界已经爆中爆了。


                  IP属地:广东来自Android客户端11楼2026-09-10 21:59
                  回复
                    牛逼


                    IP属地:广东来自Android客户端12楼2026-09-10 22:08
                    回复
                      以前我还觉得是不是要把实战数据喂给ai,给他讲解思路,才能让他慢慢会打牌,像人一样有一个学习的过程,原来现在只要模型智商够高就行了吗


                      IP属地:广东13楼2026-09-10 22:33
                      收起回复
                        问了下第3回合为啥要浪费风刀再出火刀的问题,结果被gpt教育了,不过gpt连这种细节都能注意到,我确实看的时候还有点奇怪


                        IP属地:北京14楼2026-09-10 22:42
                        回复
                          确实很厉害,但游戏王是个先7后3的游戏,最强ai加最强卡组没拿到先手我展开了也得给我跪下


                          IP属地:德国来自iPhone客户端15楼2026-09-10 22:51
                          收起回复
                            隔壁早就用ai玩宝可梦了,只要能读懂规则思考量能比得上围棋吗


                            IP属地:江苏来自Android客户端16楼2026-09-10 23:05
                            收起回复
                              2026-09-15 03:47:08
                              广告
                              不感兴趣
                              开通SVIP免广告
                              gpt6是这样的,老黄说agi已来也是,个人这里也是各种实操任务zero shot完成,除了效率和烧token基本完美明年这个时候说不定实时决斗ai就已经solved了


                              IP属地:北京来自Android客户端17楼2026-09-10 23:19
                              收起回复