和小伙伴@扛把子魔王一起搞了将近一个月的基于强化学习的ygo agent的研究,过程中也烧了将近2000刀订阅的token,胜率打基于规则的winbot也到了60%,但始终很难解决泛化问题,长程任务奖励的信用分配问题也很难,导致一直在和一些奇奇怪怪的任务较劲,比如模型会反复攻击-取消-攻击-取消直到超时等等。
也参考github上开源的ygo agent的研究以及konami写的日文masterduel论文,但说实话,上限都不高,也就是勉强强于基于规则的winbot水平。
今天偶然试了下,直接接入gpt6-astra,把ygo规则卡牌效果直接喂给他让他直出和winbot打闪刀内战,这是第一次尝试,自然也不可能有任何后训练,本来只想着能证明下llm打牌是更好的方向,之后打算拿qwen做下rl后训练。
但没想到第一次就震惊到我了,下面发全流程和录像。
也参考github上开源的ygo agent的研究以及konami写的日文masterduel论文,但说实话,上限都不高,也就是勉强强于基于规则的winbot水平。
今天偶然试了下,直接接入gpt6-astra,把ygo规则卡牌效果直接喂给他让他直出和winbot打闪刀内战,这是第一次尝试,自然也不可能有任何后训练,本来只想着能证明下llm打牌是更好的方向,之后打算拿qwen做下rl后训练。
但没想到第一次就震惊到我了,下面发全流程和录像。















