Hasty Briefsbeta

双语

Teaching a World Model to Play Pokemon

6 hours ago
  • 作者训练了一个基于JEPA的世界模型(LeWorldModel),使用《宝可梦红》的截图来规划选择初始宝可梦的按键序列。
  • 世界模型从观察中学习状态转换动态,无需奖励;模型预测未来的嵌入而非原始截图。
  • 为防止潜在崩溃(所有嵌入变得相同),SIGReg正则化鼓励嵌入类似于各向同性高斯分布。
  • 训练数据包括42,382个灰度帧,分为1,009条短轨迹,包含清晰和噪声路径。
  • 规划使用来自14步展开的预测嵌入和交叉熵方法(CEM)来搜索最小化与目标嵌入距离的序列。
  • 初始规划因预测误差累积而失败;展开微调(在自身预测上训练预测器)提高了性能。
  • 微调后,模型在Oak's Lab中从保存状态选择初始宝可梦(杰尼龟)的成功率达到52%,而随机动作的成功率为0%。
  • 最终模型约有1250万个参数,从头开始端到端训练,并且由于难度指数级增长,仍然仅限于短任务。