Hasty Briefsbeta

双语

Letting Claude Play Text Adventures

17 hours ago
  • 参加了一个专注于认知架构(Soar、ACT-R)的AI黑客马拉松,用于搭建LLM的脚手架。
  • 选择文字冒险游戏(特别是《Anchorhead》)作为评估智能体性能的长时域任务。
  • 为dfrotz Z-machine解释器编写了一个Python封装,用于控制游戏。
  • 实现了一个保持完整游戏历史的“简单”测试框架,但代价是令牌消耗过高。
  • 测试了一个记忆框架(最近5回合+通过工具使用的语义记忆),减少了令牌,但导致智能体无效漫游。
  • 尝试了更小的生成游戏(如密室逃脱、抢劫),但发现它们过于线性且无趣。
  • 确定了未来改进方向:领域特定记忆、自动/手动地理追踪以及情景记忆摘要。