Hasty Briefsbeta

双语

Can a MUD evaluate LLMs? A $99 proof of concept

5 hours ago
  • CrucibleBench在一个持久化的MUD文本世界中,通过50个回合评估语言模型,并隐藏社交目标。
  • 它采用‘枯竭技术的横向思维’——应用成熟、低成本的技术(MUD)来衡量AI行为。
  • 关键约束包括可枚举的动作空间、来自具有信任/怀疑状态的NPC的明确社交反馈,以及运行内的持久性。
  • 核心发现:一个LLM评判组件可以重新排序排行榜多达六个位置,而聚合可靠性统计却保持沉默。
  • 三种算法检测到的故障模式是对话循环、错误房间交互和探索瘫痪。
  • 这项工作是一个概念验证,不是经过验证的社交智能衡量标准或确定的排行榜。
  • 第二阶段旨在构建一个校准基准;贡献可以资助、构建或安装它。