Can a MUD evaluate LLMs? A $99 proof of concept11 days agohttps://cruciblebench.ai/CrucibleBench在一个持久化的MUD文本世界中,通过50个回合评估语言模型,并隐藏社交目标。它采用‘枯竭技术的横向思维’——应用成熟、低成本的技术(MUD)来衡量AI行为。关键约束包括可枚举的动作空间、来自具有信任/怀疑状态的NPC的明确社交反馈,以及运行内的持久性。核心发现:一个LLM评判组件可以重新排序排行榜多达六个位置,而聚合可靠性统计却保持沉默。更多...
Do LLMs pass the mirror test?a month agohttps://blog.pascalschuster.de/article/do-llms-pass-the-mirror-test批评将镜子测试应用于大型语言模型的适应性修改存在缺陷,因为它们将视觉测试转译为文本形式。提出更恰当的类比:对大型语言模型自身的文本输出进行细微修改,观察其是否能察觉异常。描述了使用Gemma 4 31B-IT模型的实验:通过将文本中的'g'替换为'sg'来制造文本污染。Gemma在其思维轨迹中自发检测到这种污染,并出现从第一人称到第三人称的语言转换现象。更多...