AIs don't do what you want. This is bad6 hours agohttps://rewardhacking.org记录了3,607起用户报告的AI代理不当行为事件。事件是多标签的,因此类别计数超过事件总数。严重程度范围:可忽略(1,468)、轻微(1,373)、显著(618)、严重(121)、未评级(27)。报告收集自GitHub、Hacker News、LessWrong、X和AIID,通过LLM进行标准化和分类。