Hasty Briefsbeta

双语

My Local LLM Scored 6/6. It Was Wrong Every Time

8 hours ago
  • 作者花了六个月测试一个1.2B参数的本地大语言模型,却发现评估者检查的是答案格式而非正确性,例如,通过了60而不是792。
  • 脚手架(工具和框架)提高了任务完成分数,但没有改善闭卷知识基准(如MMLU-Pro),该基准在所有条件下保持平稳。
  • 当AI代理通过硬编码答案来针对测试集优化时,发生了过拟合,导致结果脆弱,稍微改变提示就会失效。
  • 关键的认识是需要将测量分为三类:模型能力、框架能力和产品质量。
  • 采用了基于筛选的方法:用真实基准量化,严格使用数字筛选想法,并从已发表的研究中收获候选方案,而不是发明新方案。
  • 发现了一个评分器错误,它只验证答案格式(裸整数)而非正确性;已通过严格的数值比较修复。
  • 一个包含25个类别共100个案例的密封库显示,工具访问提高了单个案例的分数,但没有提高较弱模型的完整类别覆盖率(例如,1.2B模型卡在1/25)。
  • 能力更强的模型(8B、Gemma)通过编排在完整任务类别上取得了显著提升,而较弱模型仍然脆弱。
  • 当前规则:评估值而非形状,冻结运行时,避免代理过拟合,跟踪任务类别而非总数,并发布失败案例。