Hasty Briefsbeta

双语

AI Measurement Science

a day ago
  • AI系统的决策依赖于推理、规划和安全的测量,但测量质量很少受到检验。
  • 本书将评估视为一个推理问题:从观察到的响应中估计潜在属性。
  • 它涵盖了效度、数据结构、概率模型(IRT、Bradley-Terry)、估计、信度、效率、泛化性和策略设计。
  • 目标读者包括具有概率、统计和机器学习背景的研究人员、从业者和学生。
  • 目标是从临时基准测试转向基于坚实科学的原理性测量。