AI Measurement Sciencea day agobenchmarkingmeasurement scienceAI evaluationhttps://aimslab.stanford.edu/textbook/Copy LinkAI系统的决策依赖于推理、规划和安全的测量,但测量质量很少受到检验。本书将评估视为一个推理问题:从观察到的响应中估计潜在属性。它涵盖了效度、数据结构、概率模型(IRT、Bradley-Terry)、估计、信度、效率、泛化性和策略设计。目标读者包括具有概率、统计和机器学习背景的研究人员、从业者和学生。目标是从临时基准测试转向基于坚实科学的原理性测量。