Wolfram LLM Benchmarking Project
2 days ago
- 沃尔夫拉姆大语言模型基准测试项目专注于通过使用沃尔夫拉姆语言来评估大语言模型(LLMs)在代码生成任务上的表现。
- 该任务将英文语言规范转换为沃尔夫拉姆语言代码,基于《沃尔夫拉姆语言初阶介绍》中的练习题。
- 项目利用工具评估功能正确性,测试案例此前已由数百万人在线完成。
- 结果及先前版本可通过沃尔夫拉姆数据仓库以可计算形式访问。
- 对于大语言模型开发者,沃尔夫拉姆提供数据集、工具访问权限,以及将LLM纳入基准测试的机会。