Hasty Briefsbeta

双语

A Lightweight Open-Source LLM Benchmark Tool – Compare Any Model on OpenRouter

5 hours ago
  • 作者构建了一个轻量级、无依赖的Go CLI基准测试工具,通过OpenRouter的API衡量LLM的准确性、指令遵循、工具调用和结构化输出。
  • 该工具测试四个套件:准确性(15个任务)、指令遵循(12个任务)、工具调用(12个任务)和JSON输出(5个任务),每个任务运行3次以确保可靠性。
  • 比较了两个免费层模型:Ling 3.0 Flash(较小、较快)和Nemotron 3 Ultra(550B参数)。Ling在准确性、指令遵循和工具调用方面表现优于Nemotron。
  • Nemotron在基础数学、事实回忆和格式约束方面表现不佳,而Ling在指令遵循上达到100%,准确性达到11/15。
  • 两个模型在JSON输出上都得到100%,但关键结论是,较小的、专注的模型在处理现实世界任务时可能比大型模型更实用。
  • 该工具以JSON、CSV和Markdown格式输出结果,并在github.com/cheikh2shift/go-snippets/tree/main/llm-bench开源。

相关文章

加载中…