Hasty Briefsbeta

双语

MicroLLM Lab – Try 7 tiny LLM's in the browser

4 hours ago
  • 使用客观检查(正则/精确标记),而非写作质量。
  • 允许135M模型失败——这就是衡量标准。
  • 选择模型,然后运行。如果有上一次的令牌/秒数据,则使用它进行估算。
  • 每次测试的运行时间(毫秒)、每次测试的准确率、速度(持续解码的令牌/秒,套件总时间)以及准确率(客观测试的通过率),均来自此浏览器中的运行。
  • 数据保留在此机器上。图表使用每个模型的最新套件。
  • 生成并下载可验证的性能证书,包含设备硬件、峰值和持续令牌/秒,并分享您的得分。
  • 用JavaScript编写基准测试:编辑器在此源中被eval()执行,然后每个检查作用于模型的输出。