MicroLLM Lab – Try 7 tiny LLM's in the browser
4 hours ago
- 使用客观检查(正则/精确标记),而非写作质量。
- 允许135M模型失败——这就是衡量标准。
- 选择模型,然后运行。如果有上一次的令牌/秒数据,则使用它进行估算。
- 每次测试的运行时间(毫秒)、每次测试的准确率、速度(持续解码的令牌/秒,套件总时间)以及准确率(客观测试的通过率),均来自此浏览器中的运行。
- 数据保留在此机器上。图表使用每个模型的最新套件。
- 生成并下载可验证的性能证书,包含设备硬件、峰值和持续令牌/秒,并分享您的得分。
- 用JavaScript编写基准测试:编辑器在此源中被eval()执行,然后每个检查作用于模型的输出。