Hasty Briefsbeta

双语

OpenJev

6 hours ago
  • 直接读取从选择logits计算概率,仅对提供的选项进行归一化,而不进行解码。
  • 该工具提供一个本地实时实验,模型可以读取概率或逐token生成JSON概率。
  • 选择模型大小(例如低端设备上的MiniCPM5 2B或Qwen3 0.6B),并在自己的硬件上运行两种方法进行比较。
  • 附带的模型准确率表显示了Qwen3 0.6B、MiniCPM5 2B和Qwen3.5 4B的统计数据,包括创作(平衡准确率)、扰动和TypeSafe(大小写一致性)指标。
  • 权重从Hugging Face加载并驻留在浏览器缓存中;输入数据永远不会离开页面,但首次加载可能需要几分钟,具体取决于模型、网络和GPU。
  • 决策过程对两条路径使用相同的输入:一条直接读取概率,另一条要求生成JSON文本。
  • 02A部分解释了直接读取仅对显示的选项进行归一化,并且不是校准的置信度。
  • 02B部分详细介绍了生成路径,要求模型输出其估计的分布作为JSON。
  • 方法在同一模型上顺序运行以避免GPU争用;先运行直接读取,然后运行生成。
  • 使用performance.now()测量设置、预热、提示准备、直接执行和生成的时间——没有预设结果。
  • 演示使用通过wllama量化的GGUF权重,这可能会影响质量和速度;手机模型以准确度换取体积,4B选项需要更多内存。