Hasty Briefsbeta

双语

Turning GLM-5.3-Flash into a Jev-like decision model

11 hours ago
  • 该技术通过单次前向传播获取带概率的类型化决策,无需微调,将现成的大语言模型(GLM-5.3-Flash)转化为类似Jev的决策模型。
  • 关键步骤:对选项进行编号,用'choice_index:'预填充答案,然后使用vLLM的logprob_token_ids读取选项令牌的对数概率,而不是生成完整的JSON。
  • 在29个公开数据集上的评估表明,GLM-5.3-Flash在准确率上与Jev相当(中位数差距0.7个百分点,无统计显著性),且优于Laya。
  • 速度:每次决策约180-300毫秒(取决于客户端位置);成本:GLM-5.3-Flash每百万次决策约62欧元,Jev约16欧元。
  • GLM-5.3-Flash支持对图像(如扫描文档)进行类型化决策,在RVL-CDIP上达到70.2%的准确率,而Jev和Laya无法处理。
  • 局限性包括:每个请求最多128个logprob令牌(超过128个选项需要两次请求),以及最多191个单令牌选项索引;重命名选项对GLM-5.3-Flash的影响大于其他模型。
  • 开源库和基准测试可用;通过Privatemode的机密计算可保护决策。