JevBench, a reproducible benchmark for typed decision models
5 hours ago
- 该表格对48个模型在多个性能指标(第1至第5列)上进行了排名。
- Jev 1.13.0 是整体排名最高的模型,在第一列中获得74.4分。
- 许多模型的排名与其JevBench得分存在差异,表明在不同任务上性能有所变化。
- 表现最差的模型,如Certo v1、Alibaba GTE Reranker ModernBERT-base和BAAI bge-reranker-v2-m3,得分接近于零。
- 这些模型在规模和类型上差异很大,从kev 0.5B这样的小模型到SimpleJev Qwen3.6-35B-A3B这样的大模型。