Show HN: A 6M-token movable window on a single 46GB GPU
2 days ago
- 一种新颖的方法冻结了语言模型,并在其旁边建立了一个持久化的已验证解决方案记忆,避免了重新训练。
- 一旦一个问题家族被解决并独立验证,每个新实例都可以用零生成令牌、比特精确且确定性地回答。
- 在跨越9个问题家族和4种架构的180个实例中,该系统以每个答案零令牌实现了180/180的准确率。
- 记忆选择耗时1.4微秒,完整重用则在36毫瓦时下于6-23毫秒内完成,精确寻址消除了错误(0错误,而近似检索为94.3%)。
- 该存储作为工作上下文,在单个46GB GPU上可容纳多达600万个令牌,超越了vLLM和SGLang等引擎的限制。
- 前沿模型在原始推理上表现更优,但对于已验证的问题家族,验证重用每次消耗零令牌并返回相同的比特,扭转了比较结果。