Hasty Briefsbeta

双语

Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

4 hours ago
  • 缩放定律表明,拥有更多数据的更大语言模型能力更强,而混合专家(MoE)架构每个令牌仅激活大型存储参数库的一小部分。
  • 部署的模型会遇到训练集中没有的实时数据;传统模型由于权重冻结而无法从中学习,转而依赖基于提示的检索或指令。
  • 提出的无限参数大语言模型使用紧凑的超网络从实时数据生成共享基础网络的低秩调制,从而实现权重生成而非固定存储。
  • 超网络潜在代码上的贝叶斯信念在线更新,使得有效权重在会话期间演化,而不是在一次读取后固定不变。
  • 将知识存储在权重中而非提示中,可以分摊计算成本,释放上下文窗口,跨轮次持久化,并且比上下文学习具有更好的泛化能力。
  • 指定了评估协议,以测试模型与上下文学习和检索方法的对比。