Thinking Machines and interaction models
3 hours ago
- Thinking Machines发布了交互模型,一种全双工语音模型,能够以微回合的方式收听和发言,从而实现自然的打断。
- 该模型通过工具调用将复杂的推理任务委托给更智能的后台模型,从而在保持智能的同时实现快速对话。
- 它整合了视频输入来读取面部表情,使对话更加人性化。
- 该模型显著扩大规模(活跃参数是Moshi的2倍,总参数是其40倍),从而实现了多模态能力。
- 文章指出,虽然某些功能并非全新,但规模和视频整合是真正的进步。