Why on-device agentic AI can't keep up
a day ago
- 本地设备端AI提供隐私保护、零延迟和无API成本,但对于大多数消费设备来说基本上不切实际。
- 消费硬件面临内存限制,通常为8-16GB,操作系统和应用程序占用后,留给AI模型的只有4-8GB。
- 一个能力强大的70亿参数模型需要约5GB,但代理式任务还需要大型KV缓存,很快会超过8GB内存。
- 即使是小型代理式任务也需要至少32K token的上下文,仅设备端AI就需要约16GB内存。
- 内存价格上涨以及与数据中心HBM的竞争加剧了消费设备的内存可用性问题。
- 设备端推理速度随上下文长度急剧下降,例如在桌面GPU上,上下文为16K时,速度从100 token/秒降至不到10 token/秒。
- 电池和发热问题使得在手机上持续使用设备端代理式AI变得不切实际。
- 云端推理避免了这些限制,但需要巨大的数据中心容量来支持数十亿设备。
- 在没有重大硬件或架构突破的情况下,消费设备上的实用代理式AI仍需数年时间。