13 hours ago
- 作者强烈希望本地模型在编程代理的实际应用中能与托管API竞争,但目前的使用体验零散且过于复杂。
- 关键痛点:本地模型设置需要大量选择(推理引擎、模型、量化、模板、上下文大小)和配置调整,经常导致结果不佳或功能失效。
- 工具参数流式传输是本地模型缺失的关键功能——没有它,用户会面临长时间的连接中断,无法实时查看工具调用,也无法提前中断操作。
- 本地技术栈分散在多个引擎(llama.cpp、Ollama、LM Studio等)中,导致用户需要处理一系列影响行为且难以预测的小决策。
- 行业进展过快,专注于让每个新模型运行起来,而不是精雕细琢一个模型和栈;托管提供商不发布原始权重,期望用户自行解决其余问题。
- 作者提议选择一个优胜者(DeepSeek V4 Flash),并通过一个名为ds4.c的窄模型专用推理引擎对其进行全面优化,该引擎专为128GB以上内存的Mac设计。
- ds4.c是一个完整的包:包含Metal路径、模型专用加载、提示渲染、KV处理、服务器API和测试——无需MLX或Ollama。
- pi-ds4扩展将ds4.c嵌入Pi编程代理,提供零配置的本地推理,将本地模型视为一流提供者。
- 目标是实现类似托管API的本地模型使用体验,从配置强劲的Mac开始,然后扩展到更多硬件和模型,同时保持一切开放和可改进。
- 作者鼓励拥有合适硬件的用户尝试pi-ds4,并希望积累临界规模,从而端到端地完善一个编程代理的体验。