Run large language models at home, BitTorrent‑style
6 hours ago
- 通过BitTorrent风格的分布式网络,使用消费级GPU或Google Colab在家中运行Llama 3.1、Mixtral、Falcon、BLOOM等大型语言模型。
- Llama 2(70B)推理速度可达6 tokens/秒,Falcon(180B)可达4 tokens/秒,适合聊天机器人和交互式应用。
- 拥有超越基础API的先进能力,包括微调、自定义采样、模型路径执行和隐藏状态检查,并具备PyTorch和Transformers的灵活性。