Popping the GPU Bubble21 days agohttps://moondream.ai/blog/popping-the-gpu-bubble流水线解码将GPU和CPU的工作重叠,以避免GPU出现等待CPU处理管理任务的空泡期。三种机制确保安全性:乒乓槽防止缓冲区冲突、先解码后采样处理受限解码场景、僵尸引用计数管理已完成的请求。性能提升取决于GPU速度和批次大小,在硬件速度越快、空泡期影响越显著的情况下,最高可获得35%的性能提升。
AI inference is obviously profitable18 days agohttps://www.seangoedecke.com/ai-inference-is-obviously-profitable/认为AI推理因成本高昂而不盈利的观点存在争议,有证据表明它实际上可以盈利。粗略成本估算显示推理成本约为每百万tokens 1美元,而GPT-5.4-mini收费4.50美元,这意味着利润率很高。像DeepSeek这样的开源LLM报告推理利润率超过80%,市场成本接近每百万tokens 0.87美元,这支持了盈利性。OpenAI和Anthropic等AI实验室可能利用高推理利润率补贴训练成本,这解释了它们定价较高的原因。即使主要AI实验室失败,没有训练成本的推理服务商仍可通过提供模型盈利,这表明推理业务具有可持续性。
GLM5.2 on AMD MI355X at 2626 tok/s/node at over 2x lower cost than Blackwell18 days agohttps://www.wafer.ai/blog/glm52-amdAMD MI355X GPU相比NVIDIA Blackwell B300显著降低了单GPU成本(约便宜2.75倍),为AI推理提供了经济高效的解决方案。Wafer在AMD MI355X上以2.4 RPS的请求速率运行GLM5.2模型,实现了2626 tok/s/节点的聚合吞吐量,以超过2倍的成本优势达到B200性能的80%,且单流解码速度为213 tok/s。优化措施包括使用AMD Quark将GLM-5.2量化为无损MXFP4格式、采用sglang作为推理框架、修复推测解码问题,并通过调优MoE内核来提升预填充性能。AMD在尖端模型的初期支持和软件适配方面仍面临挑战,但随着内核与模型优化的进步,性能差距正在缩小,降低了对定制内核的依赖。研究强调,在AMD平台上实现尖端性能日益取决于支持力度与优化水平,而非固有的软件限制,这标志着NVIDIA的CUDA优势正在逐渐消解。
Mesh LLM: distributed AI computing on iroh10 days agohttps://www.iroh.computer/blog/mesh-llmMesh LLM是一个分布式人工智能计算系统,它将多台机器上的GPU和内存汇集起来,呈现为一个与OpenAI兼容的统一API。该系统提供三种处理请求的方式:在本地GPU上运行、将请求路由至加载了模型的节点,或将大模型跨机器拆分为管道并行处理。系统使用iroh端点处理节点身份与网络连接,支持NAT穿透和中继备用机制,并维护两个中继服务器以确保开放互联网环境下的可靠性。通信基于QUIC的ALPN协商实现,针对网格管理、控制和拆分模型激活分别采用独立的协议。在主连接内部,各类流类型(如流言传播、HTTP隧道、路由查询)通过前导字节进行解复用,从而实现高效的端到端操作。用户可安装轻量级软件(约18MB)加入公共网格或部署私有网络,并通过localhost:9337/v1端口使用标准OpenAI客户端进行访问。
Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU6 days agohttps://www.neomindlabs.com/2026/06/08/running-gemma-4-26b-at-5-tokens-sec-on-a-...作者在一台没有 GPU 的 13 年历史双路 Xeon 服务器上成功运行了谷歌的 Gemma 4 26B 模型,解码速度达到了每秒约 5 个 token。该项目需要为 ik_llama.cpp 分支打补丁,以使其能在不支持 AVX2 指令集的 CPU 上运行,Claude AI 协助诊断并修复了模型图运算中存在的静默内核切换漏洞。修复包括编译时调整和运行时解决方法,以处理缺失的 AVX2 指令,使得旧硬件能够经济高效地运行现代 MoE 模型,作为一种本地备用方案。
Show HN: FlexInference LLM Router2 days agohttps://www.flexinference.comFlexInference是一项服务,它通过路由AI推理请求来在指定时间预算内寻找更便宜的选项。如果未找到更便宜的推理选项,请求将升级到标准层级且不产生额外费用;路由服务免费。用户使用自己的提供商密钥,并直接由提供商计费,FlexInference从节省的费用中抽取20%作为服务费。它支持OpenAI、Anthropic、Gemini,并集成了Amazon Bedrock和Google Vertex AI等平台。该服务通过不存储提示或回复,并使用信封加密技术保护密钥来确保数据隐私。它提供透明的错误处理、严格的参数遵循,并能通过SDK或直接API调用进行交互。通过MCP服务器,编码工具可以使用OAuth管理密钥和搜索文档,而无需处理原始密钥。由Adi创立,旨在通过降低成本及减少拖慢和限制推理的中间层来改进AI模型的使用权限。