Everyone says Chinese AI is dirt cheap10 days agohttps://badboylabs.com/articles/chinese-ai-models-cheap-benchmark-receiptsKimi K3并非廉价选择;其价格与西方旗舰产品相当,且在每次测试成本上表现处于中等水平。中国模型在作为'执行者'(编码执行)方面占据主导地位,实现相同结果时比西方同类产品便宜19倍。三个陷阱包括:推理令牌的隐藏计费、尽管在排行榜上排名靠前但在实际工具中失败的模型,以及廉价聚合器上的不稳定路由。最佳配置是使用一个前沿规划器(例如Grok-4.5或GPT-5.6 luna)搭配一个廉价的中国执行者(例如DeepSeek flash)。更多...
Performing Live Migrations of VMs18 days agohttps://www.sailresearch.com/blog/performing-live-migrations-of-massive-vms-at-s...Sailboxes采用成本效益高的定价模式,仅按活跃资源每秒使用量收费,使长期运行的智能体工作流具备可扩展性。实时迁移技术使Sailboxes能够在主机间无缝迁移虚拟机,实现最短停机时间,支持临时计算和负载均衡。网络代理在迁移期间处理开放连接,通过缓存数据包保持连通性,并提供白名单和凭据注入等附加功能。P2P迁移利用用户态缺页处理(userfaultfd)实现高效内存传输,按需分页调入数据,并使用更大的内存块降低延迟。更多...
Distributed System Is Slower Than a Laptopa month agohttps://codegood.co/writing/your-distributed-system-is-slower-than-a-laptop2015年一篇论文显示,单线程笔记本电脑在大规模图处理任务上胜过了分布式系统。许多分布式系统即使动用数百个核心也未能超越单个合格线程,导致了高COST(超越单线程的配置成本)。公司在单机解决方案更简单、更便宜且性能更好的情况下,仍花费数百万购买分布式系统。硬件进步使得单台服务器变得极为强大,但“默认分布式”的思维定式依然毫无根据地持续存在。更多...
A verification loop 4x'd DeepSeek's intelligence, matching Opus at 1/7 the costa month agohttps://ironbee.medium.com/what-a-verification-loop-adds-to-a-coding-agent-a-fir...验证循环通过早期发现错误,显著提高了编码代理完成多步网页开发任务的能力。使用IronBee(验证层)配合DeepSeek(低成本模型)将任务完成率从平均6.8/20提高到了17/20,与Claude Opus(前沿模型)的性能相当。DeepSeek结合IronBee取得了与单独使用Opus相似的效果,但成本仅为约1/7(每次运行2.4美元对15美元),这表明验证可以减少对昂贵模型的依赖。研究强调,验证对于只有在运行应用程序进行测试时才会出现的错误帮助最大,特别是在顺序任务中,早期的错误会不断累积。更多...
GLM5.2 on AMD MI355X at 2626 tok/s/node at over 2x lower cost than Blackwella month agohttps://www.wafer.ai/blog/glm52-amdAMD MI355X GPU相比NVIDIA Blackwell B300显著降低了单GPU成本(约便宜2.75倍),为AI推理提供了经济高效的解决方案。Wafer在AMD MI355X上以2.4 RPS的请求速率运行GLM5.2模型,实现了2626 tok/s/节点的聚合吞吐量,以超过2倍的成本优势达到B200性能的80%,且单流解码速度为213 tok/s。优化措施包括使用AMD Quark将GLM-5.2量化为无损MXFP4格式、采用sglang作为推理框架、修复推测解码问题,并通过调优MoE内核来提升预填充性能。AMD在尖端模型的初期支持和软件适配方面仍面临挑战,但随着内核与模型优化的进步,性能差距正在缩小,降低了对定制内核的依赖。更多...
Nano Banana 2 Litea month agohttps://deepmind.google/models/gemini-image/flash-lite/Nano Banana 2 Lite是一款高速、经济高效的Gemini图像模型,专为快速图像生成和编辑而设计。它支持快速原型设计和迭代,相比重型模型,使创作者能够以低成本生成数千张图像。该模型保持了控制性和准确性,支持角色一致性、精确视觉编辑和现实世界知识的整合。应用示例包括用于室内设计的Space Lift、用于交互式学习的Gridscape、用于教育视觉的Peek-A-Word以及用于旅行明信片的Anywhere。更多...