Who Needs DRAM? We Have Fiber7 days agohttps://arxiv.org/abs/2607.08407超大规模数据中心和生成式人工智能正在增加对动态随机存取存储器的需求及价格压力。光纤存储器使用光纤作为活性循环延时线存储器,适用于如大语言模型权重这类不可变数据。该架构采用多芯光纤、被动光分接放大接口、共封装光学器件及全光再生技术。它消除了数千个人工智能加速器中冗余的权重存储需求。与传统高带宽存储器3代配置相比,该系统可将权重传输能耗降低超过70%。
Scrying the AMD GFX1250 LLVM Tea Leaves2 days agohttps://chipsandcheese.com/p/scrying-the-amd-gfx1250-llvm-teaAMD的新款GFX1250加速器(属于MI455X机器学习系列)在WGP结构和WMMA支持等方面与RDNA4有相似之处,但缺少动态VGPR分配功能。GFX1250允许每个波前最多使用1024个VGPR,相较于CDNA的512个和RDNA的256个有显著提升,并采用合并的448KB WGP缓存用于LDS和向量L0。GFX1250的图形支持极其有限,不具备光栅化器、纹理或光线追踪指令,使其成为纯粹的计算加速器。GFX1250的张量运算融合了RDNA4的编程模型与CDNA4的性能优势,支持多种数据格式和稀疏WMMA,但不包含fp64格式。新特性包括用于线程块协调的集群、集群级屏障与加载、协作原子操作,以及对tanh函数和显式预取的硬件支持。数据依赖处理经过重新设计,采用更细粒度的计数器(如ASYNCcnt、TENSORcnt)以减少停滞,相比GCN/CDNA架构提升了效率。
M-Chips: M7 with up to 1.5 TB – and why Apple is skipping the M6a day agohttps://www.heise.de/en/news/M-Chips-M7-with-up-to-1-5-TB-and-why-Apple-is-skipp...苹果将跳过M6 Pro、Max和Ultra版本,仅计划推出标准的M6芯片。M7系列将从2027年开始,配备重大的人工智能加速器升级,并包括Pro、Max和Ultra版本,支持高达1.5 TB的可寻址内存。苹果强调本地人工智能在节省成本、保护隐私和技术进步方面的优势,这与减少对云端依赖的推理趋势相符。