Hello Deep Learning - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/hello-deep-learning/本教程提供了一份无需GPU、从零开始的现代机器学习入门指南。它旨在深入解释概念,而不依赖像PyTorch这样的高级框架。教程避免了纯数学方法,因为后者可能只适合经验丰富的数学家。目标是从零开始开发出能在真实数据上产生出色结果的功能性神经网络。教程包含托管在GitHub上的代码和Markdown文件,便于协作改进。它涵盖12章,从线性组合开始到注意力机制和Transformer等高级主题,包括手写数字识别和语言处理等实际应用。
Hello Deep Learning: Intro - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/hello-deep-learning-intro/作者此前认为深度学习被过度炒作,但后来意识到其正取得重大进展。受安德烈·卡帕斯2015年关于循环神经网络的文章启发,作者决定补上这一课。作者的目标是用纯C++构建一个自包含、从零开始的演示程序,以解释深度学习的基本原理。该项目将涵盖使用真实数据识别手写字母等技术。代码将仅使用系统库以及日志、矩阵和图像处理库。目标是展示深度学习工具的内部运作机制,而不仅仅是其使用方法。
Hello Deep Learning: actually learning something - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/first-learning/本章展示了一个神经网络如何通过简单的权重调整技术,自行学习区分数字3和7的图像。最初,权重随机初始化并产生不正确的分数;学习过程会朝着正确输出的方向调整权重。调整幅度与输入像素值(亮像素更重要)成正比,并由学习率(例如0.01)控制。这种称为反向传播的简单方法,在干净测试数据上实现了超过98%的准确率,与之前手工配置的网络相当。代码初始化一个随机权重矩阵,通过单位矩阵应用学习率,并根据误差大小在每个训练样本后更新权重和偏置。该过程通过使用阈值(2或-2)进行更新来避免权重无限增长,后续将替换为激活函数。
Hello Deep Learning: Automatic differentiation, autograd - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/autograd/本章介绍了一个5层神经网络,能够以近乎完美的准确率识别所有10个手写数字,使用了109184个权重和202个偏置。学习过程涉及梯度下降,计算所有参数相对于误差的导数,并以较小的学习率调整参数。自动微分(autograd)是一种核心技术,通过构建操作的有向无环图(DAG),然后按拓扑顺序遍历以传播梯度,从而高效地计算导数。该实现依赖于运算符重载和引用计数(例如在C++中)来惰性构建DAG,从而支持训练的前向和反向传播。关键组件包括使用Eigen进行快速矩阵运算的Tensor类,以及用于前向传播的'assureValue'方法和用于反向传播的'doGrad'方法。
Hello Deep Learning: Convolutional networks - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/dl-convolutional/卷积网络(CNN)使用卷积核扫描图像中的特征,使其对像素位置变化具有鲁棒性。最大池化通过下采样降低对特征位置的敏感性,使用非重叠窗口仅保留最大值。GELU激活函数通常优于ReLU,因为它从负输入中保留更多信息。所描述的用于手写字母识别的CNN设计包括三个卷积+最大池化阶段,随后是三个全连接层和LogSoftMax。训练卷积网络计算量很大(例如可能需要一天),因为有大量运算,不过并行处理有所助益。过拟合是一个关键挑战;生产环境通常需要经历训练、验证、真实世界数据和可重复性等阶段。网络对手写字母的性能可能具有主观性(例如g与q),导致准确率约85%,但考虑第二佳猜测时超过95%。CNN中的反向传播涉及在输入和梯度上滑动卷积核以更新权重和偏置。实际实现中,将数字数据集替换为字母数据集,并使用ConvoAlphabetModel而非更简单的数字模型。
Hello Deep Learning: Dropout, data augmentation, weight decay and quantisation - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/dropout-data-augmentation-weight-decay/
Hello Deep Learning: Further reading & worthwhile projects - Bert Hubert's writingsa day agohttps://berthub.eu/articles/posts/dl-and-now-what/完成系列博客使您对深度学习基础有扎实的了解,但这篇两万字的入门指南之外还有更多内容需要学习。推荐资源包括PyTorch文档、Andrej Karpathy的micrograd和RNN文章,以及FastAI的Jupyter笔记本。进一步学习值得关注的项目:Whisper.cpp(C++语音识别)和Llama.cpp(大型语言模型),两者在中端硬件上即可运行。作者邀请读者通过拉取请求或邮件贡献推荐。
November newslettera day agohttps://gwern.substack.com/p/november-newsletter关于深度学习与基因组学规模化的链接网站的深色模式重写一篇已发表的论文对瓦格纳《指环》组曲的一篇歌剧评论
Show HN: FeyNoBg – Automatic background removal model and training librarya day agohttps://usefeyn.com/blog/feynobg/FeyNoBg是一种先进的自动背景去除模型,在八个基准测试中的四个上取得了最佳S-measure,在其余四个上差距在2%以内。该模型需要两种互补的技能:前景识别(将主体与背景分离)和边界精度(对头发或运动模糊等边缘进行图像抠图)。FeyNoBg基于BiRefNet架构,将第三个特征提取阶段从18个块扩展到24个块(2.63亿参数),以在不遗忘先前知识的情况下提高信息保留能力。构建了一个来自10个来源的26.1K张图像的多样化训练数据集,每个来源最多4000张图像,并将注释转换为二值掩码以确保一致性。NoBg库提供了用于运行和训练背景去除模型的统一Python接口,相比原始BiRefNet实现具有更高的吞吐量和更低的延迟。FeyNoBg和NoBg都是开源的,分别可在Hugging Face和GitHub上获取。
SEAM-V: A Hybrid-Decoupled RISC-V Vector Processor7 days agohttps://arxiv.org/abs/2607.17899论文介绍了SEAM-V,一种混合解耦的RISC-V向量执行架构,旨在解决紧耦合向量实现中的局限性。SEAM-V采用任务级解耦、本地指令供给和VLIW风格打包,形成连续的执行包(EP)流,从而改善指令供给并减少标量侧延迟。EP标识和基于请求的预取上下文对动态向量后端保持可见,支持同EP内冒险抑制和基于请求的预取,以提升持续吞吐量。该架构在安全条件下支持有限的跨EP向量重叠,而跨EP依赖、资源冲突和内存排序由后端动态管理。周期精确的RTL评估表明,SEAM-V在17个内核上相比基于Ara的紧耦合实现实现了1.34倍的几何平均加速,其中可变AVL、BLAS/矩阵和固定大小应用组的加速比分别为1.50倍、1.25倍和1.27倍。在AVL=32时,六个一维向量内核的几何平均加速比接近3倍。
Wax On, Weights Off: Knowledge Distillation Explained8 days agohttps://jdsemrau.substack.com/p/knowledge-distillation-attacks知识蒸馏是一种技术,让小型学生模型从大型教师模型的输出中学习,将多年的研发压缩到数周。存在三种类型:基于响应的(匹配输出)、基于特征的(匹配内部表示)和基于关系的(匹配示例之间的关系);对于封闭模型,只有基于响应的类型可通过API实现。针对封闭模型的蒸馏是一种分布式攻击,利用数千个API账户、查询多样化(自我指令循环、Evol-Instruct)以及数据工程来收集和清洗训练数据。该流程主要是一个数据工程系统:提示生成、收集(规避防御)、筛选(过滤/质量评分)和训练(SFT、LoRA、偏好优化)。经济优势:蒸馏仅支付压缩成本,跳过昂贵的发现过程(数据整理、架构搜索、对齐),使快速追随者能以较低成本追赶。前沿开发者的技术栈包括在大量数据上预训练、对齐(RLHF、奖励建模)、评估和推理防御——这些蒸馏者除非出售模型,否则不会投资。蒸馏将教师模型的护城河商品化,但迫使学生模型处于永久追赶状态,继承教师模型的偏见和能力上限。中美AI竞赛因蒸馏而被重新定义:深度求索、月之暗面和MiniMax等中国实验室被发现大规模收集Claude,导致访问限制和地缘政治紧张。
From Muon to Gradient Clipping: Some Thoughts on QK Stability16 days agohttps://MasterGodzilla.github.io/posts/2025/07/muon-clip/Muon优化器在函数空间中工作,通过对权重更新的谱范数施加约束,旨在限制对任何输入的函数变化,这与Adam等参数空间优化器形成对比。将标准Muon应用于Transformer的Q和K矩阵会导致训练不稳定,因为它分别约束W_Q和W_K的更新,未能控制它们在注意力分数中的耦合乘积,这可能导致谱范数爆炸。将Muon修改用于QK的一种理论尝试是直接约束注意力分数矩阵S的变化,这引出了一个优化问题,其约束条件耦合了ΔW_Q和ΔW_K。通过三角不等式解耦这一约束并解决子问题,得到了理论上简洁的更新公式,但它需要昂贵的伪逆计算,使其不切实际。数学简化表明,梯度G_Q自然地包含W_K,这引出了一个涉及投影矩阵的几何解释,然而外部的伪逆仍然存在,未能解决计算瓶颈。通过统一的双线性矩阵B = W_Q W_K^T 来看待注意力,将Muon更新简化为单矩阵约束,但这种方法由于参数爆炸(d^2对2dh参数)而不实用。多头注意力可视为完整双线性注意力的低秩近似,这与LoRA的结构相联系,提示了开发用于参数高效微调的Muon-LoRA优化器的潜力。由于计算障碍,实际解决方案转向经验近似,如梯度裁剪或Kimi的MuonClip,这些方法利用批信息来近似最坏情况行为,从而稳定训练。
Theories of Deep Learning17 days agohttps://astledsa.substack.com/p/theories-of-deep-learning深度学习已取得指数级的实证成功,但理论研究长期滞后;然而,随着多种新兴理论的出现,这一差距正在缩小。深度学习理论可分为架构理论、优化理论和功能理论三类,分别侧重于模型设计、优化器行为和泛化能力等不同方面。范畴化深度学习运用范畴论来泛化所有神经网络架构,通过二维范畴中的单子为约束条件与实现之间搭建桥梁。模块对偶性提出基于范数的优化框架以提升训练效率,引入对偶映射使梯度更新与参数空间对齐。泛化理论将研究焦点从参数空间转向输出空间,利用经验神经正切核解释良性过拟合、双重下降、隐式偏置和顿悟现象。其他研究领域包括机械可解释性与多种解释性原则,但上述理论为深度学习奠定了坚实的理论基础。
FlashAttention-4: Algorithm and Kernel Pipelining25 days agohttps://research.colfax-intl.com/flashattention-4-algorithm-and-kernel-pipelinin...现代GPU如Blackwell上的非对称硬件扩展导致张量核心吞吐量的增长速度快于共享内存带宽和特殊功能单元(SFU)等资源。FlashAttention-4是为Blackwell架构协同设计的算法与内核,在B200上使用BF16精度实现高达1605 TFLOPs/s,性能超越cuDNN和Triton。关键创新包括用于重叠的新流水线技术、通过多项式近似进行指数运算的软件模拟以缓解SFU瓶颈,以及使用TMEM减少共享内存流量。Blackwell的硬件特性如Tensor Memory(TMEM)、完全异步的第五代张量核心和2-CTA MMA模式支持更大的分块、降低流量并提升性能。反向传播受限于共享内存带宽;优化措施包括采用2-CTA MMA将流量减半并减少原子加法操作,以及确定性模式以实现可复现的训练。调度改进通过网格线性化和最长处理时间优先(LPT)调度,解决了因果掩码和可变序列长度导致的负载不均衡问题。FlashAttention-4基于CuTe-DSL实现,显著缩短了编译时间,并推动了cuDNN 9.13及后续版本的优化。
Scaling Laws, Carefullya month agohttps://lilianweng.github.io/posts/2026-06-24-scaling-laws/缩放定律描述了训练损失与模型大小(N)、数据集大小(D)和计算量(C)之间的幂律关系,这对于深度学习中优化计算资源分配至关重要。早期工作(例如Amari等人1992年,Hestness等人2017年)确立了幂律学习曲线,并发现架构影响偏移量但不影响指数,指数是领域特定的。Kaplan等人(2020年)形式化了Transformer的缩放定律,提出模型大小应比数据增长更快(N_opt ∝ C^0.73),但这一观点后来受到质疑。Chinchilla(Hoffmann等人2022年)发现了最优缩放关系N_opt ∝ C^0.5,主张使用更多令牌训练更小的模型,表明许多大型模型训练不足。Kaplan和Chinchilla之间的差异源于规模、嵌入参数计算和拟合方法的不同,后来由Pearce和Song(2024年)调和。幂律可能源于数据流形维度或量化技能学习,但理论解释仍不完整。在数据受限的情况下,研究(如Hernandez等人2022年,Muennighoff等人2023年)显示重复数据会损害效率,模型通过有效数据和过拟合惩罚进行调整。Lovelace等人(2026年)引入了基于容量比(N/U_D)和重复的过拟合惩罚项,改善了受限数据下的缩放定律拟合。由于对损失精度、噪声、拟合区域以及固定架构和调优等假设的敏感性,拟合缩放定律具有挑战性,这在复制尝试中可见(Besiroglu等人2024年)。