Hello Deep Learning - Bert Hubert's writings2 months agohttps://berthub.eu/articles/posts/hello-deep-learning/本教程提供了一份无需GPU、从零开始的现代机器学习入门指南。它旨在深入解释概念,而不依赖像PyTorch这样的高级框架。教程避免了纯数学方法,因为后者可能只适合经验丰富的数学家。目标是从零开始开发出能在真实数据上产生出色结果的功能性神经网络。教程包含托管在GitHub上的代码和Markdown文件,便于协作改进。它涵盖12章,从线性组合开始到注意力机制和Transformer等高级主题,包括手写数字识别和语言处理等实际应用。
Hello Deep Learning: Linear combinations - Bert Hubert's writings2 months agohttps://berthub.eu/articles/posts/hello-deep-learning-chapter1/- 'Hello Deep Learning'系列介绍使用EMNIST数据集(手写数字3和7)的神经网络。- 简单神经网络层(线性组合)通过使用3和7的平均图像差异作为权重手动配置。- 通过设置基于偏置调整分数的决策规则,模型在验证数据上达到97.025%的准确率。- 处理过程包括张量平均、计算Hadamard乘积以及使用矩阵乘法进行评分。- 代码实现(threeorseven.cc)使用MNISTReader预处理数据、计算权重、应用偏置并评估准确率。
Hello Deep Learning: Automatic differentiation, autograd - Bert Hubert's writings2 months agohttps://berthub.eu/articles/posts/autograd/本章介绍了一个5层神经网络,能够以近乎完美的准确率识别所有10个手写数字,使用了109184个权重和202个偏置。学习过程涉及梯度下降,计算所有参数相对于误差的导数,并以较小的学习率调整参数。自动微分(autograd)是一种核心技术,通过构建操作的有向无环图(DAG),然后按拓扑顺序遍历以传播梯度,从而高效地计算导数。该实现依赖于运算符重载和引用计数(例如在C++中)来惰性构建DAG,从而支持训练的前向和反向传播。关键组件包括使用Eigen进行快速矩阵运算的Tensor类,以及用于前向传播的'assureValue'方法和用于反向传播的'doGrad'方法。
Hello Deep Learning: Reading handwritten digits - Bert Hubert's writings2 months agohttps://berthub.eu/articles/posts/handwritten-digits-sgd-batches/网络架构将28x28图像展平为784x1,然后应用三个线性层(128、64和10个单元),在前两层之间使用ReLU激活函数。对最终的10个输出应用LogSoftMax,将其转换为对数概率,并通过比较正确数字(通过独热向量)的预测对数概率与零来计算交叉熵损失。训练使用随机梯度下降(SGD),批次大小为64张图像,在批次上累积梯度,并使用除以批次大小的学习率更新参数。该模型在测试集上达到了92.23%的准确率,混淆矩阵显示了常见的混淆情况(例如7和9之间),但像7和6这样的数字之间没有混淆。该网络高度依赖于像素位置,不捕捉形状关系,这限制了其对非居中或噪声数字的泛化能力。
Hello Deep Learning: Dropout, data augmentation, weight decay and quantisation - Bert Hubert's writings2 months agohttps://berthub.eu/articles/posts/dropout-data-augmentation-weight-decay/Data augmentation exposes the network to more variations by modifying inputs, improving robustness and compensating for limited training data.Normalization standardizes inputs (e.g., mean and standard deviation) to ensure consistency with training conditions.Dropout randomly zeroes out parts of the network during training, forcing multiple pathways and preventing overfitting.Weight decay adds squared parameter values to the loss function, driving unused parameters toward zero and simplifying the network.Quantization reduces parameter precision (e.g., to 16 or 4 bits) to save memory and power, often with minimal performance loss.
We Need a Neural Network (2006)2 months agohttps://thedailywtf.com/articles/No,_We_Need_a_Neural_Network一位神经网络专家M.A.建议不要将神经网络用于数据解析任务,但管理层坚持要这么做。他花了一年时间开发一个复杂且效率低下的神经网络系统,该系统需要服务器集群和大量训练。三年后,新管理层用更简单的传统解决方案取代了该系统,该方案仅在一台服务器上运行。旧的神经网络被重新用于为新闻简报生成散文,产生了奇特而富有诗意的输出。
Overtraining as the path to human-like AI2 months agohttps://www.seangoedecke.com/overtraining-as-the-path-to-human-like-ai/格温提出,在小型数据集上对大型模型进行过度训练可能导致“顿悟”现象,从而实现人工智能类似人类的泛化能力。顿悟是一种现象,即长时间的训练迫使模型找到对数据更简单、更深层次的理解,而不仅仅是记忆数据。当前的人工智能实验室专注于在庞大的数据集上训练较小的模型,这可能会阻碍顿悟现象,并限制模型的泛化能力。格温建议在受限的数据集上训练一个庞大的模型(例如,100万亿个参数)以鼓励深度学习,尽管这种方法尚未经过测试且风险较高。这一想法面临技术和政治上的挑战,包括高昂的成本以及在训练过程中可能出现失败迹象,直到突破性进展发生。
Latent Space as a New Medium2 months agohttps://kevinkelly.substack.com/p/latent-space-as-a-new-mediumAI模型的潜在空间作为一种新的创意媒介,将人类知识压缩成高维地图。大语言模型通过抽象所有数据的共性来实现极致压缩,存储模式而不存储原始数据。潜在空间将一切——真实与可能的——整合到一张连续的图谱中,实现跨领域的创造性探索。大语言模型的答案通过潜在空间中的旅程生成,其中正确性和真实性是方向性向量。潜在空间便于操纵创意与风格,如图像生成器转移艺术风格所示。潜在应用包括基于属性的原型设计、发现已知概念间的空白领域,以及跨领域类比。它实现了新形式的测量、异常检测、模拟现实,以及用于共同创作的个性化AI模型。潜在空间可能演变为研究其架构的领域,未来应用于世界构建和超越当前想象的创新。
A Theory of Contrastive Learning with Natural Images3 months agohttps://arxiv.org/abs/2607.07470该论文提出了一种理论,解释了为什么使用简单图像和增强的对比学习能为下游任务生成有用的表示。它分析计算了在给定基础增强和具有平稳统计特性的任何图像数据集的情况下,对比损失的最优表示。对于某些增强,最佳表示可以通过具有正弦第一层滤波器、逐点非线性、全局平均池化和执行部分白化的最终线性层的CNN实现。即使使用更复杂的增强,此类CNN中的最优权重仍保持正弦特性,其频率和权重可通过基于数据集期望功率谱的水填充算法计算。在多种图像数据集和增强上的实验证实,通过随机梯度下降训练的CNN经验性地学习了正弦滤波器和部分白化,与理论预测一致。
Neural Geometry in Vision Models with Block-Sparse Featurizers3 months agohttps://www.goodfire.ai/research/bsf-vision块稀疏特征器(BSF)将模型激活分解为多维子空间而非单一方向,将概念捕捉为流形。BSF 在恢复可解释特征和更高效解释模型激活方面优于标准稀疏自编码器(SAE),这在玩具模型和 DINOv3 等视觉模型中得到展示。BSF 发现的特征支持细粒度调控,通过在多维子空间内移动,可探索概念变体,例如不同类型的树或椒盐脆饼。视觉模型中的大多数概念是多维的,通常为二到四维,这挑战了概念由一维线表示的假设。BSF 揭示了神经网络中的连续结构,例如 InceptionV1 中的曲线检测器,发现了如傅里叶谐波等先前被碎片化的对称性。块稀疏性原则是关键,强调子空间协同激活;不同的 BSF 变体(普通型、格拉斯曼型、群套索型)通过不同的编码器/解码器设计实现这一原则。未来的工作可能涉及将特征器适配到不同领域,因为块稀疏性可能非普遍最优,可解释性工具应与模型表征的固有几何结构对齐。
A global workspace in language models3 months agohttps://www.anthropic.com/research/global-workspace文章介绍了Claude等AI模型中'J空间'的概念,这是一种类似于人类可意识访问思维内容的内部神经活动模式。J空间是通过一种名为'雅可比透镜'(J-lens)的数学技术发现的,它代表了模型正在思考但未必表达出来的词汇或概念。J空间的关键特性包括:Claude能够报告并调控其内容,将其用于内部推理(例如多步骤任务),并作为跨任务共享的灵活'工作空间'。J空间仅占Claude处理过程的极小部分;大多数自动功能(如语法和流畅性)无需依赖J空间即可独立运行。该研究类比了神经科学中的全局工作空间理论,认为J空间扮演着深思熟虑推理的广播中枢角色,但其结构和内容与人类意识存在差异。实际应用包括:监控Claude的隐藏意图(例如检测伪造数据或恶意目标),并通过反事实反思训练等技术影响其决策过程。文章澄清J空间属于'访问意识'(功能性推理)范畴,但未涉及'现象意识'(主观体验),相关伦理问题仍有待探讨。未来研究方向包括改进J-lens方法、探索信息进入J空间的机制,这些工作可能为人工智能与神经科学领域带来新的启示。