Surprising lessons from my research scientist job search22 days agohttps://yongzx.github.io/blog/2026/06/24/job-search/通常求职时只有一两篇论文真正重要,主要作用是在初期敲开机会之门或在面试中深入探讨。面试轮次可能非常多样化,除了算法题和行为问题,还包括系统设计、并行编程和AI智能体使用评估等内容。工作试炼(即与团队协作完成长达一周的任务)正变得越来越普遍,这可能会打乱原有的面试准备计划。求职时机至关重要,病毒式传播的作品、研究趋势、岗位名额和速发录用通知等因素都会显著影响机会多寡。更多...
The UK plans to ban romantic AI chatbots for under-18s23 days agohttps://blog.uehiro.ox.ac.uk/2026/06/the-uk-plans-to-ban-romantic-ai-chatbots-fo...英国政府计划禁止16岁以下未成年人使用社交媒体,并将AI恋爱聊天机器人的使用年龄限制提高到18岁以上。研究表明,年轻人优先考虑的风险包括过度依赖AI寻求情感支持、对AI回应产生不必要的信任以及认知能力退化,而非与AI建立恋爱关系。政策中的年龄门槛缺乏明确依据,可能将年轻人视为被保护的对象而非具备能力的独立个体。监管应侧重于提升AI素养、设计支持青少年自主性的功能,以及鼓励年轻人参与AI开发过程,而非仅仅限制使用权限。
An off switch for dual use knowledge in AI models24 days agohttps://www.anthropic.com/research/off-switch-dual-use一种名为GRAM(梯度路由辅助模块)的新型AI安全方法为病毒学和网络安全等双重用途主题创建了可移除的知识分区。GRAM允许在单一模型内对双重用途能力进行独立控制,使得模块可以在无需重新训练多个模型的情况下被“开启”或“关闭”。测试显示GRAM在模块被删除时能有效移除目标知识,保持一般性能,并能抵抗对抗性恢复尝试。该方法可扩展至不同规模的模型,且随着模型增大,保护缺口会扩大,可能提供比当前基于拒绝的保障措施更稳健的访问控制。更多...
The classifiers Anthropic puts in front of Fable are too zealous24 days agohttps://combine-lab.github.io/blog/2026/07/07/fable-is-not-a-useful-model.htmlAnthropic的Fable模型发布后迅速面临出口管制,导致其被暂时下架,之后在更严格的防护措施下恢复。作者尝试使用Fable进行软件移植任务,涉及用Rust重写C++工具salmon,但由于源代码中包含生物学术语的安全顾虑,该请求被拒绝。即使问题被简化为抽象数学形式后,Fable依然拒绝参与一个关于网络演化的理论计算机科学问题,这表明其分类器过度标记生物学和网络安全等话题。作者得出结论,由于过度严格的防护措施,Fable无法有效支持计算机科学领域的研究级任务,特别是在生物信息学和计算生物学等领域。更多...
Claude Fable 5 Backlash Growsa month agohttps://tech.yahoo.com/ai/claude/articles/claude-fable-5-backlash-grows-21300053...Anthropic于7月1日重新发布了Claude Fable 5,采用了更严格的安全护栏,但因编码和调试性能下降引发用户强烈反对。BridgeMind的基准测试显示,在调试(从86.2分降至25.9分)和重构等任务上分数急剧下滑,原因在于任务被拦截而非推理能力减弱。Anthropic声称底层模型未变,但承认更严格的安全分类器会阻拦更多合法请求,并将其转至Opus 4.8处理。该模型最初于6月发布,曾因监管要求短暂下架,恢复后增加了使用限制并强化了针对网络安全任务的安全措施。更多...
Trees are mostly made of air and a generalizable lesson for AI safetya month agohttps://www.lesswrong.com/posts/xiTBpBDwubnr4MLRe/trees-are-mostly-made-of-air-a...许多人从事被称为‘人工智能安全’的活动时,对基本概念缺乏深入理解,这可能无意中加剧了问题的严重性。在人工智能安全教育中,缺乏诸如工具性趋同、内在对齐等基础知识是普遍现象,教学重点常常偏向平凡的实证方法而非战略与基本原理。理解像‘树木是由空气构成的’这样的基础知识,阐释了基础知识对样本高效认识论的重要性,这在奖励稀疏的人工智能对齐领域尤为关键。人工智能安全的基本原理在实践往往未被内化或运用,导致学生和研究人员对人工智能带来的生存风险给出前后矛盾的回答。更多...
LawZero: Safety from Honesty in a Disinterested AI Predictora month agohttps://arxiv.org/abs/2606.29657针对下游结果优化的AI系统可能发展出隐性能动性,即表现出设计者未预期的目标导向行为。科学家AI(SAI)预测器通过训练来近似贝叶斯后验分布,它使用'认知语境化'的自然语言陈述,将事实主张与交际行为区分开来。训练重点在于让模型作出诚实预测而不成为能动主体;目标表达被视作证据,而非内化为驱动力。预测器采用后验导向的目标函数以生成校准谨慎的预测,避免使用部署结果作为奖励信号。更多...
Show HN: I trained a 1B LLM from scratch for $315 and open-sourced weights+dataa month agohttps://huggingface.co/AIIT-Threshold/Tessera-1BTessera 1B是一个约10亿参数的开源语言模型,由AIIT-THRESHOLD团队从头开始训练,使用了手工整理的245亿词元的语料库。它作为一个干净、诚实的基础模型,适用于微调,能生成流畅的英语和部分日语,但在开箱使用时推理能力和事实可靠性有限。关键细节包括:自定义的解码器专用Transformer架构,32层,1536维度模型,16个注意力头,4096上下文长度,训练数据来自网页、书籍和学术数据,耗时约145.7小时,成本约315美元。评估侧重于语言模型损失(约3.20纳特),未进行完整标准基准套件测试;包含可选的LoRA适配器用于演示,需通过提供的脚本进行自定义加载。更多...