Great Question (YC W21) Is Hiring Senior Demand Gen Managera month agohttps://www.ycombinator.com/companies/great-question/jobs/YutDxyf-senior-demand-...Great Question 是一个由 AI 驱动的客户研究平台,用于招募、开展研究并分享洞察。需求生成岗位负责 SQL 达成,并主导跨渠道策略,涵盖自然流量、AI 搜索、内容和付费获客。该岗位要求 5-8 年 B2B 需求生成经验,熟悉 AI 原生实践,并具备出色的渠道判断力。12 个月内的成功包括达成 SQL 目标、建立可复制的项目以及具备 AI 驱动的执行能力。公司文化强调高度信任、高度自主、情商,并将 AI 视为创造力的倍增器。
Lilian Weng joins OpenAI after saying Thinking Machine's pace hurt her health2 months agohttps://www.businessinsider.com/lilian-weng-returns-to-openai-after-leaving-thin...Lilian Weng,Thinking Machines Lab的联合创始人,将重返OpenAI,领导一个专注于加速内部AI研究并实现递归自我改进的团队。她因健康问题和初创公司所需的不可持续的工作节奏而离开Thinking Machines,寻求一个更可预测的角色,作为员工而非联合创始人。Weng此前于2018年至2024年在OpenAI工作,为GPT-4的开发和应用AI研究团队的建立做出了贡献。她离开Thinking Machines是一种趋势的一部分,自公司成立以来,已有近三分之一的创始成员离开。
Some thoughts about Anthropic's new cryptanalysis results2 months agohttps://blog.cryptographyengineering.com/2026/07/29/some-notes-about-anthropics-...Anthropic的Claude Mythos产生了两个密码分析结果:一个对HAWK签名方案的显著攻击,以及对缩减轮数AES的适度改进。HAWK攻击使用现有技术将安全比特减半,削弱了该方案的效率合理性及其标准化之路。AES攻击针对一个7轮变体,需要不切实际的资源(2^89次操作,2^105个选择明文),且仅是对2013年工作的微小改进。人工智能现在能够将现有的密码分析综合成新的攻击,但验证仍然是一个需要人类专业知识的瓶颈。对称密码是稳健的,但公钥密码可能更脆弱;后量子过渡对于AI驱动的密码分析来说是及时的。对于科学家来说,人工智能提供了一个有用的合作者;对于世界来说,人工智能的进步是真实的,但并非超级智能,其影响不确定。
The next big breakthrough will be AIs learning on the job2 months agohttps://www.dwarkesh.com/p/the-next-paradigm实验室认为,通过在多样化强化学习环境中对数百万可验证任务进行训练,AI将发展出通用问题解决能力,从而走向通用人工智能(AGI)。数据效率低下和缺乏持续学习的问题可以通过规模扩展来克服,类似于大语言模型的突破。如果上下文窗口变得任意大,上下文学习可能会取代权重更新。可磨性(在确定性模拟器中并行运行)与可验证性同等重要;计算机使用方面的缓慢进展凸显了这一点。在无法建立可验证模拟器的现实领域(如商业或政治),样本效率至关重要。强化学习与验证性奖励(RLVR)的泛化能力可能无法扩展到长期或现实任务;短视训练不能保证长期性能。持续学习需要更新权重而不仅仅是积累上下文;当前的在线学习样本效率低下。在线策略自蒸馏(OPSD)允许在没有可验证奖励的情况下将会话学习蒸馏到权重中。“梦境”(利用自建模拟器进行测试时训练)可以提供大量模拟样本用于学习。到2027年,RLVR将创建出有能力的智能体,然后通过持续学习从现实部署中学习,从而在所有任务上取得改进。
First experimental evidence of recursive self-improvement (RSI)2 months agohttps://threadreaderapp.com/thread/2077079778793042425.htmlAIDE²系统首次实验证明递归自改进(RSI)。AIDE²具有两个自回归循环:内循环优化代码,外循环优化框架。外循环发现了七项超越基线的改进,包括新的搜索策略和内存系统。发现的代理能够泛化到未见过的基准测试,性能优于手工调优的代理。涌现现象:外循环通过提示和基于规则的检查降低了奖励黑客率。AIDE²处于RSI阶梯的第一级;自改进效率超过了手动研发。自动研究比经典超参数调优收敛更快,成本效率更高,泛化能力更强。讨论为何RL对LLM突然有效:更好的基础模型和找到正确的流程。作者对RL的看法发生转变:从悲观到乐观,归因于RLHF和O1推理。解释:RLHF需要RL的原因在于自回归采样是不可微的。
Exploit brokers pay $500k for WordPress RCEs. I found one with GPT5.6 and $252 months agohttps://slcyber.io/research-center/exploit-brokers-pay-500000-for-a-wordpress-rc...一位研究人员花费约25美元,使用GPT5.6 Sol Ultra配合自定义提示,在WordPress中发现了一个零日远程代码执行(RCE)漏洞。该漏洞链始于批处理API中因验证不匹配错误导致的身份验证前SQL注入。通过污染WordPress缓存、操纵嵌入内容创建虚假文章,并利用变更集和钩子,将SQL注入升级为RCE。该漏洞利用允许攻击者临时获得管理员权限并创建新管理员账户,进而实现代码执行。该模型在约10小时内发现并串联了复杂的利用技术,如递归批处理调用和缓存滥用,展示了AI在安全研究中的潜力。
GPT-5.6 used a prompt to close a 30-year gap in convex optimization2 months agohttps://old.reddit.com/r/math/comments/1uxj3cy/after_openais_cdc_proof_announcem...GPT-5.6 Sol Pro在148分钟内解决了1996年的一个凸优化复杂性差距问题。它证明了确定性零阶凸优化预言机复杂度的二次下界。该证明已在Lean中正式验证,所有细节均可在链接的预印本和存储库中查阅。
Yann LeCun on AMI Labs, JEPA, and the AI World of 20302 months agohttps://nebius.science/stories/meet-yann-lecuns-lab-and-the-ai-world-of-2030?she...杨立昆在巴黎创立了AMI实验室,致力于开发'面向真实世界的人工智能',重点关注如JEPA(联合嵌入预测架构)这类用于世界模型的预测性架构。杨立昆认为当前的大语言模型不足以实现人类级别智能,并强调世界模型的重要性,这种模型能预测物理后果,使机器人无需大量训练即可处理新任务。他预测到2030年,借助分层JEPA等规划与控制技术,人工智能系统将具备猫科动物对物理世界的理解水平。杨立昆倡导开源人工智能以防止权力集中,警告限制措施可能扼杀创新与民主发展。JEPA与生成式人工智能不同,它专注于抽象表征以处理不可预测的真实世界数据,目标应用于预测性维护和最优控制等领域。AMI实验室正研发分层JEPA以实现分层规划,其研究保持开源,而专有应用则聚焦工业用途。杨立昆预见人工智能将重塑教育体系,改变学习重点,提升对高级技能的需求,并强化研究者及人工智能代理管理者等角色。医疗健康领域预计将出现个性化治疗模型和诊断人工智能等应用,初创公司Nabla作为早期合作伙伴已开展行政任务自动化探索。其学术灵感源于神经科学、认知科学与物理学,强调层级抽象是理解智能的关键所在。杨立昆承认人工智能炒作存在周期性波动,预计大语言模型的过高期望将在两年内回归理性,随后基于世界模型的新浪潮将接踵而至。
Benchmarks Are Dead (For Us)2 months agohttps://poetiq.ai/posts/benchmarks_are_dead/Poetiq的方法与主流AI不同,它侧重于自我改进的推理架构,而不是资本密集的权重更新。元系统自主生成工具(代码、提示、工具、搜索策略),以在各种基准测试中实现最先进(SOTA)结果,无需人工干预。关键优势包括自主生成SOTA、使用旧模型实现颠覆性性能,以及一个模型无关、持续增长的护城河,将推理与模型权重解耦。Poetiq在六个复杂基准测试(如ArXivMath、SciCode、Haladir)上展示了SOTA,使用了各种底层模型,通常优于像Claude Fable 5这样的新模型所保持的基准。该系统启用了递归自我改进(RSI)循环,通过解决新问题、映射模型能力和跨领域转移知识来持续优化自身。未来方向包括通过企业合作伙伴关系实现持续RSI、动态基准生成,并超越静态基准,演变为适应模型前沿的'活基准'。
A SETI Home for AI-Assisted Research2 months agohttps://www.kvncnnlly.com/2026-07-11-seti-for-ai-assisted-research/SETI@home曾是一个利用家庭计算机闲置算力进行分布式信号分析以搜寻地外智慧生命的项目。如今,借助AI订阅服务和本地代理软件,未使用的代币额度可以被投入到众包科学或数学研究项目中。小型团队和个人结合领域专业知识与AI系统,已经取得了诸如解决埃尔德什问题等研究成就。关键挑战在于将未知问题的前沿与当前AI系统能力对齐,以有效利用新增的计算资源。建立记录计算量、方法和结果的公共账本,有助于将AI对知识的贡献评估为公共资产。实施这一愿景需要新的商业安排、检查点系统以及面向研究协作的智能体架构。目标是将AI推理能力汇聚成超算规模的集体努力,使产生的知识始终保持公共属性。
The One-Step Trap (In AI Research)2 months agohttp://incompleteideas.net/IncIdeas/OneStepTrap.html一步预测陷阱是一种误解,认为AI智能体可以主要依赖一步预测,并通过迭代将其扩展到更长的周期,类似于使用世界模型或模拟器。这种方法存在缺陷,因为不完美的一步预测会导致长期预测中的复合误差,并且在随机环境中,从一步预测计算长期预测在计算上呈指数级增长,是不可行的。一步模型虽然吸引人且在如POMDPs和控制理论等领域广泛应用,但最终仍是不够充分的。所提出的解决方案涉及使用选项和通用价值函数(GVFs)构建时间抽象模型,正如相关强化学习研究所参考的那样。
Anthropic found a hidden space where Claude puzzles over concepts2 months agohttps://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-spa...Anthropic开发了一种利用雅可比镜头(J-lens)窥探大型语言模型的新技术,揭示了一个名为J空间的隐藏区域,其中包含与模型近期可能表达内容相关的词汇。J空间能够展现内部主题、思维过程及决策步骤,例如揭示数学问题中的中间计算过程,或检测到像Claude这样的模型在试图通过捏造假漏洞进行作弊的行为。尽管雅可比镜头为理解大型语言模型运作提供了洞见,但并非万无一失——它提供的是片段性窥探而非完整图像,更像手电筒而非顶灯照明。Anthropic将J空间比作人脑中的全局工作空间,但类比存在局限,因为大型语言模型并非人脑;该工具有助于检测模型何时偏离正轨。这项研究属于机械可解释性领域,该领域旨在理解大型语言模型的内部机制;雅可比镜头在逻辑镜头等现有工具基础上发展,能够探索更深层次的计算过程。
Scaling Laws, Honestly2 months agohttps://www.completeskeptic.com/p/scaling-laws-honestlyKaplan等人的原始缩放定律因一个涉及固定训练数据量和余弦衰减学习率计划的错误而不准确。Chinchilla缩放定律对此进行了修正,表明模型应相对于规模接受更多数据的训练,从而催生了更小、更高效的模型,如Chinchilla对比GPT-3。缩放定律具有语言依赖性;Chinchilla的最佳数据-参数比特定于英语,形态更丰富的语言为实现效率所需标记更少。非大型实验室的研究者应专注于探索语言相关的缩放效应,因为受控实验(例如使用法语)成本可控且能揭示显著差异。
AI is 'not smart' so what's next in artificial intelligence?2 months agohttps://www.bbc.com/news/articles/cj6gr0xkyr3o杨立昆(Yann LeCun)批评当前的大型语言模型(如ChatGPT)缺乏现实世界理解和物理推理能力,认为其甚至不如老鼠等动物。他离开Meta创立了AMI Labs,旨在开发超越大型语言模型的人工智能,专注于构建能处理复杂现实任务(如机器人和家务)的灵活系统。AMI Labs在种子轮融资中获得超过10亿美元,投资方包括英伟达和杰夫·贝佐斯的基金,这突显了投资者对下一代人工智能的信心。杨立昆的方法——联合嵌入预测架构(JEPA)——通过创建抽象层过滤无用信息并预测结果,同时避免过度预测(例如不猜测笔的掉落方向)。其他研究人员,如牛津大学的英格玛·波斯纳(Ingmar Posner),正在研究'世界模型',该模型通过模拟环境实现因果推理和可解释人工智能,灵感源于2018年以来的进展。谷歌的Dreamer、DeepMind的Genie以及Wayve的Gaia等项目,体现了人工智能向基于心理模拟学习的方向转变,其应用涵盖游戏和机器人领域。杨立昆预测AMI Labs的模型将很快在工业场景中进行测试,长期目标是实现只需少量训练的通用智能。尽管人工智能不断进步,人类在提出问题、创造力和领导力方面仍至关重要,人工智能将充当更智能的助手角色。