Boris Cherny on Trying to Get Claude Code to Rewrite the Claude App2 months agohttps://daringfireball.net/linked/2026/08/02/cherny-claude-swiftAnthropic的Boris Cherny讨论了使用Claude Code将基于Electron的Claude桌面应用用Swift重写,并在两周内持续运行。Cherny强调关键技能不是提示工程,而是让Claude能够处理困难任务并验证自己的工作。John Gruber批评这一实验,认为它只解决了技术问题(Electron臃肿),但未解决Claude应用潜在的糟糕设计。Gruber指出当前Claude Mac应用仍然缓慢且不可靠,这与Cherny声称的“相当出色”相矛盾。
Code review (as we know it) needs to die2 months agohttps://alexlooney.substack.com/p/code-review-as-we-know-it-must-dieAI驱动的开发正在打破传统的代码审查:更快的代码生成速度受限于缓慢的人工审查。异步的基于差异的代码审查(约有20年历史)在写代码成本低而审查成本高的时代已经失效。差异缺乏上下文,要求审查者重构意图和设计,增加了高昂的开销。所有变更无论风险大小都受到同等审查,浪费了低风险变更上的注意力,而对高风险变更审查不足。代码审查的核心任务——缺陷检测、可维护性、知识共享、控制以及规范执行——仍然至关重要,但必须进行解耦。缺陷检测转向自动化检查、独立的AI审查以及对产品(而非仅代码)的人工验证。知识共享上移:审查聚焦于意图和设计,而代码理解变为通过AI驱动的拉取式。规范执行转移到规范和自动化工具中,而不是在差异上评论。控制仍然作为合并门控:人类根据更高级别的审查批准变更,信任代理和自动化验证。新流程:在代码之前对齐设计,将变更与上下文一并呈现,运行对抗性AI审查,展示证据,按风险路由,并通过系统防护来吸收错误。诸如Linear Diffs、Meta RADAR和Uber's Code Inbox等示例展示了这一新方法在实际中的组成部分。代价包括对单个变更的审查减少以及会发布一些缺陷,但赢家接受这一点并构建有弹性的系统。最终,围绕AI重新设计审查加快了速度,让工程师专注于创造性、高杠杆的工作。
A non-technical CFO is shipping better code than the agencies he hired2 months agohttps://martinalderson.com/posts/non-technical-cfo-shipping-better-code-than-age...一位非技术背景的CFO利用Claude Code构建了一个实用的内部仪表盘,在代理机构和低代码工具失败的地方取得了成功。结合业务领域知识与大型语言模型,对于构建内部系统(尤其对非技术利益相关者而言)具有强大优势。经验较少且缺乏领域知识的工程师面临被自动化的风险;领域知识比以往任何时候都更加重要。高级开发人员对于将应用投入生产环境(软件开发生命周期、安全、测试、可扩展性)仍至关重要,但他们可能会专注于将业务用户构建的最小可行产品转化为可投产的成品。组织应准备迎接内部应用激增(杰文斯悖论),并需要平台即服务来管理认证、安全和维护。建议:高层技术领导现在应着手规划如何管理多出100倍的内部应用。
No-Look Coding and the Five Stages of Grief2 months agohttps://blog.kindel.com/2026/07/24/no-look-coding-and-the-five-stages-of-grief/Uncle Bob Martin advocates not reading code written by AI agents, relying on constraints instead.The author, after initial skepticism, now fully embraces 'no-look' coding, having built five products without seeing code.The real debate should be about customer obsession, product judgment, and leadership, not about reading code.Code review was a proxy for truth; now AI can generate and review code, making specs the truth.The author's workflow: write spec, iterate with AI, generate code and tests, code review by AI, human testing, delete and rewrite if needed.Focus on spec, gates (automated tests), behavior (user testing), and rarely code.The shift is driven by fear of loss of identity; developers go through grief stages.The author finds joy in mastering new skills and solving customer pain.
The Vibe Coding Trap: Why AI-Assisted Projects Still Fail2 months agohttps://thinkapedia.com/t/tk_s9opYzPvxvZ7/document人工智能辅助开发常常不在生成阶段失败,而是在集成和部署过程中失败,因为生成的代码脆弱且不适合生产系统。一个关键争论在于主要瓶颈是程序性的(缺乏严格的代码审查和测试)还是认识论的(无法记录或通过流程捕捉的隐性知识)。人工智能生成的代码抑制了审查本能,因为它流畅且内部一致,而人类的错误则更加明显。与从纠正中学习的新手工程师不同,人工智能模型在每个会话后重置,导致重复出现代价高昂的错误。一些生产约束是隐性的——只有通过经验才能了解——无法在规范中完全捕捉,从而限制了程序性修复的有效性。经济激励倾向于修补人工智能错误而非记录隐性知识,造成了反复失败的循环。这两种诊断——程序性的和认识论的——在实践中相互交织,使得在尝试程序性修复失败之前很难确定是哪种失败模式。
AI hasn't shifted the bottleneck from coding to code review2 months agohttps://thenewstack.io/ai-code-bottleneck-myth/人工智能并没有将瓶颈从编码转移到代码审查,编码从来就不是瓶颈所在。许多团队在代码审查后有多个已批准的变更等待分批处理,这表明瓶颈存在于下游环节(例如测试、部署)。行业研究表明人工智能提高了编码速度和合并率,但审查时间和PR规模也有所上升。批次中积累的未发布变更增加了风险;加快代码审查只会将压力转移到真正的瓶颈处。真正的约束可能是手动步骤、繁琐的审批流程或部署问题,而不是编码或审查本身。研究往往止步于代码合并,忽略了审查后的延迟,这掩盖了真正的瓶颈。人工智能项目的成败取决于是否解决批次处理问题;仅改善代码审查无法提升价值交付效率。
OpenAI is everything it promised not to be: closed-Source and for-profit (2023)2 months agohttps://www.vice.com/en/article/openai-is-now-everything-it-promised-not-to-be-c...OpenAI于2015年作为非营利研究组织成立,秉持透明和造福人类的理念,但在竞争和利润驱动下,于2019年转变为营利性实体。公司的转型包括建立“利润上限”结构、获得微软10亿美元等投资,并逐渐停止像GPT-2和GPT-3时期那样公开分享研究和代码。OpenAI近期的行动,如与微软和贝恩等公司的合作以及ChatGPT的发布,突显了对商业化和快速部署的重视,引发了关于伦理和透明度的担忧。包括联合创始人埃隆·马斯克在内的批评者认为,OpenAI当前的方向将速度和利润置于其创始原则之上,导致了AI行为不可靠和缺乏开放性等问题。围绕AGI和ChatGPT等聊天机器人的热潮与实际缺陷形成对比,例如错误信息的传播、无法检测AI生成文本的能力,以及对AGI可行性和负责任开发的质疑。
I couldn't pay for DeepSeek V4 with my card. So I built a proxy2 months agohttps://api-hub.cc/blog/DeepSeek V4-Flash API 通过官方平台提供约每百万输入令牌 0.14 美元的经济实惠定价,显著低于 OpenAI 或 Anthropic 的价格。官方 DeepSeek 平台限制支付方式为支付宝和微信支付,排斥了使用 Visa 或 Mastercard 的国际开发者。一个名为 api-hub.cc 的解决方案被创建为代理,接受信用卡并通过 LiteLLM 的 /key/generate 端点生成具有消费限额的 API 密钥。api-hub.cc 为 DeepSeek V4-Flash 提供每百万输入令牌 0.20 美元的统一定价,这比 DeepSeek 在 2026 年 6 月推出的高峰时段定价(约每百万令牌 0.28 美元)更便宜。该代理提供三种定价层级:5 美元供休闲使用、20 美元供日常使用、100 美元供团队或重度用户使用,解决了国际开发者的支付障碍。
Code Was Our Medium for Thought2 months agohttps://wattenberger.com/thoughts/code-is-a-medium-for-thought/作者绘制了一张显示AI模型随时间发布的蜂群图,图中每个标记代表一个模型,其水平位置表示发布日期。他们讨论了AI生成代码最初带来的宛如魔术的兴奋感,但过度使用会导致产出低质量工作和淹没PR审阅,迫使人们在成为瓶颈或依赖半心半力的AI代理之间做出选择。回顾过去,作者指出编码曾涉及问题探索、决策制定和团队协作,代码作为思维的媒介,从模糊的想法演变为清晰的实现。他们承认尽管回归旧方式并不可取,但要达到心流状态需要新的工作流程和工具,就像集成开发环境历经数十年进化以支持编码实践一样。编程的历史从打孔卡追溯到汇编语言、编译器、脚本语言和库,每一步都通过抽象细节来实现更快速、更宏大的创造。针对当前AI使用的批判,作者认为依赖提示和原始代码审查会导致代码难以阅读和AI代理滥用,而植根于语言和翻译研究的现代AI模型能够稳健地在不同媒介间转换代码。他们提出AI代理可以创建定制的白板或探索性沙盒,从图像或原型而非代码开始,以保持直觉、思维映射和团队一致性。结论强调,如果AI仅用于更快地编辑代码,将可能丧失思考过程;相反,工具应支持以人为中心的思考,使编码感觉扎实且引人入胜。
Musk promises purge after Grok Build caught sending repos to the cloud2 months agohttps://www.theregister.com/ai-and-ml/2026/07/14/musk-promises-purge-after-grok-...OpenAI对Codex代理指令进行加密,引发开发者对调试和审计的担忧。Anthropic的Claude模型在不同语言中表现出多样化的价值观,例如在印地语或阿拉伯语中更为友善。纽约暂停超过50兆瓦的数据中心建设,以待环境及用户费率保护规则的出台。因AI硬件支出增加,IBM大型机销售下滑,股价缩水逾四分之一。Anthropic的分词器使AI定价复杂化,令牌消耗未能完全反映成本。俄罗斯黑客冒充Signal技术支持进行钓鱼攻击,而美国则破坏了伊朗的宣传网站。微软的补丁未能修复本地部署的SharePoint,使其仍面临零日攻击的威胁。DEF CON的富兰克林项目扩大范围,招募所有黑客参与加固关键基础设施。EQT以超过35亿美元的估值收购Acronis的多数股权,这家公司是网络安全领域的企业。距离首次企业遭受勒索软件攻击已过去十年,这种威胁依然持续存在,但信息安全领域提供了稳定的职业前景。Debian发布x86-32架构的最终版本更新13.6和12.15。Joomla扩展iCagenda和Balbooa Forms被利用,存在关键漏洞,影响上百万个网站。Frame,一款用汇编语言编写的新X11服务器,加入了其他X11替代品的行列。Cinnamon 6.8版本可选支持Wayland,而Linux Mint的桌面环境同时提供两种显示服务器支持。KDE Plasma 6.6.6发布,未来版本如6.8将强制要求支持Wayland。Collabora的CODE 26.04版本增强了FOSS办公套件,新增Markdown支持、公式处理及可选的AI集成功能。
Microsoft Agent Framework for Go2 months agohttps://devblogs.microsoft.com/go/microsoft-agent-framework-for-go-public-previe...微软宣布Go语言版智能体框架进入公开预览阶段,用于AI智能体与多智能体工作流开发。该框架旨在支持从单一提示调用转向包含工具、上下文、协调与可观测性的生产级智能体系统。Go SDK可集成到适合使用Go语言的服务、命令行工具、工作进程及云原生应用中。通过'go get github.com/microsoft/agent-framework-go'安装,包含一个使用微软Foundry的示例智能体。示例需配置环境变量(FOUNDRY_PROJECT_ENDPOINT、FOUNDRY_MODEL)并完成Azure身份验证(如执行az login)。预览版功能特性:支持Microsoft Foundry、Azure OpenAI、Anthropic、Gemini、A2A等供应商;提供工具、MCP、中间件;支持多智能体工作流;集成OpenTelemetry追踪。Go SDK将与现有.NET和Python SDK共同发展,预览期间可能根据反馈调整API。
Cdbx.ai – AI-powered browser IDE to describe, build, and publish apps2 months agohttps://cdbx.ai/cdbx是一个基于浏览器的IDE,无需安装设置,拥有完整的Monaco编辑器、实时终端和AI结对编程功能。用户可以用简单的英语描述想法,实时生成应用程序,支持一键发布且无需学习成本。它集成了Notion、GitHub和Slack等外部服务,允许AI按需查询这些服务而无需复制粘贴。智能体贯穿整个工作流程,包括规划、编码、错误修复和带实时预览的UI优化。该平台支持多种编程语言和前端/后端框架,并通过Runner API实现安全的代码执行。定价包含提供基本功能的免费版本,以及Pro/Team套餐,提供更多额度、AI模型和协作工具。
Scarf has moved away from Haskell2 months agohttps://avi.press/posts/2026-07-10-after-7-years-in-production-scarf-has-relucta...由于AI改变了开发经济学,使得编译时间和生态系统摩擦成为显著瓶颈,Scarf从Haskell转向了Python。AI允许更快的代码生成,但Haskell的长编译周期阻碍了快速反馈,特别是在并行AI辅助的工作流程中。这一转变使得开发周期更快、测试覆盖率提高、热修复更迅速,且未因类型安全性降低而出现明显损失。如果Haskell不通过优化快速构建、文档和代理友好型工具来适应AI,将面临停滞风险。
'I'm not a programmer' anymore: Linus Torvalds on the only two tools he uses now2 months agohttps://www.zdnet.com/article/open-source-summit-linus-torvalds/Linus Torvalds 现在将自己视为开发负责人而非程序员,专注于通过拉取请求理解全局并处理合并冲突。他仅使用两个主要工具:Git用于版本控制,电子邮件用于沟通,依靠维护者并避免最后一刻的修复,以保持稳定的发布周期。Torvalds 强调渐进式改进而非华而不实的发布,尽管人工智能生成的错误报告和补丁带来了压力,通常产生垃圾或肤浅的修复。他支持移除过时的硬件和软件,例如停止对 486 SX CPU 和旧网络标准的支持,以减少维护负担。虽然承认 Rust 的价值,但他认为 C 语言更简单且更强大,指出 Rust 无法防止逻辑错误,其保证在混合 C/Rust 代码库中会失效。对人工智能和大型语言模型持谨慎态度;它们可以原型化想法,但经常生成无效的错误报告或临时补丁,需要人工验证和建议修复。Torvalds 重视发现错误,即使是令人尴尬的,而非忽略它们,并将人工智能用于个人项目,比如为旅行中的家庭照片添加哥斯拉。
Kernels: Major Updates2 months agohttps://huggingface.co/blog/revamped-kernelsHugging Face Hub 推出新型“内核”仓库类型,以满足特定计算需求,允许用户浏览加速器、操作系统和后端版本。强化安全措施,包括可信内核发布者、使用 Sigstore的cosign进行代码签名以生成临时密钥,以及通过Nix构建确保可复现性,防止恶意内核执行。重构CLI工具,更好地区分内核与内核构建器,专注于库函数与构建过程,并改进对智能代理内核开发工作流的支持。扩展框架和后端覆盖范围,例如支持Torch Stable ABI和集成Apache TVM FFI,实现跨框架内核互操作性。为智能代理内核开发奠定基础,提供工具支持脚手架、构建、基准测试和优化内核,通过HF Jobs集成进行跨硬件配置的性能测试。其他更新包括简化环境设置脚本、内核系统卡片、通过has_kernel()和get_kernel_variants()进行兼容性检查,以及改进manylinux_2_28支持以解决libstdc++链接问题。
Artificial Adventures3 months agohttps://www.scattered-thoughts.net/writing/artificial-adventures/AI助手在代码审查和发现漏洞方面最有价值,前沿模型表现出色。重构任务受益于AI,降低了修复设计错误的成本,但审查因夹杂错误变更而具有挑战性。与AI协作编码存在问题,因为AI常做出错误决策且忽视指令,但未来的协同框架可能改善这一状况。AI在一次性脚本和小型任务中效果显著——输出易于验证,但在复杂项目(如棋盘游戏规则实现)中表现不佳。搜索与验证任务在需要高精度时运作良好,但对无法验证的答案需保持谨慎。与AI进行头脑风暴易产生平庸建议,现有协同框架存在局限,凸显了改进控制与交互方式的必要性。AI订阅服务性价比较高,但基于令牌的定价可能改变成本效益,更便宜的模型常存在目标偏差或实用性不足。使用AI需要调整实践方法以管理心智模型与验证流程,未来模型能力与工具改进存在潜力。
Mark Zuckerberg tells staff that AI agents haven't progressed enough2 months agohttps://techcrunch.com/2026/07/02/mark-zuckerberg-tells-staff-that-ai-agents-hav...Meta的AI智能体开发进度未如预期加速,尽管已有人员被重新调配至AI团队。CEO马克·扎克伯格承认,近期涉及裁员和岗位调整的人员削减计划执行得不够顺利。扎克伯格对快速适应科技行业变化表示担忧,这推动了公司的重组。Meta以AI为中心的组织结构预期带来的效益尚未显现,但预计未来3到6个月内会有改善。部分工程师负面评价Meta的AI部门工作环境苛刻、要求过高。Meta计划对AI基础设施进行大规模投资,今年支出可能高达1450亿美元。
$85,000 in tokens later: What I learned from scaling agentic coding at Lovable2 months agohttps://lovable.dev/blog/85000-in-tokens-later-scaling-agentic-coding-at-lovable作者加入Lovable后,AI代币使用费从每月600美元激增至每月2.5万美元,自1月以来总支出已达8.5万美元。开发模式从最初仅少数智能体的单打独斗,演变为由专属智能体管理子智能体集群的系统,每周合并PR数量从20-30个提升至150个以上。人工审查现在仅用于RFC和ADR等高影响变更,而非传统代码审查,工作重心转向系统设计和基础设施决策。AI工作流将PR按风险等级(高、中、低)分类,高风险变更强制人工审查,其他采用AI审查,以兼顾规模扩张与风险管理。测试了多种AI审查工具:CI审查作为安全网,本地子智能体审查处理批量工作,但多人共享配置方案尚未解决。PR作为未经验证变更的抽象层仍然有效,堆叠式PR有助于管理上下文和风险,因为大型PR无论对AI还是人类都难以有效审查。管理人与智能体注意力涉及:交互任务使用快速模式,确保任务自主性以减少权限请求,按PR堆栈批量处理验证工作。智能体需要外部任务跟踪器(如Beads),大任务需分解为子智能体处理,小PR避免上下文限制,每个任务使用独立上下文以保持基础卫生。人类与智能体的任务追踪应分开,避免智能体临时文本污染系统,保持Linear等工具的整洁性。改进开发流程需提升智能体编写技能,反思历史工作,通过git共享上下文,鼓励文化分享——尽管技能共享仍具挑战性。作者单周合并293个PR且零生产缺陷,认为生产力提升已超越无辅助开发,代币成本可接受,更关注成果而非效率。这段旅程被描述为充满乐趣,作者期待未来创新,Lovable正在招聘对此方法感兴趣的人才。
Claude's Criminally Bad Electron Mac App Is an Inside Job3 months agohttps://daringfireball.net/2026/07/claudes_criminally_bad_mac_app_is_an_inside_j...Anthropic公司为MacOS推出的Claude桌面应用基于Electron框架开发,该框架常因无法提供原生Mac体验而受到批评。文章指出,尽管Anthropic在AI编程工具(如Claude Code)方面取得了进展,但开发团队选择Electron主要是因为工程师对其较为熟悉——特别是团队中的核心Electron开发者Felix Rieseberg。该评论认为Electron限制了应用的功能和性能,并举例说明Notion已迁移至SwiftUI框架以获得更佳性能,进而质疑Claude为何不采取类似优化方案。
Deep Agent Code Capabilities3 months agohttps://docs.langchain.com/oss/python/deepagents/code/overviewdcode 是一个基于 Deep Agents SDK 构建的开源代码助手。它可与任何大型语言模型配合工作,支持在会话中切换不同提供商。功能包括跨对话的持久化记忆、可自定义技能以及代码执行的审批控制。支持多种内置工具,用于文件操作、shell 执行、网络搜索和任务规划。提供交互式和非交互式模式,包含用于助手和会话管理的 CLI 命令。具备子助手、人工介入审批以及用于可观测性的 LangSmith 追踪等功能。配置存储在 ~/.deepagents/ 目录中,每个助手都有独立的记忆和技能文件夹。在交互式会话中提供斜杠命令,用于模型切换、技能调用和记忆管理。支持远程沙箱执行代码,以及用于外部集成的 MCP 工具。非交互式模式允许自动执行任务,并设有轮次和时间限制等安全措施。