LLM's as a Different Kind of Intelligence3 months agohttps://handmadeoasis.com/llms-as-a-different-kind-of-intelligence/LLMs代表了一种不同于人类智能的新型智能。诸如‘初级工程师’或‘抽象层’之类的人类类比是有缺陷的,因为LLMs缺乏意图和确定性推理能力。LLMs结合了海量知识和无法理解意图的特点,导致随着时间的推移逐渐偏离用户目标。LLMs的概率性行为挑战了软件工程中确定性的基础。有效使用LLMs需要学习其独特的失败模式,而非强行套用熟悉的类比。
Model Training as Code3 months agohttps://aleph-alpha.com/en/blog/model-training-as-code/模型训练的复杂性需要专业团队,而人工协调效率低下。Aleph Alpha的Savanna平台实现了模型训练即代码(MTaC),支持密封式一键训练运行。手动训练容易导致人为错误、学习成果丢失以及团队责任分散。MTaC通过版本控制实现可组合性、共识达成和基于代码历史的来源追溯。Savanna采用基于主干的开发、持续集成验证和不可变工件版本管理。该系统支持带缓存的超参数扫描,避免重复计算。平台基于Flyte在Kubernetes上运行,具备工件追踪和实时监控功能。MTaC提升了迭代速度、便于团队重组并支持自动化研究。
Most rewrites serve the engineer, not the business3 months agohttps://anatoliybabushka.com/blog/when-to-rewrite-working-code.html重写通常优先考虑工程师的偏好而非业务价值,正如将CakePHP应用迁移至Laravel却无实质效益的例子所示。现有代码承载了历史知识和错误修复;重写可能重新引入过去的问题,并丢失Joel Spolsky所记录的宝贵'伤疤组织'。对代码库或框架不熟悉可能导致误判;在认定代码'损坏'前,假设先前开发者做过合理选择至关重要。重写的合理理由包括运行时环境生命周期结束、关键人员流失、功能开发成本过高,或业务需求超出当前设计承载能力。人工智能能加速代码生成,但可能忽略过去修复的上下文,导致旧错误重现,并使重写循环持续,未能解决根本原因。要打破重写循环,需清晰记录代码决策背后的逻辑,确保未来工程师或AI模型理解'为什么',而不仅仅是'是什么'。
Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers3 months agohttps://senior-swe-bench.snorkel.ai/高级SWE-Bench将代理视为高级工程师,采用真实、自然的语言指令,而非过度细化的需求。它引入了一个验证代理,用于编写行为测试来评估任务,并能适应提交的解决方案。Bug任务基于棘手的用户报告,需要运行时调查,例如调试日志和复现步骤。评分结合了运行时正确性测试和质量指标,以评估优雅的代码解决方案。任务来源于多样化仓库的PR,涉及多阶段、多堆栈的功能或bug,需要进行大量的运行时调查。指令自然且不够具体,其长度中位数仅为SWE-Bench Pro的31%。功能任务可能跨越多个服务,平均每个任务涉及11个文件,并且是长期性的,需要数百个步骤来完成。排行榜显示了表现最佳的模型,如Claude Opus 4.8,其解决率达到24.0%,而前沿模型的失败率超过75%。