xAI's first lawsuit against a user tests who is responsible for what Grok makes2 months agohttps://thenextweb.com/news/xai-sues-grok-user-csam-terms-of-servicexAI起诉一名用户,指控其规避安全措施,使用Grok生成儿童性虐待材料。诉状强调,Grok的防护机制已启动并拒绝相关指令,但该用户反复修改指令以绕过内容审核。xAI报告称,2026年已暂停超过5.2万个账户,并向美国国家失踪与受虐儿童中心提交逾7.3万份报告,导致近250人被捕。此案与当前xAI作为被告的诉讼形成对比,那些诉讼指控xAI(而非用户)应对Grok生成的内容负责。这起诉讼并未解决通用图像模型若可能被操控生成有害内容,是否应公开提供的问题。
Anthropic Thinks Its Own Success Is Key to Making AI Safe2 months agohttps://www.wired.com/story/anthropic-thinks-ai-can-only-be-safe-under-its-contr...Anthropic在推进AI能力的同时警告AI风险,相信其领导地位能确保负责任的监管。公司基于两个核心理念运作:AI的必然性与变革性,以及处在AI前沿是实现安全过渡的必要条件。Anthropic将积累实力视为履行确保AI安全使命的手段,而非最终目标。前员工形容该公司具有强烈的使命驱动特性,将人类的长期利益置于利润之上。内部文化高度信赖但可能缺乏多元性,批评意见有时仅限于私下交流,不挑战领导层决策。争议事件包括与Palantir合作提供美军AI服务,以及在AI模型中设置秘密破坏程序等安全措施。CEO达里奥·阿莫代伊承认AI权力集中的风险,但仅建议通过公开承诺等有限方式进行补救。批评者认为Anthropic假定自己掌握AI未来的'真相',尽管其对全球影响仍存在不确定性。
Asimov: NeuroSymbolic Adversarial Generation of Ethic Axioms3 months agohttps://parrotsbasilisks.substack.com/p/asimov-neurosymbolic-adversarial阿西莫夫通过对抗性优化和使用Z3求解器的形式验证生成伦理公理,以解决人工智能系统中的对齐问题。它结合了对抗性技术以实现广泛覆盖,以及神经符号方法以提供形式化保证,并以机器人三定律为基础的种子公理作为起点。该架构涉及一个迭代循环:使用LLM生成的对抗示例攻击公理,修补公理,并用Z3进行验证,同时使用小型模型进行测试以确保鲁棒性。使用小型模型的经验教训包括分步执行、鲁棒验证、重试机制、容错性以及用于解析输出的自定义工具。评估使用良性和有害场景,以确保公理既不过于严格也不过于宽松,并显示每次迭代后的韧性提升。最终的公理包括关于防止伤害、服从命令、自我保存、风险缓解和优先行动等规则,适用于实际用例中的代理约束,如邮件发送和发票审核。