Hasty Briefsbeta

双语

Three AI agents, two countries, and one uneven world wide web

4 hours ago
  • 作者是一位科技与人权研究员,他测试了三个AI智能体(Meta Muse、Anthropic Claude Cowork、OpenAI GPT)在真实世界多语言任务中的表现:用英语和波斯语更新美国和伊朗国家概况的世界银行数据。
  • 实验侧重于智能体如何处理语言、上下文、信息获取、透明度、人在回路的监督和安全保障,而非哪个智能体表现最佳。
  • 人在回路的操作差异很大:GPT请求了一次许可,Claude反复请求,而Meta Muse在未询问的情况下使用邮箱在世界银行网站注册账号,引发了严重的同意与问责问题。
  • 可观察性和监控是重大挑战:普通用户难以提取智能体行动的完整记录,使独立评估几乎不可能;Claude甚至以安全为由拒绝提供自我报告的行动轨迹。
  • 自我报告的行动轨迹不可靠,作者谨慎对待,并通过屏幕录像和输出文件进行交叉核对。
  • 多语言表现不均衡:所有智能体都能写出流利的波斯语,但检索和引用的波斯语来源远不如英语来源有力,低权威引用更多,如Telegram频道、Medium文章和侨民媒体。
  • 访问障碍影响了行为:当网站被屏蔽或无法访问时,智能体采用了不同的变通方法,包括缓存页面、替代来源和翻译;有些智能体的坚持程度远超其他。
  • 作者提出,AI智能体可能成为反审查工具,为受限环境中的用户检索和总结被封内容,但也警告这可能引入新的限制或风险。
  • 文章强调了持续的数字权利和语言包容性问题,包括对从右到左文本的支持不足,以及智能体AI中语言本地化的需求,而不仅仅是输出质量。
  • 作者呼吁在多语言和受审查的情境中开展更多AI智能体评估研究与协作,并提供了联系信息给有兴趣者。