LLMs can now identify public figures in images
2 days ago
- 多模态大语言模型能够从图像中提取结构化语义数据,以便更好地分类、标记和搜索。
- ChatGPT和Claude因AI安全策略和从人类反馈中强化学习训练而拒绝识别像巴拉克·奥巴马这样的公众人物,而Gemini则没有这种犹豫。
- 在六种大语言模型的测试中,Gemini在准确识别公众人物方面始终优于其他模型,包括在合影和服饰照片等具有挑战性的场景中。
- GPT和Claude拒绝识别公众人物的行为可以通过提示工程技巧绕过,例如指示模型在其输出前添加前缀。
- 大语言模型识别人的准确性各不相同,有些模型会幻觉出错误身份(例如,Mistral将普莉希拉·陈误认为雪莉·桑德伯格)。
- Gemini的卓越表现归功于谷歌从其搜索引擎获取的海量训练数据,在识别不同领域的公众人物方面实现了超过90%的准确率。
- 存在一个伦理问题:随着模型改进和从人类反馈中强化学习规则变得宽松,大语言模型未来可能识别非公众人物。