The Scientific Literature Is Poisonous to LLMs
9 hours ago
- 21世纪的科学文献被认为对训练有用的LLM是有毒的,因为普遍存在的不诚实、半真半假的说法以及对指标的操纵。
- 一项2024年的研究发现,从训练数据中移除ArXiv、PhilPapers和NIH ExPorter后,LLM性能提升且有毒输出减少,这表明科学文章损害了模型质量。
- 科学元数据(作者信息、引用)已被操纵且不可靠,而知名机构也不能幸免于不当行为。
- AI代理无法获取人类科学家用于验证工作的非正式社交网络和声誉信息。
- 潜在的解决方案包括创建与科学家社交的AI代理、记录非正式讨论或激励八卦,尽管这些引发了监控方面的担忧。