7 hours ago
- 一名学生使用余弦相似度对高频词进行分析,以检测黑客新闻上的相似或虚假账户。
- 作者使用Redis向量集和伯罗斯-德尔塔技术复现了该方法。
- 数据预处理包括下载黑客新闻评论,将Parquet文件转换为带有用户词频表的JSONL格式。
- 伯罗斯-德尔塔方法计算相对频率,然后使用每个词的全局均值和标准差计算z分数。
- 最佳高频词数量在150到500之间;使用过多词会捕捉内容而非写作风格。
- 验证表明,将用户的评论分成两组并进行比较,能够正确识别同一用户。
- 向量可视化揭示了过度使用和未充分使用的词,突出了母语与非母语使用者之间的差异。
- 代码和演示站点已提供,通过词数过滤有助于检测虚假或一次性账户。