Hasty Briefsbeta

双语

Predicting Average IMDb Movie Ratings Using Text Embeddings of Movie Metadata

19 hours ago
  • 一名Reddit用户在提交了一个用于预测IMDb电影评分的神经网络模型作为回家作业后,被拒绝获得数据科学职位,引发了关于模型可解释性的讨论。
  • 作者探索使用LLM嵌入(来自阿里巴巴的gte-modernbert-base)对电影元数据进行编码,然后构建预测模型,发现从零训练的小型LLM取得了最佳测试MSE 1.026。
  • 传统模型如SVM(MSE 1.087)和基于嵌入的MLP(MSE 1.074)表现良好,但训练专用LLM超越了它们,尽管过拟合是一个挑战。
  • 作者使用Polars进行高效数据处理,UMAP进行可视化,以及GPU加速(cuML)进行模型训练,强调了基于嵌入的方法在数据科学任务中的实用性。