【发布时间】:2020-07-09 04:11:48
【问题描述】:
我目前正在学习使用 Facebook FastText 进行文本分类。我从 Kaggle 中发现了一些包含 �� 或 twitter 用户名和主题标签等字符的数据。我尝试在网上搜索,但是没有说明在训练模型之前您真正需要如何清理/预处理文本。
在一些博客中,我看到作者写过关于标记化的文章,但在 fasttext 中没有提到它。另一点是fasttext git有干净数据的例子,比如stackoverflow,但对于twitter或这样的平台没有。
问题是,在训练模型之前预处理用户(社交)生成的内容的最佳做法是什么?需要编辑什么?
谢谢
【问题讨论】:
标签: machine-learning nlp text-classification fasttext