【问题标题】:training fasttext models with social generated content使用社交生成内容训练 fasttext 模型
【发布时间】:2020-07-09 04:11:48
【问题描述】:

我目前正在学习使用 Facebook FastText 进行文本分类。我从 Kaggle 中发现了一些包含 �� 或 twitter 用户名和主题标签等字符的数据。我尝试在网上搜索,但是没有说明在训练模型之前您真正需要如何清理/预处理文本。

在一些博客中,我看到作者写过关于标记化的文章,但在 fasttext 中没有提到它。另一点是fasttext git有干净数据的例子,比如stackoverflow,但对于twitter或这样的平台没有。

问题是,在训练模型之前预处理用户(社交)生成的内容的最佳做法是什么?需要编辑什么?

谢谢

【问题讨论】:

    标签: machine-learning nlp text-classification fasttext


    【解决方案1】:

    由于 FastText-Classifier 不适用于预训练嵌入,您几乎可以选择自己的方式来清理数据。我建议你:

    • 将所有内容转换为小写(如果需要,也可以转换为大写)。

    • 我会删除 # 和 @ 旁边的特殊字符。

      其他一切由您决定。您可以决定保留或删除主题标签,用户名也是如此。我可能会删除用户名,因为我猜其中没有太多信息。但在某些情况下,它可能会提供信息:想想关于唐纳德特朗普的推文和回答,我猜他的用户名经常被使用。只需尝试最适合您的情况的方法。 FastText 速度超级快,因此进行几次实验不会有太大问题。

    【讨论】:

    • 谢谢,有道理。我同意用户名点,这取决于用例。
    猜你喜欢
    • 2021-03-29
    • 2019-02-04
    • 1970-01-01
    • 1970-01-01
    • 2021-09-01
    • 2021-12-19
    • 1970-01-01
    • 2017-08-19
    • 2020-09-03
    相关资源
    最近更新 更多