【问题标题】:How to train and test data for classification using Machine learning algorithms如何使用机器学习算法训练和测试数据以进行分类
【发布时间】:2019-10-26 21:03:30
【问题描述】:

我从 Twitter API 收集了推文。推文没有标签,我不知道如何开始?所有教程都已经标注了数据。如何标注数据?只能手动标记吗?任何回答我的疑问的好教程都会有很大帮助。

【问题讨论】:

  • 这是一个非常广泛的问题,在您的情况下,您可能希望使用自然语言方法来标记您的推文,因为这取决于您采用哪种方法。您可能需要数千个标记数据。例如,您可以尝试在每条推文中选择具有较高 TF-IDF 的词。
  • 我需要好的教程形式的帮助
  • 欢迎来到 SO;请花一些时间阅读What topics can I ask about here?,并注意要求我们推荐或查找书籍、工具、软件库、教程或其他场外资源的问题与 SO 无关。

标签: python-3.x machine-learning training-data test-data


【解决方案1】:

我假设当您从 Twitter API 中提取数据时,它是 JSON 格式的。使用键、值对作为您的数据框标题和值。现在对于标签部分,这取决于您对数据集的用途。如果你想做情绪分析,那么你需要手动标记数据集(或者只是从互联网上下载预先标记的 twitter 数据集)。

供参考here 是关于如何挖掘和处理原始数据、获得洞察力和应用聚类算法的精彩教程。希望对您有所帮助!

【讨论】:

  • 数据在 .csv 中
  • 如果数据在 .csv 中,则手动标记它,将其存储在数据框中或仅查看数据。顺便说一句,在训练模型时,标签并不重要。如果您需要这方面的代码,请回复。或分享.csv以获得更好的图片。
猜你喜欢
  • 2020-02-21
  • 2016-12-03
  • 2019-07-03
  • 2020-07-01
  • 2015-12-21
  • 2017-07-11
  • 2014-04-21
  • 2022-01-19
  • 1970-01-01
相关资源
最近更新 更多