【问题标题】:About Data Cleaning关于数据清理
【发布时间】:2023-02-19 03:25:46
【问题描述】:

我是一名非常业余的数据科学专业学生,我正在从事一个项目,在该项目中,我比较了基于团队的游戏中的两台服务器,但我的两个数据集的格式彼此不同。例如,一列是第一滴血,其中一组数据将此信息存储为“blue_team_first_blood”并存储为 True 或 False,而另一列仅将其存储为“第一滴血”并存储整数,(1 代表蓝队, 2 代表红队,0 代表没有人(如果适用)

我觉得我可以围绕这些差异进行编码,但最佳做法是什么?我应该采取额外的步骤来确保两个数据集的格式正确,还是根本不重要?

【问题讨论】:

  • 如果您在开始分析之前清理数据以确保它们采用相同的格式,从长远来看,您会节省很多时间。

标签: python sql pandas data-science data-analysis


【解决方案1】:

数据清理通常是任何数据科学项目的第一步。在任何进一步的处理步骤之前将数据转换为一致的格式是有意义的。

【讨论】:

    【解决方案2】:

    您可以考虑将“blue_team_first_blood”列转换为与其他数据集一致的整数格式,例如 1 表示 True,0 表示 False。您还可以考虑将第二个数据集中的“first blood”列重命名为“blue_team_first_blood”以匹配第一个数据集。

    总的来说,最佳做法是确保两个数据集的格式一致,并且采用对您的分析有意义的方式。这将使比较两个数据集并得出有意义的见解变得更加容易。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-04-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多