【发布时间】:2023-02-19 03:25:46
【问题描述】:
我是一名非常业余的数据科学专业学生,我正在从事一个项目,在该项目中,我比较了基于团队的游戏中的两台服务器,但我的两个数据集的格式彼此不同。例如,一列是第一滴血,其中一组数据将此信息存储为“blue_team_first_blood”并存储为 True 或 False,而另一列仅将其存储为“第一滴血”并存储整数,(1 代表蓝队, 2 代表红队,0 代表没有人(如果适用)
我觉得我可以围绕这些差异进行编码,但最佳做法是什么?我应该采取额外的步骤来确保两个数据集的格式正确,还是根本不重要?
【问题讨论】:
-
如果您在开始分析之前清理数据以确保它们采用相同的格式,从长远来看,您会节省很多时间。
标签: python sql pandas data-science data-analysis