【发布时间】:2022-01-11 09:00:57
【问题描述】:
我在R 中有一个df,其中包含有关俄罗斯杜马政党投票行为的数据。见附图。
每列当前包含 百分比 和 数量 的投票。因此,例如,在第一列的第一行UR_yes,我们看到 95.8% 和 228 гол。 (即英文228票)。在每一列中,我希望后一个数字不带 гол。因此,例如,每个单元格应该只包含一个数字。以第一列为例,这看起来像第一个单元格中的 228,第二个单元格中的 234,第三个中的 235,依此类推。我正在处理很多条目(在 15 个单独的 df 中约有 15,000 个条目),因此这意味着在 Excel 中手动编辑这些条目会很困难。有没有办法在R 中自动化这个过程?任何建议将不胜感激。
【问题讨论】:
-
如果您包含一个简单的reproducible example,其中包含可用于测试和验证可能解决方案的示例输入和所需输出,则更容易为您提供帮助。请不要将数据共享为图像,否则我们需要重新输入所有内容以测试任何可能的建议。
-
您能否在问题文本中将
dput(head(YOUR_TABLE))的输出作为代码分享?这将生成代码,创建前 6 行数据的完美副本,供人们测试潜在解决方案,而无需重新输入数据并猜测您的数据格式。
标签: r dataframe data-cleaning