【发布时间】:2019-04-07 10:19:15
【问题描述】:
我编写了一个 python 脚本,它创建了一个包含三行数字的文本文件;
4.54 67.66 71.27 NaN ,4.54 304.53
9.06 14.08 39.56 NaN ,4.54 307.65
3.85 61.22 90.14 108.13 ,6.13 400.50
它是由不同文本文件产生的串联数据框。会有大量重复的数字,一些空元素等,所以我想按升序对它们进行排序并去掉所有重复。
对于排序,我尝试使用df.sort_values,但不知道如何对值进行排序;不考虑列名左右,逐行升序排列..
对于重复,我最初搜索 pandas 来处理这个问题(例如,df.drop_duplicates,转置数据然后选择重复/重新索引等);但我只想删除每行中的重复值...我已经被困在同一个地方好几天了,并使用 excel 手动删除重复项。有什么方法可以解决这个问题吗?
提前感谢您提供的任何帮助!
【问题讨论】:
-
连续“摆脱”重复是什么意思?将重复单元格更改为
null?NaN? -
"转置数据" 你是说你这个文本文件是“向后”保存的,就像它是行/列而不是列//行?
-
哦,等等。我认为他正在尝试删除是否需要将任何列分开。像每列一样作为一个表?我走远了吗?
-
@Jaba 我正在尝试删除每行的任何重复单元格/条目;被认为是分开的。对于“转置”部分,是的,它是从一组 txt 文件中提取的数据集(因此半决赛数据 = 列中的 concat),最终结果应保存在 3 行中;因此我把它全部转置了。对造成的任何混乱表示歉意!
标签: python pandas sorting duplicates