【发布时间】:2019-11-19 13:31:05
【问题描述】:
我有一个包含很多页面的文档,我正在尝试提取每页的前 3 行。
我这样做,我的输出是多个列表,例如:
['hello','','data']
['hello','','data']
['test','','data']
我想删除任何匹配的列表,例如,第 1 页和第 2 页有相同的 3 行。我想从相关页面的原始文档中删除这 3 行。我该怎么做呢?
到目前为止,我已经尝试过使用集合和交集功能。示例:
for item in line_list:
common = list(set(line_list[0]).intersection(line_list[2:]))
print (common)
我在这里得到的只是空列表。我认为这可能是我的语法,但不确定。谁能给点建议?
【问题讨论】:
-
您只想保留 ['hello','','data'], ['test','','data']?无法真正理解您要实现的目标
-
不,我想从我的整页数据中删除常用列表。因此,如果没有带有
['test','','data']的公共页面,则此列表可以保留,并且循环将检查文档的下一页