【发布时间】:2019-07-13 02:00:32
【问题描述】:
我有许多 gz.tar 压缩文件的主文件夹。所以我需要解压缩两次才能得到一个带有文本的数据文件,然后我在文本中提取某个字符串。我无法解压缩以获取带有文本的文件,然后移至下一个文件并执行相同操作。将结果保存在数据框中。
import os
import tarfile
for i in os.listdir(r'\user\project gz'):
tar = (i, "r:gz")
for m in tar.getmembers():
f= tar.extractfile(member):
if f is not None:
content = f.read()
text = re.findall(r"\name\s", content)
df = pd.Dataframe(text)
print(df)
【问题讨论】:
-
试试内置模块
tarfile? -
@james Liu 是的,我导入了 tarfile。但还是卡住了
-
当我解压缩两次时,每个文件中有 50 个左右的文件。我只需要一个 .txt 文件来运行字符串搜索。
标签: python jupyter-notebook filereader tar gzip