【发布时间】:2012-01-19 06:23:23
【问题描述】:
我编写了一个爬虫,它会爬过一个名为 fid 的文件夹,并提取所有子文件夹的名称作为链接。现在的问题是这些子文件夹中的每一个都有一个 html 页面,我想提取所有这些 html 文件的名称并添加到当前的“start_urls”,这样我就可以从所有这些 html 中刮出所需的信息页。我试过了:
os.listdir()
glob.glob()
但这些都不起作用。请帮我解决这个问题。
【问题讨论】:
-
您能提供一些代码作为起点吗?