【发布时间】:2017-03-29 06:17:29
【问题描述】:
我想在 python 中解析 robots.txt 文件。 我已经探索了 robotParser 和 robotsExclusionParser,但没有什么能真正满足我的标准。我想一次性获取所有 diallowedUrls 和 allowedUrls,而不是手动检查每个 url 是否允许。有没有图书馆可以做到这一点?
【问题讨论】:
-
请问robot.txt包含什么,解析文本文件是什么意思?
-
robots.txt 是每个站点地图支持都遵循的标准。站点地图:使我们的内容可搜索。
-
好吧,现在更有意义了,也许你应该在你的问题中为不熟悉这个概念的其他人链接到这个。
-
由于robot.txt数据在
<pre>标签中,这里不能使用html解析,有一个备用选项disallow = [ i for i in data.split('\n') if 'Disallow' in i]
标签: python robots.txt