【发布时间】:2020-09-23 21:40:29
【问题描述】:
我正在尝试读取 robots.txt 文件并确定是否允许机器人读取特定页面。
import urllib.robotparser as urobot
import urllib.request
url = "https://example.com"
rp = urobot.RobotFileParser()
rp.set_url(url + "/robots.txt")
rp.read()
if rp.can_fetch("*", URL):
#do something
else:
# else do something
虽然上述程序对大多数 URL 运行良好,但它在 rp.read()
处挂起其中的几个它只是在 read() 处挂起,不会抛出任何异常。
【问题讨论】:
标签: python-3.x robots.txt