【发布时间】:2021-04-22 22:52:18
【问题描述】:
我是编码新手,并且已经完成了一个简单的程序,可以在网络上抓取一些股票网站以获取特定数据。简化后的代码如下所示:
headers = {'User-Agent': 'Personal_User_Agent'}
fv = f"https://finviz.com/quote.ashx?t=JAGX"
r_fv = requests.get(fv, headers=headers)
soup_fv = BeautifulSoup(r_fv.text, 'html.parser')
fv_ticker_title = soup_fv.find('title')
print(fv_ticker_title)
在我创建用户代理之前,该网站无法运行,但后来它运行良好。然后我通过 python 的本地主机创建了一个网站,它也运行良好,所以我认为我已经准备好通过“python 任何地方”将网站公开。
但是,当我去创建公共网站时,每次我通过网络抓取(即使用 user_agent)访问信息时,程序都会关闭。我不喜欢将我的用户代理用于公共领域的想法,但是当公共领域需要用户代理时,我不知道其他网络抓取的人如何解决这个问题。有什么建议!?
【问题讨论】:
标签: python html web-scraping error-handling user-agent