【发布时间】:2017-09-07 18:30:54
【问题描述】:
这段代码曾经为我工作。
from bs4 import BeautifulSoup
from urllib.request import urlopen
search = 'some_website'
BeautifulSoup(urlopen(search), "lxml")
但现在我收到以下错误。
HTTPError: HTTP Error 403: Forbidden
我不能做一个简单的请求,因为我需要抓取 javascript 信息。
hdr = {'User-Agent': 'Mozilla/5.0'}
req = Request(site,headers=hdr)
page = urlopen(req)
soup = BeautifulSoup(page)
print(soup)
我在汤里得到以下。
<noscript>Please enable JavaScript to view the page content.</noscript>
当我收到“HTTP Error 403: Forbidden”错误时,如何从网页中删除 JavaScript?提前感谢您的帮助。
我正在使用 python 3。如果您需要更多信息,请告诉我。
【问题讨论】:
-
from PyQt5.QtWebKitWidgets import QWebPage此代码在最新版本的 PyQt5 中不起作用。有谁知道他们是否有类似的替代方案来使用“QWebPage”?
标签: javascript python-3.x web-scraping beautifulsoup