【问题标题】:Python Webscrape website with javascript使用 javascript 的 Python Webscrape 网站
【发布时间】:2017-09-07 18:30:54
【问题描述】:

这段代码曾经为我工作。

from bs4 import BeautifulSoup
from urllib.request import urlopen

search = 'some_website'
BeautifulSoup(urlopen(search), "lxml")

但现在我收到以下错误。

HTTPError: HTTP Error 403: Forbidden

我不能做一个简单的请求,因为我需要抓取 javascript 信息。

hdr = {'User-Agent': 'Mozilla/5.0'}
req = Request(site,headers=hdr)
page = urlopen(req)
soup = BeautifulSoup(page)
print(soup)

我在汤里得到以下。

<noscript>Please enable JavaScript to view the page content.</noscript>

当我收到“HTTP Error 403: Forbidden”错误时,如何从网页中删除 JavaScript?提前感谢您的帮助。

我正在使用 python 3。如果您需要更多信息,请告诉我。

【问题讨论】:

  • from PyQt5.QtWebKitWidgets import QWebPage 此代码在最新版本的 PyQt5 中不起作用。有谁知道他们是否有类似的替代方案来使用“QWebPage”?

标签: javascript python-3.x web-scraping beautifulsoup


【解决方案1】:

QtWebKit 在 Qt 5.5 中被上游弃用并在 5.6 中被删除。

您可能想要切换到 PyQt5.QtWebEngineWidgets。 link

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-01-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多