【发布时间】:2020-12-29 17:04:14
【问题描述】:
我无法像通常那样下载文章来实例化 Article 对象,如下所示:
from newspaper import Article
url = 'http://fox13now.com/2013/12/30/new-year-new-laws-obamacare-pot-guns-and-drones/'
article = Article(url)
article.download()
article.top_image
但是,我可以从请求中获取 HTML。我可以使用这个原始 HTML 并以某种方式将其传递给 Newspaper 以从中提取图像吗? (以下是尝试,但不起作用)。谢谢
from newspaper import Article
import requests
url = 'http://fox13now.com/2013/12/30/new-year-new-laws-obamacare-pot-guns-and-drones/'
raw_html= requests.get(url, verify=False, proxies=proxy)
article = Article('')
article.set_html(raw_html)
article.top_image
【问题讨论】:
-
为什么不起作用?你得到哪个错误?
-
我无法将公司的内部 SLL 证书密钥注入到我的请求中。该问题正在调查中。唯一的解决方法是手动发出请求并传递
verify=False,这给了我原始 HTML
标签: python extract python-newspaper newspaper3k