【发布时间】:2014-11-07 18:56:31
【问题描述】:
我正在尝试将 Newspaper 库用于简单的新闻抓取工具。 http://newspaper.readthedocs.org/
得到这样的文章列表后:
cnn_paper = newspaper.build('http://cnn.com')
我只想获取特定类别的文章。虽然我可以看到可用的类别,但我找不到按下载类别过滤我拥有的文章的方法。
我该怎么做?
【问题讨论】:
标签: python web-scraping
我正在尝试将 Newspaper 库用于简单的新闻抓取工具。 http://newspaper.readthedocs.org/
得到这样的文章列表后:
cnn_paper = newspaper.build('http://cnn.com')
我只想获取特定类别的文章。虽然我可以看到可用的类别,但我找不到按下载类别过滤我拥有的文章的方法。
我该怎么做?
【问题讨论】:
标签: python web-scraping
如果我理解正确,你想检索给定类别的文章,那么我想应该是这样的(如果我弄错了,对不起):
import newspaper
cnn_paper = newspaper.build('http://cnn.com')
for category in cnn_paper.category_urls():
cat_paper = newspaper.build(category)
print cat_paper.articles #Gives all articles of category
for article in cat_paper.articles:
print article.url #prints URL for all articles in given category
【讨论】: