【问题标题】:How to extract elements (title names, votes, views, answers for each title) from https://stackoverflow.com/?tab=month?如何从 https://stackoverflow.com/?tab=month 提取元素(标题名称、投票、视图、每个标题的答案)?
【发布时间】:2018-05-01 04:05:16
【问题描述】:

我可以弄清楚读取页面并将文本存储到文件部分(urllib2),但不能确定元素的提取(votestitle,...)。 页面是https://stackoverflow.com/?tab=month

如何编写python脚本来获取网页然后提取所有标题,不。每个问题收到的意见、投票和答案?

【问题讨论】:

  • 你试过了吗?
  • 是的,我可以使用 urllib2 提取内容,但提取的元素并不是我希望的那样。
  • 请发布您拥有的代码并描述什么不起作用。
  • 不要刮,它不礼貌和笨拙,使用 API:api.stackexchange.com/docs/questions 注意sort 参数:month – 通过公式排序月份标签跨度>

标签: python python-3.x file dictionary


【解决方案1】:

如果你想爬取页面,你可以使用像 scrapy 这样的库,但是 stackoverflow 有非常好的和易于使用的 REST API,带有排序功能,你可以在这里访问和阅读: https://api.stackexchange.com/docs/ 例如,对于检索问题,请参阅此页面: https://api.stackexchange.com/docs/questions

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-07-10
    • 1970-01-01
    • 2017-11-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多