【问题标题】:Python Data Crawler to MySQL DATABASEPython 数据爬虫到 MySQL 数据库
【发布时间】:2014-06-06 16:11:35
【问题描述】:

我正在尝试在页面源中检索一些看起来像这样的数据: “日期”:“2011-04-03T00:00:00.000Z”, “排名”:55182 }, { “日期”:“2011-04-10T00:00:00.000Z”, “排名”:23649 }, { “日期”:“2011-04-17T00:00:00.000Z”, “排名”:26064 }, { “日期”:“2011-04-24T00:00:00.000Z”, “排名”:18373 }, { “日期”:“2011-05-01T00:00:00.000Z”, “排名”:18073 }, { “日期”:“2011-05-08T00:00:00.000Z”, “排名”:15539 }, { “日期”:“2011-05-15T00:00:00.000Z”, “排名”:14562 }, { “日期”:“2011-05-22T00:00:00.000Z”, “排名”:18921 }, { “日期”:“2011-05-29T00:00:00.000Z”, “排名”:10849 }, { “日期”:“2011-06-05T00:00:00.000Z”, “排名”:5871 }, { “日期”:“2011-06-12T00:00:00.000Z”, “排名”:3804 }, { “日期”:“2011-06-19T00:00:00.000Z”, “排名”:8243 }, { “日期”:“2011-06-26T00:00:00.000Z”, “排名”:9688 }, { “日期”:“2011-07-03T00:00:00.000Z”, “排名”:11592 }, { “日期”:“2011-07-10T00:00:00.000Z”, “排名”:11508 }, { “日期”:“2011-07-17T00:00:00.000Z”, “排名”:10405 }, { “日期”:“2011-07-24T00:00:00.000Z”, “排名”:10080 }, { “日期”:“2011-07-31T00:00:00.000Z”, “排名”:10392 }

我想使用 Python 爬虫从网站检索这些数据,我需要将数据存储在 MYSql 数据库中。

我该怎么做呢? 我需要根据数据库中的日期值存储 52 周。 该网站目前还安装了验证码。

我将如何绕过验证码,我应该制作 52 列数据来存储它吗?

【问题讨论】:

    标签: python mysql sql date web-crawler


    【解决方案1】:

    尝试的一个好方法是使用 urllib2:https://docs.python.org/2/library/urllib2.html 该网页可能使用 cookie 来检查您是否完成了验证码步骤,所以首先手动执行验证码部分,获取所有 cookie 等并使用 urllib 模拟真实浏览器和用户。如果这不起作用,那么您可以尝试绕过 catpcha,例如找到一个 json 文件,该文件允许您将值(在 url 中)传递给服务器,然后将正确的 json 文件发送给您。

    【讨论】:

    • 我需要自动化这个获取这个 Json 数据的过程。目前有 800 多个链接我必须从中获取数据。此外,来自链接的数据每周更新一次。我需要一种方法来根据特定日期条件存储链接,然后为每个链接存储大约 50 个 json 值。
    【解决方案2】:

    我实际上是使用 Selenium 或 HTMLAgilityPack 和正则表达式来实现的。我检索页面的 DOM,然后使用正则表达式解析文档,直到找到所需的数据。完成后,将数据存储在变量中并使用数据。我选择的语言是 C#。

    【讨论】:

      猜你喜欢
      • 2011-10-24
      • 2012-08-08
      • 2019-12-20
      • 1970-01-01
      • 2023-01-26
      • 1970-01-01
      • 2012-05-16
      • 1970-01-01
      • 2015-07-13
      相关资源
      最近更新 更多