【问题标题】:Injecting HTML into a page using Mechanize使用 Mechanize 将 HTML 注入页面
【发布时间】:2012-12-28 11:55:04
【问题描述】:

我正在编写一个网页抓取程序以从网站获取我的成绩。我使用 Mechanize 登录页面并导航到我正在抓取的区域。不幸的是,该页面使用 Javascript 来加密页面(可能是为了阻止我抓取)。我找到了解密脚本并移植到 Python。它可以工作,我用它从页面中提取加密字符串,当我转换它时,它变成了 HTML 中的表格。

那么,说到我的意思,有没有办法将 HTML 注入页面并使用 mechanize 使用表格上的链接来获取我的成绩?

感谢您的帮助!

编辑:我也有美味的汤,如果有帮助的话。

【问题讨论】:

  • 您想将一些代码注入外部网站?
  • 只使用 selenium,它更简单。
  • @feeela 不,我想在本地(我认为)临时注入原始页面并使用机械化导航。或者找到一种使用 mechanize 以某种方式在 HTML 字符串本身中导航的方法。
  • 如果您不想看到它四处移动,可以将硒与虚拟显示器一起使用。
  • @EpicDavi 这就是它的设计目的。所以你的目标是解析一些 HTML 来找到你的标记,但为了做到这一点,你必须在原始 html 变得可读之前插入一些 html?

标签: javascript python html web-scraping mechanize


【解决方案1】:

我最终只使用了这个:

response = br.open("www.linknotonpagethatiwanttogoto.com")
page = response.read()

我发现您将链接的 .open() 存储为响应,而不是使用 .follow_link()。此外,浏览器使用相同的 cookie,因此会话 cookie 被保留。因此,在解析完 html 后,我将链接弹出到 .open() 并获得了新页面。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-07-14
    • 2023-03-05
    • 2013-04-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多