【发布时间】:2012-12-28 11:55:04
【问题描述】:
我正在编写一个网页抓取程序以从网站获取我的成绩。我使用 Mechanize 登录页面并导航到我正在抓取的区域。不幸的是,该页面使用 Javascript 来加密页面(可能是为了阻止我抓取)。我找到了解密脚本并移植到 Python。它可以工作,我用它从页面中提取加密字符串,当我转换它时,它变成了 HTML 中的表格。
那么,说到我的意思,有没有办法将 HTML 注入页面并使用 mechanize 使用表格上的链接来获取我的成绩?
感谢您的帮助!
编辑:我也有美味的汤,如果有帮助的话。
【问题讨论】:
-
您想将一些代码注入外部网站?
-
只使用 selenium,它更简单。
-
@feeela 不,我想在本地(我认为)临时注入原始页面并使用机械化导航。或者找到一种使用 mechanize 以某种方式在 HTML 字符串本身中导航的方法。
-
如果您不想看到它四处移动,可以将硒与虚拟显示器一起使用。
-
@EpicDavi 这就是它的设计目的。所以你的目标是解析一些 HTML 来找到你的标记,但为了做到这一点,你必须在原始 html 变得可读之前插入一些 html?
标签: javascript python html web-scraping mechanize