【问题标题】:Python scrape all javascript mailtoPython 抓取所有 javascript mailto
【发布时间】:2019-11-21 03:02:03
【问题描述】:

我需要抓取一个电子邮件显示为“电子邮件”的网站。当您单击超链接时,它会自动打开您的电子邮件并有一条新消息,其中包含准备发送的电子邮件。

我以为我可以浏览 html 并将电子邮件刮掉。但是,电子邮件被列为 javascript 对象(我不熟悉)。

电子邮件编码为:

<li class="email"><a href='javascript:let("179 540 458 268 179 597 380 355 635 44 188 274",649,387)'>email</a></li>

我正在尝试弄清楚如何将其提取并解码为常规电子邮件格式。

【问题讨论】:

  • 网站是公开的吗?
  • 是的,它是一个公共网站
  • 您能分享一下网址和您当前的代码吗?还要指出预期的输出。
  • 每个条目都有一个电子邮件超链接;我想提取该电子邮件以输入到列表中

标签: javascript python html web-scraping


【解决方案1】:

该页面通过一系列 javascript 函数使用混淆。该代码受版权保护,因此我不确定将其编码到 python 中的易读性,这是非常微不足道的。代码位于:https://barrowjackson.yourkwoffice.com/mcj/template_content/scripts/deobscure.js

作者有一个网站,但我怀疑它会说“确保你可以用不同的语言编写你自己的版本”....

您也可以轻松地将字符映射到您自己的查找字典中,因为相关字符集并不大。当您单击一个链接时,您可以看到网络流量中的解码值。

您只需要在实际页面中看到的函数调用的第一个参数,例如

let("179 540 458 268 179 597 380 355 635 44 188 274",649,387)

获取第一个参数:“179 540 458 268 179 597 380 355 635 44 188 274”并翻译它。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-09-12
    • 2018-06-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多