【发布时间】:2012-05-22 17:10:27
【问题描述】:
我需要创建一个工具,可以登录网站、读取 HTML、可能导航到另一个页面,并最终从页面中提取数据(并将其导出到文件中,或将其保存在“内存中”进行更多处理等)。我将在 Mac OS 上执行此操作。这些天有没有关于如何最好地做到这一点的建议?过去,我使用 Web 库在 .NET 或 Java 中完成了这项工作。我需要能够登录到使用 HTTPS 的站点。
【问题讨论】:
-
不清楚您的要求。您是否正在寻找与 Mint.com 基本执行相同功能的通用 API?这很重要——为什么不使用现有的现成产品(例如前面提到的 Mint)?
-
我将不得不同意柯克的评论。没有“工具”可以做到这一点,除了 Mint(仅访问,它做得很好)或可能的快速书派生(确实有 excel 导出)。 Intuit 两者兼得。
-
有很多工具可以做到这一点——屏幕抓取工具、网络爬虫工具、Microsoft .NET 等。我过去曾为想要登录网站并抓取的金融机构这样做实时报价等(在可以做到这一点的 API 存在之前)。我对工具的了解很老(大约 7 岁)——所以寻找当前关于自动化登录安全网站、处理页面并将部分内容保存到文件的建议。
标签: java .net screen-scraping web-crawler