【发布时间】:2011-04-26 13:26:37
【问题描述】:
我需要从不提供 RSS 提要的远程网站检索文本。
我所知道的是,我需要的数据始终位于从主页 (http://www.example.com/) 链接到的页面上,其中的链接包含文本“Invoices Report”。
例如:
<a href="http://www.example.com/data/invoices/2010/10/invoices-report---tuesday-october-12.html">Invoices Report - Tuesday, October 12</a>
因此,我需要在主页上找到与此模式匹配的所有链接,然后从位于名为<div class="invoice-body">
的标记内的那些页面中检索所有文本。
是否有 Java 工具可以帮助解决此问题?是否有任何专门针对 Google App Engine for Java 的工具可用于执行此操作?
【问题讨论】:
标签: java regex google-app-engine screen-scraping web-scraping