【发布时间】:2017-01-19 07:26:04
【问题描述】:
我对 Java 很陌生。
现在,我想使用 Google 新闻搜索 -keyword: "toy" 从第 1 页到第 10 页检索新闻文章内容。
即从第 1 页到第 10 页检索 100 条新闻内容。(假设每页有 10 篇新闻文章)
读完之后 Crawler4j vs. Jsoup for the pages crawling and parsing in Java
我决定尽可能使用 Crawler4j
给出基本 URI(主页)
获取每个页面的所有 URI 并检索这些内容 也。
为您检索的每个 URI 递归移动。
仅检索本网站内的 URI 的内容(有 可能 引用另一个网站的外部 URI,我们不需要这些)。
在我的情况下,我可以将谷歌搜索页面从 p1 到 p10。如果我设置 intnumberOfCrawlers=1,它会返回 100 篇新闻文章
但是,当我尝试 Crawler4j 的快速入门 example
它只返回从原始链接中找到的外部链接。 像这些:
URL: http://www.ics.uci.edu/~lopes/
Text length: 2619
Html length: 11656
Number of outgoing links: 38
URL: http://www.ics.uci.edu/~welling/
Text length: 4503
Html length: 23713
Number of outgoing links: 24
URL: http://www.ics.uci.edu/~welling/teaching/courses.html
Text length: 2222
Html length: 15138
Number of outgoing links: 33
URL: http://www.ics.uci.edu/
Text length: 3661
Html length: 51628
Number of outgoing links: 86
因此,我想知道crawler4j 是否可以执行我提出的功能。或者我应该使用crawler4j +JSouptogether 吗?
【问题讨论】:
标签: java parsing web-crawler jsoup crawler4j