【发布时间】:2012-01-15 14:27:42
【问题描述】:
我想使用 java.net.url 来爬取一些网站并检索一些数据。
我对以下问题感到困惑--
(1) 假设我将爬虫配置为访问视频共享网页,例如 You Tube。现在,爬虫被设置为访问特定的 You Tube 视频页面——这是否意味着当爬虫实际访问该页面时,它会默认下载该页面上的所有元素,包括 FLV 视频?或者我可以控制要检索的文件。目的是最小化 Google App Engine 上的带宽利用率。具体来说,最初我只想检索 HTML 网页本身,而不检索该网页上的图像/视频/其他附件……这可能是在 Google App Engine 上还是作为常规 Java Web 应用程序的一部分?
(2) 了解访问单个特定站点所使用的确切带宽的快速简便方法是什么?以便我可以跟踪带宽使用情况?
同时牢记以上两个问题,您推荐使用 java.net.url 还是低级 API?还是您认为我不应该坚持使用 App Engine(并使用例如 AWS)?
【问题讨论】:
-
java.net.url 不是爬虫。