【问题标题】:some questions on usage of java.net.url in Google App Engine for Java关于在 Google App Engine for Java 中使用 java.net.url 的一些问题
【发布时间】:2012-01-15 14:27:42
【问题描述】:

我想使用 java.net.url 来爬取一些网站并检索一些数据。

我对以下问题感到困惑--

(1) 假设我将爬虫配置为访问视频共享网页,例如 You Tube。现在,爬虫被设置为访问特定的 You Tube 视频页面——这是否意味着当爬虫实际访问该页面时,它会默认下载该页面上的所有元素,包括 FLV 视频?或者我可以控制要检索的文件。目的是最小化 Google App Engine 上的带宽利用率。具体来说,最初我只想检索 HTML 网页本身,而不检索该网页上的图像/视频/其他附件……这可能是在 Google App Engine 上还是作为常规 Java Web 应用程序的一部分?

(2) 了解访问单个特定站点所使用的确切带宽的快速简便方法是什么?以便我可以跟踪带宽使用情况?

同时牢记以上两个问题,您推荐使用 java.net.url 还是低级 API?还是您认为我不应该坚持使用 App Engine(并使用例如 AWS)?

【问题讨论】:

  • java.net.url 不是爬虫。

标签: java google-app-engine


【解决方案1】:

(1) 你的爬虫只会加载网络服务器对特定 URL 的响应,通常是纯 HTML。如果是 YouTube,只需用浏览器在页面上单击鼠标右键,然后选择查看源代码。如果您自动加载页面,这就是您将下载的内容。没有视频,只有文字。

(2) 当你阅读网页内容时,只计算你收到的字节数。那是你的带宽。

【讨论】:

    猜你喜欢
    • 2011-09-28
    • 1970-01-01
    • 1970-01-01
    • 2013-03-30
    • 2011-07-30
    • 2012-01-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多