【问题标题】:Programming using information from html pages as part of the input data? [closed]使用来自 html 页面的信息作为输入数据的一部分进行编程? [关闭]
【发布时间】:2013-01-31 16:59:49
【问题描述】:

是否有规则、框架或工具集用于使用来自 html 页面的信息作为输入数据的一部分进行编程?类似于元搜索引擎的东西。你是怎么解析网页的?

我更喜欢 java 或 flex/flash,或者一些阅读的指针。

谢谢!

2013 年 2 月 7 日更新

感谢您的回答!网络抓取是我一直在寻找的术语!

从这篇帖子Web scraping with Java 中找到了这个很棒的java 库:http://jsoup.org/

正在寻找 flex 的,我会在找到后立即更新。

【问题讨论】:

  • 我想这就是你想要的:en.wikipedia.org/wiki/Web_scraping(顺便说一句,这个问题对于这个网站来说有点太笼统了)
  • 你能告诉我们你到底想做什么吗?

标签: java apache-flex web-scraping


【解决方案1】:

我认为您的问题对于获得好的答案有点含糊,而且我自己没有 Java/Flex 经验,但大多数语言都有库支持向相关资源发出 HTTP 请求(而且,很可能,某种支持将 HTML/XML 解析为某种数据结构,您可以从中提取数据。)

根据您要从中获得什么,您可能只需要对 HTTP 响应进行简单的字符串搜索即可找到您需要的内容。这基本上是@pablochan 在建议关于网络抓取的 wiki 页面时所推荐的内容。

请注意,某些服务/网站旨在混淆您尝试对其数据进行页面抓取的尝试,并且确实可能​​将此类行为列为违反其服务条款的行为。如果您成功执行此操作但过于频繁,您可能会发现您的 IP 被阻止或采取了其他类型的措施来阻止您这样做。

大多数静态网站不会有这样的保护,但大型服务可能会很好。

【讨论】:

    猜你喜欢
    • 2013-02-01
    • 2016-10-17
    • 2014-09-05
    • 2013-05-08
    • 2015-12-28
    • 1970-01-01
    • 2012-09-26
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多