【发布时间】:2021-06-10 22:26:06
【问题描述】:
我需要用 Java + Groovy 写一个爬虫..
我想知道是否存在能够解析 HTML 文档并通过简单的 CSS 选择器选择我需要的信息(而不是遍历整个文档树并手动选择我需要的信息)的东西?像 Nokogiri 对于 Ruby 的东西,只是为了让你知道我需要什么..
提前致谢!
【问题讨论】:
-
我的第一个想法:终于有人没有问这个关于正则表达式的问题。;)当然,这已经详细介绍了。
-
我一直在使用 C# 进行抓取。我写了一个 jQuery 端口,但我不敢在这里发布它,因为害怕由于自我推销而被否决。
-
那么,如果你被降级了怎么办。我有兴趣看到它,而且我不会是唯一一个。
标签: java html css screen-scraping