【发布时间】:2010-11-30 16:26:05
【问题描述】:
我正在使用 HtmlCleaner 库进行 html 内容提取。它运行良好,但几乎没有限制。
它无法处理特殊字符,如 £ 或引号等。例如。 对于 url:http://www.basicelegancefurnishings.co.uk/alaska-3-and-2-seater-sofa-setspan-classukmadespan-p-280.html,在给 xpath 价格时,它给了我“&磅;”代替£
是否有任何我们可以在 htmlcleaner 中设置的属性来处理这个或任何其他解决方案。
谢谢
吉腾德拉
【问题讨论】:
标签: java jsp web-crawler web-scraping