【发布时间】:2010-08-06 03:43:55
【问题描述】:
我有一个下载页面并尝试解析 HTML 的爬虫。我一直面临的问题之一是如何正确确定 HTML 文件是什么 mimetype。
我现在正在使用
is = new ByteArrayInputStream( htmlResult.getBytes( "UTF-8" ) );
mimeType = URLConnection.guessContentTypeFromStream(is);
但它错过了这样的网站:http://www.artdaily.org/index.asp?int_sec%3D11%26int_new%3D39415,因为源代码中的 doc 标记和 HTML 标记之间有额外的空间。
有没有人知道判断字符串是否为 HTML 的好方法?由于文本嵌入在我可能遇到的二进制文件中,因此搜索或其他一些标签不一定有效。
谢谢
【问题讨论】:
-
你看过这个库吗? sourceforge.net/projects/mime-util
标签: java html mime-types