【发布时间】:2011-09-15 18:06:19
【问题描述】:
我有一个博客数据集,其中包含大量博客页面,包括博客文章、cmets 和所有博客功能。 我只需要从此集合中提取博客文章并将其存储在 .txt 文件中。 我需要修改这个程序,因为这个程序应该收集以 p> 开头并以 /p> 结尾的博文标签,并避免使用其他标签。
目前我使用 HTMLParser 来完成这项工作,这是我目前所拥有的:
import org.htmlparser.Node;
import org.htmlparser.Parser;
import org.htmlparser.util.NodeList;
import org.htmlparser.util.ParserException;
import org.htmlparser.filters.HasAttributeFilter;
import org.htmlparser.tags.MetaTag;
public class HTMLParserTest {
public static void main(String... args) {
Parser parser = new Parser();
HasAttributeFilter filter = new HasAttributeFilter("P");
try {
parser.setResource("d://Blogs/asample.txt");
NodeList list = parser.parse(filter);
Node node = list.elementAt(0);
if (node instanceof MetaTag) {
MetaTag meta = (MetaTag) node;
String description = meta.getAttribute("content");
System.out.println(description);
}
} catch (ParserException e) {
e.printStackTrace();
}
}
}
提前致谢
【问题讨论】:
标签: java html text-processing html-parsing