【发布时间】:2011-04-08 22:37:06
【问题描述】:
我有一个程序,它根据没有 html 信息的同一文档上的信息对 html 格式的文档进行文本处理。我基本上是在未格式化的文档中找到一个单词或短语,然后在格式化的文档中找到相应的单词并使用 HTML 标签更改单词或短语的外观以使其突出(例如加粗或更改其颜色)。
这是我的问题。有时,我想对可能是 html 标签的一部分的单词或短语进行格式化(例如,也许我想对单词“font”进行一些格式化,但前提是单词不在 html 标签内) .有没有一种简单的方法来检测字符串是否是文本块中 html 标记的一部分?
顺便说一句,我不能只去掉文档中的 html 标签并对剩余的文本进行处理,因为我需要在结果中保留 html。我需要添加到现有的 html,但我需要可靠地区分属于标签的字符串和不属于标签的字符串。
有什么想法吗?
谢谢,
艾略特
【问题讨论】:
标签: java text html-parsing