【发布时间】:2012-04-08 11:50:06
【问题描述】:
我在 R 上工作,我想提取所有关闭的 HTML 标记 来自纯文本文档。 我使用带有正则表达式的 gsub 方法:
gsub("<?!([^<]/*)>"," ",fm,perl=TRUE,ignore.case=TRUE)
但是,斜线“/”没有被计算。
我想我不是很清楚。
这是我需要做的:
我有一个文本(HTML 文档),我只想保留标签(<> 和 </>)。我认为使用 gsub 是个好主意,但也许您有更好的解决方案。
【问题讨论】:
-
是否需要转义
/? -
我同意 Ben 的观点,如果这被解析为 perl 正则表达式,perl 不使用
/作为分隔符吗? -
斜线不需要转义(Perl 可以使用任何东西作为分隔符)。
?!是否应该是负前瞻?正确的语法是(?!...)。要解析 XML,您可以使用XML包:它将为您完成所有工作。
标签: html regex r regex-negation