【发布时间】:2013-08-11 14:43:00
【问题描述】:
我正在尝试从包含标签的文本文件中检索信息,例如:
<name> Joe </name>
文本文件由多行组成,其中一些包含更多这些标签(例如,身高和体重),而一些仅包含其他文本。我将文本文件称为“工作表”(参见下面的代码)。
我想检索标签之间的文本。为此,我提出了以下解决方案:
m1 <- regexpr("<name> [a-zA-Z]+ </name>", sheet)
m2 <- regmatches(sheet,m1)
m3 <- gsub("<name> ", "", gsub(" </name>", "", m2))
m3
我以前没有使用过正则表达式,但我想知道我的“正则匹配”是不是绕道而行。似乎应该有更直接的方法来检索标签内的文本?
谢谢,
理查德
【问题讨论】:
-
您的示例看起来像 HTML 或 XML;如果是,即围绕它有一个正式的结构,可能会有更好的解决方案,例如使用 XML 包。