【发布时间】:2012-09-25 10:16:24
【问题描述】:
我正在尝试使用以下代码定位(然后提取)重复的短语。我需要以“大约”开头并以“关闭”结尾的短语。
例如“关闭了大约 1.629 亿美元的总资产和 1.445 亿美元的总存款”
str_locate(x,"(\b[Aa]pproximately\b)(.*)(\b[Cc]losed\b)")
str_extract(x,"(\b[Aa]pproximately\b)(.*)(\b[Cc]losed\b)")
以上代码为短语起点和终点返回 NA。 这是短语所在的字符向量示例。(这是一个公开的 FDIC 信息网页)
"206-4662)。\r\n\r\n12 月 \r\n\r\n\r\n 位于亚利桑那州凤凰城的 Western National Bank,总资产约为 1.629 亿美元,总存款为 1.445 亿美元已关闭。华盛顿州西雅图市华盛顿联邦银行已同意承担除某些经纪存款外的所有存款。\r\n(PR-195-2011) \r\n\r\n\r\n\r\n Premier Community Bank of Emerald Coast, Crestview, FL 已关闭,总资产约为 1.26 亿美元,存款总额为 1.121 亿美元。Summit Bank, N.A., Panama City, FL 已同意承担所有存款。\r\n(PR-194-2011) "
我可能不正确地使用 reg 表达式,因为我是新手,因此非常感谢任何建议。
【问题讨论】: