【发布时间】:2010-05-07 14:10:08
【问题描述】:
我正在尝试为我所从事的周刊设置索引页。是为了向读者展示他们的名字 在那几周的问题中提到的公司,以及它们出现的页码。
我想搜索本周的所有 PDF 文件,其中一个 PDF = 一个杂志页面(最初制作于 Adobe InDesign CS3 和 Adobe InCopy CS3)。
我已经设置了我要搜索的公司列表,并使用 PowerGREP 和分隔正则 表达,我能够找到提到公司的大多数页码。 但是,如果 公司名称包含两个或多个单词,我正在运行的搜索不会找到 name 出现在不止一行上。
例如,在查找“CB Richard Ellis”和“Cushman & Wakefield”时,当 文字看起来像这样:
DTZ 击败 BNP PRE、CB [此处换行]
Richard Ellis 和 Cushman & [此处换行]
Wakefield 确保合同。 [此处结束]
有人可以告诉我如何编写一个忽略空格之间的正则表达式 单词并忽略行尾或查找包含所有类型空格的单词(即不均匀 单词之间的空格;行尾或行尾的空格;和标签(我猜这个信息是 以某种方式嵌入 PDF 文件中)。
这是我要求 PowerGREP 搜索的一组术语的示例:
\bCB Richard Ellis\b
\bCB Richard Ellis Hotels\b
\bCentaur Services\b
\bChapman Herbert\b
\bCharities Property Fund\b
\bChetwoods Architects\b
\bChurch Commissioners\b
\bClive Emson\b
\bClothworkers’ Company\b
\bColliers CRE\b
\bCombined English Stores Group\b
\bCommercial Estates Group\b
\bConnells\b
\bCooke & Powell\b
\bCordea Savills\b
\bCrown Estate\b
\bCushman & Wakefield\b
\bCWM Retail Property Advisors\b
[请注意,每个短语末尾的每个 \b 和下一个短语的开头之间都有一个分隔的硬回车。]
顺便说一句,我是一名制作记者,通常不参与寻找 IT 类型的解决方案,我 发现很难掌握 PowerGREP 网站上的技术语言。
感谢您的帮助
艾莉森
【问题讨论】:
标签: regex