【发布时间】:2022-01-22 13:46:28
【问题描述】:
我有一个使用 pdftools::pdf_text 从 PDF 中提取的文本。 PDf 包含要点项目,例如:
- project abstract
- project narrative
提取出来后的文字是这样的:
project abstract project narrative
现在,我想从文本块中提取这些项目。我试过做这样的事情:
grep("\\s[a-zA-Z]+\\s[a-zA-Z]+", text)
但它找不到它。提取列表项的正确正则表达式是什么?或者提取列表项的正确方法是什么?
【问题讨论】:
标签: r