【发布时间】:2021-03-01 23:09:18
【问题描述】:
我有一堆 PDF 文件(基于文本和扫描)来读取文本。在某些情况下,长词在行尾连字符。附上示例文本:
仅当这些连字符位于行尾时,我才需要清除它们。也就是说,我想保留所有标点符号和连字符,否则。所以在这个例子中,The-example-text 应该保持原样,但是在清除换行符和连字符之后,我想得到 Persönlichkeit、Gemeinschaft 和 Fähigkeiten 没有连字符和没有空格而不是连字符。
我在 R 中所做的是:
gsub("-\n\n|-\n|- \n", "", txt)
但这并不总是有效。 这样做的优雅方式是什么?
【问题讨论】: