【发布时间】:2019-12-13 05:40:42
【问题描述】:
您好,我正在尝试使用 R 中的 tm 包从 CSV 文档文件创建语料库。通过阅读文档,我了解到 DataframeSource 需要两列:1)唯一标识符和 2)文本。每行都应该是一个新文档。
doc_id text
1 Document 1
2 Document 2
我有一个 sourcedata 文件,其中包含许多跨多行的文档。
doc_id text
1 Document 1
1 Document 1 continued
2 Document 2
2 Document 2 continued
有没有一种快速而整洁的方法来读取与同一文档具有相同标识符的所有内容?谢谢!
【问题讨论】: