【问题标题】:how to read text files in quanteda, storing each line as a document如何在 quanteda 中读取文本文件,将每一行存储为文档
【发布时间】:2018-04-07 10:56:46
【问题描述】:

我将文本存储在多个文件中。
在文件中,每一行都是一个文档(博客文章的文本、推文的文本等)。
如果我以doc/examples 中显示的默认方式使用 readtext 包阅读,则每个文件的内容将是一个文档,而不是每一行都是一个文档。

我的目标是使用 quanteda 语料库,每行都存储为一个文档。
我正在使用 readtext,因为它是 quanteda 的配套包,但使用 readtext 并不是严格要求。

我想避免手动将原始文件拆分为较小的文件,每个文件对应一行。

【问题讨论】:

    标签: r nlp quanteda


    【解决方案1】:

    方法一:readLines()list.files()结合使用:

    txt <- character()
    for (f in list.files("your-folder")) {
       txt <- c(txt, readLines(f))
    }
    corp <- corpus(txt)
    

    方法2:可以使用corpus_segment()分割语料库中的行:

    corp <- corpus(readtext("your-folder")) 
    corp_line <- corpus_segment(corp, "\n",  extract_pattern = FALSE, pattern_position = "after")
    

    【讨论】:

      猜你喜欢
      • 2022-10-04
      • 1970-01-01
      • 2019-05-23
      • 2018-08-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多