【发布时间】:2020-02-15 19:36:13
【问题描述】:
我正在使用 tidyverse、tidytext 和 pdftools。我想在 70 个 pdf 文件的目录中解析单词。我正在使用这些工具成功地做到这一点,但下面的代码抓取了所有页面而不是我想要的子集。我需要跳过前两页,然后为每个 pdf 选择第 3 页到文件末尾。
directory <- "Student_Artifacts/"
pdfs <- paste(directory, "/", list.files(directory, pattern = "*.pdf"), sep = "")
pdf_names <- list.files(directory, pattern = "*.pdf")
pdfs_text <- map(pdfs, (pdf_text))
my_data <- data_frame(document = pdf_names, text = pdfs_text)
我发现通过将 [3:12] 放在这样的括号中,我可以获取第 3-12 个文档:
pdfs_text <- map(pdfs, (pdf_text))[3:12]
这不是我想要的。如何使用 [3:12] 规范从每个 pdf 文件中提取我想要的页面?
【问题讨论】:
标签: r pdf tidyverse tidytext pdftools