【发布时间】:2019-05-30 23:25:28
【问题描述】:
我试图在 R 中抓取几个 PDF,PDF1 有 9 页,PDF2 有 12 页。当我运行下面的代码时,它会刮掉两个 PDF,但只能刮到第 6 页,之后什么也没有。是否有一个原因?我的代码中缺少什么?
library(tm)
read <- readPDF(engine = "xpdf", control = list(text = "-layout"))
document <- Corpus(URISource("C:\\Users\\Goku\\Documents\\Python Scripts\\PDF Scraping\\123.pdf"), readerControl = list(reader = read))
doc <- content(document[[1]])
head(doc)
您可以在以下位置找到 pdf:https://www.scribd.com/document/396797318/123
【问题讨论】:
-
除了尝试使用 pdftools 作为引擎看看是否可行之外,我无法给您任何其他建议。
-
我试过了,它仍然只打印出 9 页中的 6 页。也许我的设置搞砸了?
-
直接使用pdftools会发生什么?喜欢
pdftools::pdf_text(your pdf document here) -
好的,打印所有 9 页,为什么可以,但在我的代码中它最多只能打印 6 页?
-
我不知道。我没有你的pdf。我无法用我的文档在我的机器上复制您的问题。
标签: r pdf tm pdf-scraping xpdf