【发布时间】:2020-03-01 14:45:02
【问题描述】:
我正在使用 pdftools 来解析 pdf,并且遇到了无法准确解析的 pdf(它正在处理其他 PDF,所以我认为它与代码无关)。
可在此处找到 PDF:https://eeas.europa.eu/sites/eeas/files/st_10113_2007_init_en.pdf
我的代码是:
EU_text_2007 <- pdf_text("2007_CA_Strategy.pdf") %>%
readr::read_lines() %>%
str_squish()
返回
[1] " (''!\n %$+!&,!-%&!0+%'2-3!(4(-)!7'2-'+9 !+,2!-!'+-!=-2'%+24$(.!\n!\n!\n#/!#%'2,&@0'(,%)!%$+ !&,!-%&!0+%'2-3!(4(-!\n!\n345678&!'):8!;8)!8!%456$7:4)3& !678 :6:5!@!(7:5(:5(!-$7*B4!85 !'):8!6*
EU_text_2007_long <- paste(EU_text_2007, collapse = ' ')
EU_text_2007_long <- EU_text_2007_long %>%
as.data.frame()
colnames(EU_text_2007_long) <- c('Text')
EU_text_2007_long <- EU_text_2007_long %>%
mutate(Year = 2007) %>%
mutate(Text = as.character(Text))
EU_text_2007_tokens <- EU_text_2007_long %>%
unnest_tokens(tokens, Text, token = "words")
标记化后的数据如下所示:
年份 |tokens
1 2007 0
1.1 2007 2
1.2 2007 3
1.3 2007 4
1.4 2007 7'2
1.5 2007 9
1.6 2007 2
1.7 2007 2
1.8 2007 24
1.9 2007 2
我已尝试删除第一页以防水印引起问题,但这并未成功。
是否有人可以查看他们是否也无法解析此文档,或者对于为什么会发生这种情况没有任何建议。谢谢!
【问题讨论】: