【发布时间】:2020-09-01 16:34:29
【问题描述】:
我想创建一个程序来处理两个文件的编辑距离,我的代码适用于从 txt 文件中读取的字符串。但现在我想从 PDF DOC exc 中读取字符串。如何从这些文件中读取字符串?我尝试了 func fread 但它不起作用。 这是我写的代码:
void method () {
FILE *file;
char *str;
if ((file = fopen("C:/Users/latin/Desktop/prova.pdf", "rb")) == NULL) {
printf("Error!\n");
}
fread(&str,18,1,file);
printf("%s",str);
}
prova.pdf 是一个包含以下字符串的 PDF 文件:ciaoCiao merendina。
【问题讨论】:
-
分析 PDF 文件可能很棘手。如果您使用示例文本创建文字处理器文档并将其转换为 PDF,则生成的 PDF 文件不一定包含未更改的字符串。它可能会被拆分为多个部分,甚至可以转换为图形元素。您可能需要一个可以从 PDF 文件中提取文本的库或一个将 PDF 转换为文本的库/程序。
-
PDF 根本不是文本格式。不过,它是一个开放标准,因此您可以编写一些可以从中读取的内容。如果可能的话,最好获取一个免费的库来为你做这件事。 resources.infosecinstitute.com/pdf-file-format-basic-structure/…
-
在某处我读到我可以从 PDF 中读取字符串并读取它的二进制代码。你知道怎么做吗?
-
你读错了。在不理解和使用 PDF 文件结构格式的情况下,没有通用的方法可以简单地从 PDF 文件中读取文本。