【问题标题】:extract text from word or pdf based on format (font name and size)根据格式(字体名称和大小)从 word 或 pdf 中提取文本
【发布时间】:2009-11-25 13:41:58
【问题描述】:

我需要解析大文本(大约 1000 页的 word 或 pdf 文档)并将该文档中的一些文本放入数据库字段中

我发现我要提取的文本唯一能区分的就是格式,总是“Helvetica-Condensed”大小12

我可以这样做吗?我知道如何使用字符串函数,但我应该用什么来测试格式?

正如我所说,文本存储在 Word 文档或 PDF 中

如果有第三方组件可以做没有问题,请参考我

谢谢

【问题讨论】:

    标签: delphi pdf extract


    【解决方案1】:

    QuickPDF。价格为 249,00 美元。

    【讨论】:

      【解决方案2】:

      另一种选择是自己编写代码。 file specification 可在线获得,如果您只是想从文档中撕下文本,这应该会为您提供大部分指导。

      唯一需要注意的是完全由图像构建的文档。在那种情况下(无论您使用什么来读取文件),您还需要一个 OCR 类型的应用程序。要查看是否是这种情况,请打开您要从中“提取”文本的文件类型的示例,选择要复制的文本,然后尝试粘贴到记事本中。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2013-10-23
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2011-06-02
        相关资源
        最近更新 更多