【问题标题】:Machine learning: file parsing and prediction class file机器学习:文件解析和预测类文件
【发布时间】:2021-09-08 07:07:03
【问题描述】:

大家早上好, 我目前正在从事机器学习领域的一个项目,目标是对一组数据进行监督分类。我的数据是大量的 pdf 文件,每个文件都有一个特定的类,目标是使用这些文件作为训练数据集,以便对新文件进行类预测。 我的问题是我不知道如何构建我的训练数据集,因为分类算法必须对每个文件的内容进行训练,并且在我的训练数据框中,我有每个文件的类和相关文件的名称。如何在我的训练数据框中包含每个 pdf 文件的内容? 提前感谢您的帮助

【问题讨论】:

    标签: sql-server python-3.x dataframe machine-learning data-science


    【解决方案1】:

    PDF 文件通常以文本、图像、图表或其他内容为特征,因此它们不能轻易地转换为可以提供给机器学习算法的数字向量。首先,您需要从文件中提取感兴趣的信息。

    在这方面,您可能想先尝试一些可用于提取信息的库,然后看看会发生什么。对于 Python,一个好的开始可以是PyPDF2。你可以找到一个教程here。 如果这没有按预期工作,我的建议是尝试使用一些 OCR 工具,它们直接将 pdf 作为图像读取以提取信息。在pytesseract中是最常用的之一,但不是only one

    【讨论】:

    • 文本部分我有,我还拥有一个包含类和文件的sql数据库,我想根据文本文件的内容对类进行预测,我没有知道如何使用每个文本文件(文件内容:一组单词)及其在 sql server 或 python 上的类来构建我的训练集。请问有什么想法吗?
    • 您可以做的最简单的事情是使用一个词袋 (en.wikipedia.org/wiki/Bag-of-words_model),它会为每个文件创建一个出现次数的数组。一旦你有了这些,你就可以使用一个简单的算法来执行分类,比如逻辑回归或朴素贝叶斯。你可以在这里找到一个全面的教程:scikit-learn.org/stable/tutorial/text_analytics/…
    猜你喜欢
    • 2011-10-04
    • 1970-01-01
    • 2016-02-25
    • 2018-02-04
    • 1970-01-01
    • 2019-01-01
    • 1970-01-01
    • 2011-02-01
    • 2019-06-13
    相关资源
    最近更新 更多