【发布时间】:2021-09-08 07:07:03
【问题描述】:
大家早上好, 我目前正在从事机器学习领域的一个项目,目标是对一组数据进行监督分类。我的数据是大量的 pdf 文件,每个文件都有一个特定的类,目标是使用这些文件作为训练数据集,以便对新文件进行类预测。 我的问题是我不知道如何构建我的训练数据集,因为分类算法必须对每个文件的内容进行训练,并且在我的训练数据框中,我有每个文件的类和相关文件的名称。如何在我的训练数据框中包含每个 pdf 文件的内容? 提前感谢您的帮助
【问题讨论】:
标签: sql-server python-3.x dataframe machine-learning data-science