【问题标题】:dividing big dataset python划分大数据集python
【发布时间】:2021-01-05 22:25:34
【问题描述】:

我的数据集特征形状是 (80102, 2592) 和 label.shape (80102, 2)。我只想考虑几行进行训练,因为训练 CNN 模型需要花费大量时间。如何在 python 中划分数据集,只考虑几行来训练和测试两者。

【问题讨论】:

  • 你自己试过什么?请分享您的一些代码并解释您的问题。不要指望 StackOverflow 会为您编写代码。
  • 对不起..实际上我是这个领域的新手,但我得到了答案。谢谢

标签: python tensorflow machine-learning artificial-intelligence


【解决方案1】:

如果您的数据是数组形式,则 X 为包含数据的数组,y 为包含标签的数组。您可以使用 sklearn train_test_split 函数按照以下代码创建新的数据样本

from sklearn.model_selection import train_test_split
percent=.1 specify the percentof data you want to use, in this case 10%
X_data, X_dummy, y_labels, y_dummy=train_test_split(X,y,train_size=percent,randon_state=123, shuffle=True)

X_data 将包含 10% 的原始数据并将被打乱 y_labels 将包含 10% 的相应标签。 如果要专门设置样本数,请将 train_size 设置为整数值。如果您需要更多信息,文档位于 here. 如果您的数据是 pandas 数据框,则可以使用 pandas 函数 pandas.DataFrame.sample.. 文档为 here.。假设您的数据框称为数据。下面的代码将生成一个新的数据框,其中包含指定百分比的原始行

percent=.1
new_data=pandas.data.sample(n=None, frac=percent, replace=False, weights=None, random_state=123, axis=0)

【讨论】:

    猜你喜欢
    • 2016-01-03
    • 1970-01-01
    • 2012-03-31
    • 2020-09-01
    • 2015-02-13
    • 2018-07-02
    • 2017-10-23
    • 2021-09-08
    • 1970-01-01
    相关资源
    最近更新 更多