【问题标题】:Working on an external dataset处理外部数据集
【发布时间】:2014-04-29 12:23:34
【问题描述】:

我对 scikit-learn 还是很陌生,并且正在浏览一些学习和预测 iris 数据集中样本的示例。但是如何为此目的加载外部数据集?

我下载了一个数据集,其中包含以下形式的数据;

id attr1 attr2 .... label
123 0 0 ..... abc
234 0 0 ..... dsf
....
....

那么我应该如何加载这个数据集来学习和绘制预测?谢谢。

【问题讨论】:

    标签: python dataset scikit-learn


    【解决方案1】:

    一种选择是使用pandas。假设数据是空格分隔的:

    import pandas as pd
    X = pd.read_csv('data.txt', sep=' ').values
    

    其中read_csv 返回一个DataFramevalues 属性返回一个包含数据的numpy 数组。您可能希望将上述X 的最后一列作为标签分离出来,例如放入一维数组y

    X, y = X[:, :-1], X[:, -1]
    

    【讨论】:

    • 我对numpy非常熟悉,所以我使用了相同的技术来分离标签。谢谢。
    猜你喜欢
    • 2020-07-15
    • 2023-03-31
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-07-04
    • 1970-01-01
    • 2011-02-22
    • 2023-04-02
    相关资源
    最近更新 更多