【发布时间】:2020-03-16 17:44:40
【问题描述】:
我在下面有一个名为 train.csv 的 csv 文件:
25.3, 12.4, 2.35, 4.89, 1, 2.35, 5.65, 7, 6.24, 5.52, M
20, 15.34, 8.55, 12.43, 23.5, 3, 7.6, 8.11, 4.23, 9.56, B
4.5, 2.5, 2, 5, 10, 15, 20.25, 43, 9.55, 10.34, B
1.5, 2.5, 3.5, 4.5, 5.5, 6.5, 7.5, 8.5, 9.5, 10.5, M
我正在尝试将这个数据集分离并分类如下(这是我想要的输出):
[[25.3, 12.4, 2.35, 4.89. 1, 2.35, 5.65, 7, 6.24, 5.52],
[20, 15.34, 8.55, 12.43, 23.5, 3, 7.6, 8.11, 4.23, 9.56],
[4.5, 2.5, 2, 5, 10, 15, 20.25, 43, 9.55, 10.34],
[1.5, 2.5, 3.5, 4.5, 5.5, 6.5, 7.5, 8.5, 9.5, 10.5]],
[M, B, B, M]
“[[”中的一个是x(样本数据),“[M,M,B,B,M]”中的一个是y(与它的数据集匹配的分类.
我正在尝试创建一个已加载的 python 代码,并且可以打印出由数据分隔的数据及其分类。它与线性SVM有关。
y_list = []
x_list = []
for W in range(0, 100):
X = data_train.readline()
y = X.split(",")
y_list.append(y[10][0])
print(y_list)
z_list = []
for Z in range(0, 10):
z_list.append(y[Z])
x_list.append(z_list)
dataSet = (x_list, y_list)
print(dataSet)
注意:我知道我的范围完全错误。对于这种类型的示例,我完全不确定如何适应范围,谁能解释一下范围在这种情况下如何工作。
注意:我知道“y[10][0]”的附加行也是错误的。有人可以解释这些索引是如何工作的。
总的来说,我希望输出是我上面所说的输出。谢谢您的帮助。
【问题讨论】:
-
据了解,您想根据其他数据预测分类吗?你看过
sklearn.model_selection中的train_test_split函数吗?