【发布时间】:2019-11-28 14:32:10
【问题描述】:
我的数据集如下:
text size bold label
xxxx 5 1 0.0
yyyy 15 0 1.0
. . . .
. . . .
其中标签是目标变量,文本列是字符串,粗体和大小是int,标签是float。
现在我已经使用 tf-idf 矢量化器将文本列转换为数组。
data['tf_idf_q1'] = tfidf_vect.fit_transform(data["text"])
现在我分别使用 3 列和 1 列进行训练和测试:
X = data[['tf_idf_q1', 'size', 'bold']].as_matrix()
y = data['label'].as_matrix()
现在当我尝试将数据拟合到 svm 模型时:
clf = svm.LinearSVC().fit(X, y)
它显示错误:
ValueError: setting an array element with a sequence.
我试图将我的 X 和 y 转换为 dtype=float 但它不起作用。
我是 nlp 的新手,请大家帮帮我。
【问题讨论】:
标签: python pandas machine-learning nlp tf-idf