【发布时间】:2018-02-26 22:52:18
【问题描述】:
我有一个包含 2 列字符串的 DataFrame,从 tsv 文件导入。两列都需要转换为ascii。 (这是因为我想通过 scikit-learn 中的 CountVectorizer 和 TfidfTransformer 管道传递文本。
我在 stackoverflow 和外部都浏览了几十个帖子,但无法弄清楚这一点。我的代码如下,包括我尝试过的一些东西。
有什么建议可以完成这项工作吗?
# tried including adding encoding="utf-8", does not work
df = pd.read_csv(questions, usecols = [3, 4, 5], nrows = 10, header=0, sep="\t")
y = df["is_duplicate"].values
X = df.drop("is_duplicate", axis=1).values
for col in X:
X = X.encode('utf-8') # does not work
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size = 0.3,
random_state = 21, stratify = y)
def flat_list(my_list):
return [str(item) for sublist in my_list for item in sublist]
def transform_data(trans_obj_list,dataset_splits):
X_train = dataset_splits[0].astype(str)
X_train = flat_list(X_train)
for trfs in trans_obj_list:
transformed_vector = trfs().fit(X_train)
for x in range(0,len(dataset_splits)):
dataset_splits[x] =flat_list(dataset_splits[x].astype(str))
return dataset_splits
new_X_train, new_X_test = transform_data([CountVectorizer,TfidfTransformer],
[X_train, X_test])
【问题讨论】:
-
否则请检查我的答案,您能否分享您的数据样本?
标签: python-3.x pandas numpy ascii