【发布时间】:2020-10-20 00:03:26
【问题描述】:
我有一个大数据集,最近被介绍给 Dask。我正在尝试标记每一行中的文本。 这在熊猫中很容易做到,如下所示,但我有一个错误提示
AttributeError: 'DataFrame' object has no attribute 'lower' 当我尝试使用 Dask 时(见下面的第二组代码)
import pandas as pd
import dask
import dask.dataframe as dd
def to_lower(text):
return text.lower()
df_2016 = pd.read_csv("2016_Cleaned_DroppedDup.csv")
df_2016['token2'] = df_2016['token2'].apply(lambda x: pr.to_lower(x))
使用 DASK:
df_2016 = dd.from_pandas(df_2016, npartitions = 4 * multiprocessing.cpu_count())
df_2016 = df.2016.map_partitions.(lambda df: df.apply(lambda x: pr.to_lower(x))).compute(scheduler = 'processes')
【问题讨论】:
标签: pandas nltk dask dask-dataframe