【发布时间】:2015-05-17 18:30:32
【问题描述】:
我有一个通过解析大小为 1.4G 的 CSV 创建的 DataFrame 'clicks'。我正在尝试使用 apply 函数创建一个“购买”的新列。
clicks['bought'] = clicks['session'].apply(getBoughtItemIDs)
在 getBoughtItemIDs 中,我正在检查 'buys' 数据框是否有我想要的值,如果有,则返回一个连接它们的字符串。 getBoughtItemIDs 中的第一行将永远占用。有什么方法可以加快速度?
def getBoughtItemIDs(val):
boughtSessions = buys[buys['session'] == val].values
output = ''
for row in boughtSessions:
output += str(row[1]) + ","
return output
【问题讨论】:
标签: python pandas dataframe machine-learning