【发布时间】:2017-02-11 08:14:15
【问题描述】:
我有一长串用户(大约 200,000)和一个相应的数据框 df 及其属性。现在我想编写一个 for 循环来测量用户的成对相似性。代码如下:
df2record = pd.DataFrame(columns=['u1', 'u2', 'sim'])
for u1 in reversed(user_list):
for u2 in reversed(list(range(1, u1))):
sim = measure_sim(df[u1], df[u2]))
if sim < 0.6:
continue
else:
df2record = df2record.append(pd.Series([u1, u2, sim], index=['u1', 'u2', 'sim']), ignore_index=True)
现在我想用多处理运行这个 for 循环,并且我已经阅读了一些教程。但是我仍然不知道如何正确处理它。看来我应该先设置合理数量的进程,比如6。然后我应该将每个循环输入一个进程。但问题是我如何知道某个进程中的任务已经完成,从而可以开始一个新的循环?你能帮我解决这个问题吗?提前谢谢你!
【问题讨论】: