【发布时间】:2021-11-12 03:00:15
【问题描述】:
我正在学习 DataFrame 分块。我的伪代码很简单:
- 将 SOURCE_FILE 分解为多个块
- 加载块(带循环)
- 添加带有预测标签的列和带有置信度的另一列
- 将块写入驱动器
- 继续循环
第一个块按原样保存。其余块中的新列具有不正确的行索引。我无法弄清楚为什么会这样。感谢所有帮助。
另外,我的分块伪代码是否正确?如果这是正确的方法,我有点困惑。
# create chunks
for chunk in pd.read_csv(SOURCE_FILE, chunksize = CHUNK_SIZE):
print('BATCH:', BATCH_NUMBER)
# machine translate
for row_index, text in enumerate(chunk.title):
print('Text:', text)
print('Row Index:', row_index)
(label, confidence) = MODEL.predict(text)
label = label[0]
confidence = confidence[0]
chunk.loc[row_index, 'Language'] = label[9:]
chunk.loc[row_index, 'Confidence'] = confidence
chunk.to_csv('Chunks/chunk' + str(BATCH_NUMBER) + '.csv' , index = False)
BATCH_NUMBER += 1
【问题讨论】:
标签: python pandas dataframe chunking