【发布时间】:2023-02-23 00:39:52
【问题描述】:
我正在实施一个数据增强脚本,该脚本将 pandas DataFrame 和字符串列表(例如 variations)作为输入。该脚本应为 DataFrame 生成新行,其中每行连接 variations 的一个元素。
例如,有一个 DataFrame:
Compliment | Sentence_ID
Hi | 1
Hello | 2
Hola | 3
和变化["Elvis", "Monica"]
生成的数据框应该是这样的:
Compliment | Sentence_ID
Hi | 1
Hi Elvis | 1
Hi Monica | 1
Hello | 2
Hello Elvis | 2
Hello Monica | 2
Hola | 3
Hola Elvis | 3
Hola Monica | 3
我用pd.iterrows() 做了一些测试,但当数据帧很大时,它似乎非常慢(~5 分钟)。我想知道是否有这样一个更可行的选择。
【问题讨论】:
-
variations在你的实际情况中是大尺寸吗? -
是的,你可以考虑它们会很大。
-
你能给出你真实数据集的大小吗?和变化列表?
-
这将应用于一些不同的数据集,但您可以考虑数据集可能有 10-30k 行,变体可能有 100-300 个元素。
标签: python pandas numpy performance