【发布时间】:2013-08-16 09:44:11
【问题描述】:
我有一个巨大的文本文件(4 GB),其中每个“行”的语法如下:
[number] [number]_[number] [Text].
例如
123 12_14 Text 1
1234 13_456 Text 2
33 12_12 Text 3
24 678_10 Text 4
我的目的是将这些数据保存为 Excel 文件,其中文本文件中的每一“行”,
是excel文件中的一行。按照过去的例子:
[A1] 123
[B1] 12_14
[C1] Text 1
[A2] 1234
[B2] 13_456
[C2] Text 2
[A3] 33
[B3] 12_12
[C3] Text 3
[A4] 24
[B4] 678_10
[C4] Text 4
我的计划是按照here 的建议迭代文本“行”,将“行”分开,
并保存到excel文件中的单元格中。
由于文本大小问题,我想创建许多小的 excel 文件,它们加起来就等于文本文件。
我需要分析小的excel文件,主要是找到[Text]单元格中提到的术语,并计算与[number]单元格相关的出现次数(代表一个帖子和一个帖子的ID) .
最后,我需要将所有这些数据汇总到一个 Excel 文件中。
【问题讨论】:
-
如果您的唯一目标是分析原始文本文件(比如数数......),那么这不是最简单的方法。如果您有其他原因导致一堆 excel 文件结束,请继续。
-
你不需要将整个文本文件加载到内存中,你可以read the text line by line。将文本拆分为excel是完全没有必要的。
-
@Brionius 我很确定除了小的 excel 文件之外我没有其他选择,但是另一种方法是什么?
-
@simpleBob 建议的代码 (stackoverflow.com/questions/18178089/…) 不会将整个文本加载到内存中
-
@pnuts 这是初学者的错误,抱歉。
标签: python csv export-to-excel text-mining xlrd