【发布时间】:2015-07-03 07:49:41
【问题描述】:
我正在通过一个项目学习 Python——Facebook 消息分析器。我下载了我的数据,其中包括我所有消息的 messages.htm 文件。我正在尝试编写一个程序来解析这个文件并输出数据(消息的数量、最常用的单词等)
但是,我的 messages.htm 文件是 270MB。在 shell 中创建 BeautifulSoup 对象进行测试时,任何其他文件(全部小于 1MB)都可以正常工作。但我无法创建messages.htm 的bs 对象。这是错误:
>>> mf = open('messages.htm', encoding="utf8")
>>> ms = bs4.BeautifulSoup(mf)
Traceback (most recent call last):
File "<pyshell#73>", line 1, in <module>
ms = bs4.BeautifulSoup(mf)
File "C:\Program Files (x86)\Python\lib\site-packages\bs4\__init__.py", line 161, in __init__
markup = markup.read()
File "C:\Program Files (x86)\Python\lib\codecs.py", line 319, in decode
(result, consumed) = self._buffer_decode(data, self.errors, final)
MemoryError
所以我什至无法开始使用这个文件。这是我第一次处理这样的事情,我只是在学习 Python,所以任何建议都将不胜感激!
【问题讨论】:
标签: python html parsing beautifulsoup html-parsing