【发布时间】:2014-07-22 03:35:05
【问题描述】:
我正在尝试编写一个程序来解析一系列 HTML 文件并将生成的数据存储在 .csv 电子表格中,这非常依赖于正确位置的换行符。我已经尝试了所有可以找到的方法来从某些文本中去除换行符,但无济于事。相关代码如下所示:
soup = BeautifulSoup(f)
ID = soup.td.get_text()
ID.strip()
ID.rstrip()
ID.replace("\t", "").replace("\r", "").replace("\n", "")
dateCreated = soup.td.find_next("td").get_text()
dateCreated.replace("\t", "").replace("\r", "").replace("\n", "")
dateCreated.strip()
dateCreated.rstrip()
# debug
print('ID:' + ID + 'Date Created:' + dateCreated)
生成的代码如下所示:
ID:
FOO
Date Created:
BAR
同一个程序的这个和另一个问题一直让我陷入困境。帮助会很棒。谢谢。
编辑:想通了,这是一个非常愚蠢的错误。而不是仅仅做
ID.replace("\t", "").replace("\r", "").replace("\n", "")
我应该做的
ID = ID.replace("\t", "").replace("\r", "").replace("\n", "")
【问题讨论】:
-
尝试打印
repr(ID)以查看其中可能包含哪些字节?否则,也许尝试字符串格式而不是连接? -
打印 repr(ID) 和 repr(dateCreated) 给了我 u'\nFOO\n' u'\nBAR\n'。我已经尝试将替换设置为 (u"\n", u"") 但这没有做任何事情。
标签: python text beautifulsoup