【发布时间】:2020-12-09 10:41:50
【问题描述】:
我正在尝试从电子邮件中抓取表格并删除所有特殊字符(\r\n 等),然后再写入 csv 文件。
我已经设法抓取了数据,但是 列包含在我无法删除的 '\r\n' 中(我是新手)
表试图抓取:
Python 代码:
for emailid in items:
# getting the mail content
resp, data = m.fetch(emailid, '(UID BODY[TEXT])')
text = str(data[0][1])
tree = BeautifulSoup(text, "lxml")
table_tag = tree.select("table")[0]
tab_data = [[item.text for item in row_data.select("td")]
for row_data in table_tag.select("tr")]
print(table_tag)
for data in tab_data:
writer.writerow(data)
print(' '.join(data))
结果:
\r\n快速编号。\r\n \r\n订单号=\r\n\r\n \r\n部件号\r\n \r\n描述\r\n \r\ nUOM=\r\n\r\n \r\n订购数量\r\n \r\n接收数量\r\n \r\n接收日期\r\n(dd/mm/yyyy)\r\n \r \n其他信息\r\n \r\nE03B1A\r\n \r\nE0015130\r\n \r\nYK71114105=\r\np>\r\n \r\n彩顶组件 (R)=\r\n\r\n \r \nPIECE\r\n \r\n1\r\n \r\n1\r\n \r\n06/10/2020=\r\np>\r\n \r\n \r\nE03B1E\r\n \r\nE0015134\r\n \r\nYK78804497=\r\np>\r\n \r\nDIE BUTTON=\r\np>\r\n \r\nPIECE\ r\n \r\n4\r\n \r\n4\r\n \r\n06/10/2020=\r\np>\r\n \r\n
预期结果
- 快速编号 订货号 零件编号
- nE03B1A nE0015130 nYK71114105
- nE03B1E nE0015134 nYK78804497
提前致谢(这是我的第一篇文章,所以请温柔)
【问题讨论】:
标签: python beautifulsoup