【发布时间】:2014-12-16 05:04:56
【问题描述】:
我正在使用 Mailgun 的出色 Inbound Routing 来解析我收到的电子邮件,删除 HTML 和电子邮件签名,这让我得到了原始的文本正文。
下面是返回的一个小例子:
{
"stripped-html": "<html><body><div style=\"font-family: Helvetica; font-size: 13px;\">Testing with <b>bold<\/b> and <u>stuff<\/u><br><\/div><div style=\"font-family: Helvetica; font-size: 13px;\"><u><br><\/u><\/div><div style=\"font-family: Helvetica; font-size: 13px;\">:)<\/div> \n <div><div><br><\/div><div>-- <\/div><div>Tim Smith<\/div><div><br><\/div><\/div> \n \n <p style=\"color: #A0A0A8;\"><\/p> \n <div> \n <br><\/div><\/body><\/html>",
"stripped-text": "Testing with bold and stuff\n\n:)",
"stripped-signature": "-- \nTim Smith"
}
我想要做的是采用简单的stripped-text,但也复制基本格式,如粗体、斜体和下划线。在这个例子中,单词“bold”是bold,而世界“stuff”带有下划线。
解决这个问题的最佳方法是什么?
【问题讨论】:
-
你最好解析 HTML 而不是剥离的文本,因为剥离的文本没有关于应该或可以格式化什么的信息。
标签: regex email parsing mailgun