【发布时间】:2017-04-21 10:39:22
【问题描述】:
我想知道是否可以使用 AngleSharp 从 HTMLDocument 中提取格式化文本。我正在使用以下代码来提取文本。我遇到的问题是提取的文本一起运行,每个元素之间没有中断。
var parser = new HtmlParser();
var document = parser.Parse("<script>var x = 1;</script> <h1>Some example source</h1><p>This is a paragraph element</p>");
var text = document.Body.Text();
这将返回以下文本
一些示例来源这是一个段落元素
理想情况下,我希望它返回 一些示例来源这是一个段落元素 每个节点文本值之间存在一些分隔。
【问题讨论】:
-
由于文档中没有分隔,因此返回的文本中不会有任何内容。如果你想要这样的东西,你必须手动处理文档结构并决定在哪里放置分隔符。
-
感谢 Sami 的回复,我很感激这个事实,这是一个如此频繁的要求,我希望它可以作为库的一部分提供。特别是在需要解析 HTML 文档中的文本的情况下。例如,在说 Elastic Search 中提取文本内容和索引将是每天都会发生的事情。
标签: c# anglesharp