【发布时间】:2012-09-02 19:38:21
【问题描述】:
我正在寻找一些开源框架或算法,通过清理 HTML 代码、删除垃圾内容从任何 HTML 页面中提取文章文本内容,类似于 Pocket(又名 Read It Later)软件所做的。
此问题已在以下链接中提供: How to extract text contents from html like Read it later or InstaPaper Iphone app? 但我的要求有点不同。我想通过保留字体和样式 (CSS) 来清理 HTML 并使用图像提取主要内容。
【问题讨论】:
标签: c# .net html c#-4.0 article