【发布时间】:2011-10-17 23:54:57
【问题描述】:
我想获取特定新闻源的 xml 文件,如果有任何项目将 html 新闻转换为 xml,解析页面并标记其各种特征,如日期、作者姓名、标题、内容等。 xml 或类似类型的文件。 例如看这个链接: http://daily.bhaskar.com/article/NAT-TOP-yeddyurappa-breaks-venkaiah-naidus-laptop-slaps-minister-reports-2318460.html 如何从该网页中提取内容、作者、日期等。或者,如果我能找到这个网页的提要,我可以轻松地做到这一点。但是我该如何搜索呢。
【问题讨论】:
标签: rss html-content-extraction