【发布时间】:2018-03-18 15:09:41
【问题描述】:
假设我在文件夹中有一组文本 .html 文件。
我需要处理每个文件并删除特定 HTML 标记的内容,包括标记本身。文件处理后必须重写。
例子:
- 删除所有
<script>块 - 删除所有
<div class="test-class">块,包括内部内容
sed -i -e 's/REGEX//g' *.html 等正则表达式工具不适合 HTML 处理。因此,我正在寻找专注于 HTML 解析的解决方案,例如基于 XPATH 的 //script、//div[@class="test-class"]。
最好的方法是什么?
【问题讨论】:
-
我建议使用 XML/HTML 解析器 (xmlstarlet, xmllint ...)。
-
如果您 edit 您的问题包括一个简洁、可测试的样本输入和预期输出的示例,那么我希望您能得到帮助。
标签: javascript html xpath sed html-parsing