【问题标题】:how to get all the html tags in hierarchy except its content?如何获取除其内容之外的层次结构中的所有 html 标签?
【发布时间】:2015-02-05 23:42:07
【问题描述】:

我想获取给定 html 内容的 html 标签模式或布局。

例如:以下是给定的html内容

<p style="font-size: 11px">
  <strong>Sample Director</strong><br>
  ABC Name<br>
  Test Sign Association<br>
  12345 N. 85th Ave., Ste. D345<br>
  Test, NY  85308<br>
  Wk.:  602-385-1234;  Cell:   602-079-1234<br>
  Fax:  602-987-1244<br>
  <a href="mailto:abce@test.org">abce@test.org</a> 
</p>

期望的输出:

<p><strong></strong><br><br><br><br><a></a></p>

我已经检查了一些正则表达式和 gem,但它们都提供了删除标签的解决方案。我试过tr,但这只会导致&lt;/&gt;

非常感谢任何帮助。

【问题讨论】:

  • @Biffen 好的,感谢您提供有关不在语言上使用正则表达式的有用信息。然而,我也使用 Nokogiri 来解析 html,但它没有获取所有子节点标签的方法。有什么帮助吗?

标签: html ruby-on-rails ruby regex


【解决方案1】:

试试这个:

(<\/?\w+)(*SKIP)(*F)|[\w\s\.\:\-"'\=\@\,\;]+       // replace with ""(blank)  

  (<\/?\w+)(*SKIP)(*F)|[^<>]+

Live demoupdate demo

【讨论】:

  • 太棒了...你能解释一下正则表达式吗
  • @Hetal Khunti (&lt;\/?\w+)(*SKIP)(*F) 这部分用于跳过带有&lt;tag 的标签词,下一部分匹配没有&lt;&gt; 的任何字符
  • @Avinash Raj 我尝试过使用 php。我不知道红宝石。如果它对他有帮助,那就更好了。
  • ruby 不支持上述 PCRE 动词。
  • 好的,请帮助他。这个正则表达式是你的。你给我一个问题的答案。link
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2012-04-10
  • 2015-11-02
  • 2015-07-07
  • 1970-01-01
  • 2013-05-01
  • 2012-08-09
  • 1970-01-01
相关资源
最近更新 更多