【发布时间】:2013-01-29 06:42:48
【问题描述】:
我尝试使用 Nokogiri(在 Ruby 上)解析一些非常简单的 HTML:
<span>Address</span><br />
123 Main Street<br />
Sometown<br />
<span>Telephone</span><br />
<a href="tel:212-555-555">212-555-555</a><br />
<span>Hours</span><br />
M-F: 8:00-21:00<br />
Sat-Sun: 8:00-21:00<br />
<hr />
我唯一拥有的标签是围绕页面内容的<div>。我想要的每一件事前面都有一个<span>Address</span> 类型标签。后面可以跟另一个span 或最后一个hr。
我想将地址(“123 Main Street\nSometown”)、电话号码(“212-555-555”)和营业时间作为单独的字段来结束。
有没有办法使用 Nokogiri 获取信息,或者使用正则表达式更容易做到这一点?
【问题讨论】:
-
将上面的文字分割成
(?=<span>)?然后清理标签? -
使用 Nokogiri。总是,总是,总是使用解析器而不是正则表达式来处理 HTML/XML,除非你喜欢痛苦。
-
你能发布你想要的输出吗?
-
@A.D.我在帖子中添加了一些信息。
标签: ruby regex nokogiri text-parsing