【发布时间】:2017-05-10 10:26:03
【问题描述】:
我正在从 HTML 文档的正文中获取文本,如下所示。当我尝试对术语“Exhibit 99”进行正则表达式扫描时,我得到一个不匹配的,即一个空数组。但是,在 html 中,我确实看到了“Exhibit 99”,尽管检查元素用  99 显示它。如何摆脱这些 HTML 字符并像搜索常规字符串一样搜索“Exhibit 99”?
url = "https://www.sec.gov/Archives/edgar/data/1467373/000146737316000912/fy16q3plc8-kbody.htm"
doc = Nokogiri::HTML(open(url))
body = doc.css("body").text
body.scan(/exhibit 99/i)
【问题讨论】: