【发布时间】:2012-04-29 17:15:10
【问题描述】:
我正在尝试抓取以下网站,因为 XML 格式错误并且不包含我需要的所有数据:
http://www.cafebonappetit.com/menu/your-cafe/pitzer
但是,当我使用 Mechanize 获取文档时,我只得到:
{meta_refresh}
{title "Collins | Claremont McKenna Cafés | Café Bon Appétit"}
{iframes}
{frames}
{links
#<Mechanize::Page::Link "Welcome" "http://www.cafebonappetit.com/">
#<Mechanize::Page::Link "Our Approach" "javascript://">
#<Mechanize::Page::Link
"Kitchen Principles"
"http://www.cafebonappetit.com/our-approach/kitchen-principles">
.....
}
不幸的是,我显然需要了解表格中的内容(我猜它们是 iFrame)。有什么想法吗?
谢谢!
【问题讨论】:
-
该页面没有任何框架或 iframe。 Mechanize 只是报告有 0 个 iframe、0 个框架、N 个链接和 1 个标题。要查找表格,只需使用
page.search('table')
标签: ruby nokogiri mechanize hpricot