【发布时间】:2013-07-09 06:17:03
【问题描述】:
我试图从以下网页中抓取 R 中的到期日期数据:https://www.theice.com/productguide/ProductSpec.shtml?specId=251#expiry。此页面包含多个选项卡,到期日期只是其中之一。我使用的代码是
library(RCurl)
Canola <- 'https://www.theice.com/productguide/ProductSpec.shtml?specId=251#expiry'
WS <- getURL(Canola,ssl.verifypeer=FALSE)
library(XML)
ParsedData <- htmlParse(WS)
CanolaExpDate <- readHTMLTable(ParsedData)
names(CanolaExpDate)
然而,最终输出是第一个标签产品规范上的交易时间。
我是网络抓取的新手,对html不了解。请指教。
【问题讨论】:
-
你能显示预期的输出吗?
-
我想在 data.frame 中包含到期日期选项卡上的所有数据
-
你想加入你的
CanolaExpDate列表吗?CanolaExpDate$tradingHours?? -
我不想要交易时间,我需要到期日信息。基本上,我抓取了错误的数据。交易时间数据在产品规格选项卡上,我想要的数据在到期日期选项卡上。
-
是的,我知道您想要到期日期。我不清楚哪些数据是到期日(并非所有人都有财务背景)。也就是说,您的意思是提取链接中提到的表格中的所有日期吗?哪一栏? FTD?LTD?....这就是我要求预期输出的原因。
标签: html r web-scraping