【发布时间】:2016-08-28 02:31:30
【问题描述】:
我有一个网页“http://www.jabong.com/playdate-Off-White-Casual-Top-1342500.html?pos=1”,我可以获取它的 HTML 代码...但我需要提取特定信息...从上面的页面我需要以下信息:
类型:休闲上衣,面料:棉,袖子:半袖,领口:圆领,合身:常规,洗涤护理:手洗,使用温和的洗涤剂,洗涤前取下腰带/胸针,颜色:米白色, 面料细节:95/5 棉莱卡,款式:图形,SKU:PL527KA99JYQINDFAS
【问题讨论】:
-
你需要一个网页抓取包,比如rvest。
-
@alistaire :您没有得到正确的问题..我能够获得完整的 HTML 代码...我只需要提取特定信息...所以我猜 Stringr 包会有所帮助..但我需要一个可以提取特定信息的代码..谢谢
-
rvest可以抓取,是的,但是大部分抓取都是解析,这是你需要做的。不要用正则表达式解析 HTML;这是个坏主意。
标签: r html-parsing dplyr rcurl stringr