【发布时间】:2015-06-23 20:36:08
【问题描述】:
我正在从 barney 网站上抓取项目 ID,我在从输出中删除 unicode 时遇到问题。例如,我想获取项目 ID 为 503777359,但获取项目 ID 的输出是 [u '503777359']。我希望输出是这样的:- 503777359。我该怎么办?
d3 包含:“Fairfax 海军蓝和白色 Glenn 格子棉府绸正装衬衫。翻领、单纽扣筒形袖口、肩部过肩和背面垂直折缝、衬衣下摆、珍珠母纽扣提供海军蓝/白色棉机洗制造日本我们的模特身高 6 英尺 1 英寸/185 厘米,所穿尺码为 15.5。 款式#503777359"
d2=item.find("div",{"class":"panel-body standard-p"})
d3=d2.text
print d3
p_id = re.findall(r'[0-9]{9}',d3)
print p_id
【问题讨论】:
-
输出在哪里或
d3中有什么? -
很抱歉,现在检查。我编辑了我的问题!
-
能否请您也发布您正在抓取的链接?
-
几个问题:是否有一个列表页面将您引导至此 URL?你从哪里得到你正在使用的 URL?是否有很长的 URL 列表,您的代码将在这些 URL 上运行? URL 中的产品 ID 没有用吗?
标签: python unicode web-scraping beautifulsoup