【发布时间】:2018-10-26 00:46:22
【问题描述】:
我正在使用默认的 Scrapy Images Pipeline,并将我的数据导出为 CSV。最后一个字段自动填充一个包含原始 url、本地路径和校验和的数组。但是,我只需要一个包含本地路径的字符串。我该怎么做?
【问题讨论】:
我正在使用默认的 Scrapy Images Pipeline,并将我的数据导出为 CSV。最后一个字段自动填充一个包含原始 url、本地路径和校验和的数组。但是,我只需要一个包含本地路径的字符串。我该怎么做?
【问题讨论】:
我猜你会得到类似的结果
item["images"] = [
{'checksum': '2b00042f7481c7b056c4b410d28f33cf',
'path': 'full/0a79c461a4062ac383dc4fade7bc09f1384a3910.jpg',
'url': 'http://www.example.com/files/product1.pdf'}]
在 Pipeline 的 process_item() 方法中,执行此操作
def process_item(self, item, spider):
images = item["images"]
del item["images"]
item['path'] = []
for k,v in images.iteritems():
item['path'].extend([v['path']])
【讨论】:
process_item,只要写我告诉你的代码。