使用scrapy从网站抓取数据时如何获得干净的结果答案

【问题标题】：How to get a clean result when scraping a data from website using scrapy使用scrapy从网站抓取数据时如何获得干净的结果
【发布时间】：2013-03-24 12:52:10
【问题描述】：

我是 python 新手，我正在尝试从黄页中抓取数据。我能够刮掉它，但我得到了一个混乱的结果。

这是我得到的结果：

2013-03-24 20:26:47+0800 [scrapy] INFO: Scrapy 0.14.4 started (bot: eyp)
2013-03-24 20:26:47+0800 [scrapy] DEBUG: Enabled extensions: LogStats, TelnetConsole, CloseSpider, WebService, CoreStats, MemoryUsage, SpiderState
2013-03-24 20:26:47+0800 [scrapy] DEBUG: Enabled downloader middlewares: HttpAuthMiddleware, DownloadTimeoutMiddleware, UserAgentMiddleware, RetryMiddleware,DefaultHeadersMiddleware, RedirectMiddleware, CookiesMiddleware, HttpCompressionMiddleware, ChunkedTransferMiddleware, DownloaderStats
2013-03-24 20:26:47+0800 [scrapy] DEBUG: Enabled spider middlewares: HttpErrorMiddleware, OffsiteMiddleware, RefererMiddleware, UrlLengthMiddleware, DepthMiddleware
2013-03-24 20:26:47+0800 [scrapy] DEBUG: Enabled item pipelines: 
2013-03-24 20:26:47+0800 [eyp] INFO: Spider opened
2013-03-24 20:26:47+0800 [eyp] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min)
2013-03-24 20:26:47+0800 [scrapy] DEBUG: Telnet console listening on 0.0.0.0:6023
2013-03-24 20:26:47+0800 [scrapy] DEBUG: Web service listening on 0.0.0.0:6080

我怎样才能得到一个干净的结果？我只想获取姓名、地址、电话号码和链接。

顺便说一句，我用来执行此操作的代码是；

from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
from eyp.items import EypItem
class EypSpider(BaseSpider):
    def parse(self, response):
        hxs = HtmlXPathSelector(response)
        titles = hxs.select('//ol[@class="result"]/li')
        items = []
        for title in titles:
            item = EypItem()
            item['title'] = title.select(".//p/text()").extract()
            item['link'] = title.select(".//a/@href").extract()
            items.append(item)
        return items

【问题讨论】：

在item['title'] 中，您似乎在选择<li> 中的每个<p> 元素。您是否应该更精确地选择您想要的内容？如果你想刮name，phone number，address，link，你的项目真的应该只有title和link吗？您不应该更准确地选择要抓取的链接吗？不是每个链接，就像您对<p> 所做的那样？在寻求帮助之前，您应该学习基本手册，您不觉得吗？
我在这里给了你 3 个我看到的问题。
阅读Item Loaders。

标签： python-2.7 web-scraping scrapy scrape scraper

【解决方案1】：

您的代码有点乱，但我会尽力提供帮助：

from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
from scrapy.item import Item, Field
import string

class EypItem(Item):
    name = Field()
    address = Field()
    phone = Field()

class eypSpider(BaseSpider):
    name = "eyp.ph"
    allowed_domains = ["eyp.ph"]
    start_urls = ["http://www.eyp.ph/home-real-estate/search/real-estate/davao/cat/real-estate-brokers"]
    def parse(self, response):
        hxs = HtmlXPathSelector(response)
        sites = hxs.select("//li/div[@class='details']")
        items = []
        for site in sites:
            itemE = EypItem()
            itemE["name"] = site.select("normalize-space(p[1]/text())").extract()
            itemE["address"] = site.select("normalize-space(p[2]/text())").extract()
            itemE["phone"] = site.select("normalize-space(p[3]/text())").extract()
            items.append(itemE)
        return items

您缺少class EypItem 的定义。我已经推荐了一个。将上述内容保存为test.py 运行命令行：

$ scrapy runspider test.py -o items.json -t json

将为您提供一个名为 items.json 的带有 JSON 输出的文件。输出样本是

[{"phone": ["Phone: +63(907)6390603"], "name": ["(CARLOS A. VARGAS)"], "address": ["Mezzanine Wee Eng Apartment, Guerrero Street, Davao City, Davao Del Sur"]},
 {"phone": ["Phone: +63(921)9566577"], "name": ["(ROGELIO G. CARBIERO)"], "address": ["Sto. Nino Heights, Pantinople Village, Davao City, Davao Del Sur"]},
 {"phone": ["Phone: +63(917)3137855"], "name": ["(FLORIZEL C. CHAVEZ)"], "address": ["12 Tulip Street, El Rio Vista Village P4a, Davao City, Davao Del Sur"]},
..........

【讨论】：

她在另一个文件中有定义。 from eyp.items import EypItem 但那里有好处。那里的normalize-space 交易是什么？
normalize-space 是使用 xpath 调用删除空格。如其他地方所述，Item Loaders 可能是更合适的方法。