【问题标题】:Scrape Trivago issue刮 Trivago 问题
【发布时间】:2015-08-14 17:52:54
【问题描述】:

我正在使用以下代码来抓取网页:

$ch =curl_init("http://www.trivago.de/?aDateRange%5Barr%5D=2015-08-07&aDateRange%5Bdep%5D=2015-08-10&iRoomType=7&bIsTotalPrice=false&iPathId=3577&iGeoDistanceItem=1473453&iViewType=0&bIsSeoPage=false&bIsSitemap=false&");
 $fp = fopen("example_homepage.txt", "w");

 curl_setopt($ch, CURLOPT_FILE, $fp);
 curl_setopt($ch, CURLOPT_HEADER, 0);

$output = curl_exec($ch);
curl_close($ch);

但我得到的网页与真实页面不正确或不完整。

我得到的这个不完整:

What I getting by scrape

实际网页是这样的:
Actual page

【问题讨论】:

    标签: php curl web-scraping urlfetch


    【解决方案1】:

    您的 CURL 应该与手头的任务类似:

    $ch = curl_init();
    curl_setopt($ch,CURLOPT_URL,'http://yourwebiste.com');
    curl_setopt($ch,CURLOPT_RETURNTRANSFER,1);
    curl_setopt($ch,CURLOPT_CONNECTTIMEOUT,5); //5 seconds
    $result = curl_exec($ch); //$result now holds fetched data
    curl_close($ch);
    

    代码是我自己的 CURL 库的一部分。请记住,您获取的不是文件,而是返回的 HTML 内容。

    【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2023-04-02
    • 2022-01-02
    • 2023-03-13
    • 2014-08-31
    • 1970-01-01
    • 1970-01-01
    • 2016-01-09
    • 2021-11-11
    相关资源
    最近更新 更多