【问题标题】:How to get reviews with xpath in R如何在 R 中使用 xpath 获得评论
【发布时间】:2021-03-14 13:17:14
【问题描述】:

我正在尝试从该网页https://www.leroymerlin.es/fp/82142706/armario-serie-one-blanco-abatible-2-puertas-200x100x50cm 上抓取评论。我在获取 XPath 时遇到了一些问题,当我运行代码时,我发现输出始终为 NULL。 代码:

library(XML)
url <- "https://www.leroymerlin.es/fp/82142706/armario-serie-one-blanco-abatible-2-puertas-200x100x50cm"
source <- readLines(url, encoding = "UTF-8")
parsed_doc <- htmlParse(source, encoding = "UTF-8")
xpathSApply(parsed_doc, path = '//*[@id="reviewsContent"]/div[1]/div[2]/div[3]/h3', xmlValue)

我一定是做错了什么!我正在尝试一切。非常感谢您的帮助。

【问题讨论】:

    标签: r xml web-scraping


    【解决方案1】:

    此网页是在加载时动态创建的,数据存储在辅助文件中,典型的抓取和 xpath 方法将不起作用。

    如果您访问浏览器的开发人员工具并转到网络选项卡。 重新加载网页并过滤 XHR 文件。查看每个文件,应该会看到一个名为“reviews”的文件,这是以 JSON 格式存储评论的文件。右键单击该文件并复制链接地址。 可以直接访问此文件:

    library(jsonlite)
    fromJSON("https://www.leroymerlin.es/bin/leroymerlin/reviews?product=82142706&page=1&sort=best&reviewsPerPage=5") 
    

    这是一个很好的参考:How to Find The Link for JSON Data of a Certain Website

    【讨论】:

    • 感谢您的回答,这对我很有帮助。
    • 你是怎么得到这个链接的?
    • 查看上面的修订,希望这能让它更清楚。如果这回答了您的问题,请考虑接受答案以关闭问题。谢谢
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-11-28
    • 1970-01-01
    • 2020-01-30
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多