【发布时间】:2022-01-11 13:57:20
【问题描述】:
我正在尝试使用 rvest 对 IMDB 进行一些网页抓取,但我经常遇到语言输出问题,这可能是由于我在日本的位置。
例如,当尝试从该页面抓取电影标题时:
https://www.imdb.com/chart/top/?ref_=nv_mv_250
使用以下代码:
library(rvest)
library(tidyverse)
url <- "https://www.imdb.com/chart/top/?ref_=nv_mv_250"
read_html(url) %>%
html_nodes(".titleColumn a") %>%
html_text() %>%
tibble(title = .) %>%
head()
结果是混合了英文和日文的电影片名:
title
<chr>
1 Shôshanku no sora ni
2 Goddofâzâ
3 The Godfather: Part II
4 Dâku naito
5 12 Angry Men
6 Schindler's List
即使我屏幕上的文本,甚至当我使用 Chrome 的开发者工具检查元素时,都是英文的,但情况仍然如此。
我猜这个问题类似于 SO here 上发布的关于使用 PHP 进行抓取的问题。
有没有办法请求英文输出,最好是在一个 tidyverse 友好的管道链中?
【问题讨论】: