【发布时间】:2017-09-23 15:52:49
【问题描述】:
我正在开发一个网络抓取工具项目,该项目通过“RedditExtractoR”R 包从 Reddit 收集数据。 该包允许通过搜索查询获取帖子的 URL。然后我从每个 URL 的帖子中获取内容。
问题是某些 URL 包含来自另一种语言的符号,R 无法正确处理。
例如下面的 URL 返回错误: "http://www.reddit.com/r/Barca/comments/4g4fmp/match_thread_fc_barcelona_vs_sporting_de_gij\363n/"
In file(con, "r") : cannot open URL 'https://www.reddit.com/r/Barca/comments/4g4fmp/match_thread_fc_barcelona_vs_sporting_de_gij������n/.json?limit=500': HTTP status was '503 Service Unavailable'
原网址为:https://www.reddit.com/r/Barca/comments/4g4fmp/match_thread_fc_barcelona_vs_sporting_de_gijón/
据我了解,存在一些编码问题。 R 无法处理此 URL 字符串,因为其中包含由 R 重新编码为“\363n”的“ó”符号。
那么,如何更改编码以在 R 中正确处理这种 URL?
【问题讨论】:
-
你有没有尝试使用 URLencode() 函数?
-
有趣!这是我从 URLencode() 得到的结果:reddit.com/r/Barca/comments/4g4fmp/… 不幸的是,URL 不起作用。也许你可以为我的案例提供一些具体的参数?
标签: r encoding web-scraping