【发布时间】:2017-11-03 19:20:12
【问题描述】:
我是 R 编程新手。我在 mac OS X El Capitan V10.11.6 中使用 R 3.4.2。
当我尝试从以下 url 读取数据时,出现错误。
数据源链接: https://dumps.wikimedia.org/other/pageviews/2017/2017-10/pageviews-20171001-010000.gz
该文件包含四个字段:语言、维基百科页面标题、页面在这一小时内收到的请求数、返回内容的总大小(以字节为单位)。它是由空格分隔的 csv 文件,没有标题行。
我尝试使用以下代码读取表格:
df <- read.table("https://dumps.wikimedia.org/other/pageviews/2017/2017-10/pageviews-20171001-010000.gz", sep = " ", stringsAsFactors = FALSE, header = FALSE, encoding = "UTF-8")
我得到的错误是
扫描错误(文件 = 文件,什么 = 什么,sep = sep,quote = quote,dec = dec,: 第 1 行没有 2 个元素 另外:警告信息: 在 read.table("https://dumps.wikimedia.org/other/pageviews/2017/2017-10/pageviews-20171001-010000.gz", : 第 1 行似乎包含嵌入的空值
我也尝试使用 readr 包,仍然失败。我使用的代码如下
df <- read_delim("https://dumps.wikimedia.org/other/pageviews/2017/2017-10/pageviews-20171001-010000.gz", delim = " ", col_names = FALSE)
顺便说一句,当我用 spark scala 读取这些数据时,没有问题。
【问题讨论】:
-
添加
devtools::session_info()的输出可能有助于对根本原因进行分类
标签: r