【问题标题】:R Reading in Tweets Issue: Created_At is NAR 在推文中阅读问题:Created_At 是 NA
【发布时间】:2017-02-12 21:14:42
【问题描述】:

我有一个我的推文的 CSV 文件,其中包含以下列:

created_at | text | lon | lat 

我正在使用:

tweets_df <- read.csv("mytweets.csv", header=TRUE, StringsAsFactors=FALSE)

但是,当我输入时:

tweets_df$created_at

一切都只是不适用。

这是同一“created_at”条目的示例:

Thu Sep 15 23:59:16 +0000 2016

稍后我打算使用其中一种将其转换为更易于管理的格式,但我什至无法正确读取它...我在这里做错了什么?

time_format <- "%a %b %d %H:%M:%S %z %Y"
tweet_df$created_at <- as.POSIXct(striptime(tweet_df$created_at, time_format, tz="GMT"), tz="GMT)

但是,是的,谁能帮我弄清楚为什么他们只是读作 NA?

编辑:修复它;需要执行以下操作:

tweets_df <- read.csv("myweets.csv", header=TRUE, StringsAsFactors=FALSE, fileEncoding="latin1")

fileEncoding = "latin1" 修复了它!

【问题讨论】:

  • 如果排除StringsAsFactors=FALSE会发生什么?
  • 同样的问题,该列仍有 NA (created_at)
  • 查看帮助文件?strptime。某些格式说明符,例如%z,只能用于输出格式(POSIXtcharacter)。
  • 但这并不能解决 read.csv 的问题,因为 vals 是 NA 对吧?
  • 我投票决定将此问题作为题外话结束,因为似乎他确实发布了该问题的答案?让我有点困惑...

标签: r date datetime twitter


【解决方案1】:

需要在 read.csv 中使用 fileEncoding="latin1"。这解决了它!

【讨论】:

    猜你喜欢
    • 2017-08-31
    • 1970-01-01
    • 1970-01-01
    • 2016-09-24
    • 1970-01-01
    • 2023-03-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多