【问题标题】:searchTwitter() in twitteR package for R (2.15.2) - high number of duplicate tweetsR (2.15.2) 的 twitteR 包中的 searchTwitter() - 大量重复推文
【发布时间】:2013-03-11 00:13:39
【问题描述】:

尝试通过从 Twitter REST API 中拉取来创建与关键字相关联的 Twitter 用户名数据框。但是在许多搜索词(例如#rstats)上使用searchTwitter() 的查询,即使对于像n = 1000 这样的大样本,也会返回高度(>90%)的重复推文。

一个具体的例子是:

tweets <- searchTwitter("#rstats", n = 1000)
tweets.df <- do.call("rbind", lapply(tweets, as.data.frame))

df.undup <- df[duplicated(tweets.df) == FALSE,]
dim(df.undup)

我想知道如果搜索词相对稀缺,这是否是由于分页限制造成的?

【问题讨论】:

  • 开发版中修复了一个错误,可能会解决此问题。试试看(通过 github 或我的网站),看看是否有帮助。

标签: r twitter


【解决方案1】:

首先,代码中的第 3 行应该是 df.undup &lt;- tweets.df[duplicated(tweets.df) == FALSE,] 吗?

我猜你得到的推文少于 1000 条,当你运行上面的代码时(我得到了 604,dim(df.undup) 的结果是604 10)。所以我猜,问题不在于重复出现,而是推文数量少于 1000 条。

如果您查看创建日期,最早的推文来自 3 月 14 日(一周前)。 Twitter API 通常不允许访问超过 7-9 天的推文。我想这就是为什么您收到的推文数量较少的原因。

要检查,看看dim(tweets.df)dim(undup.df) 是否返回相同的东西。

【讨论】:

  • 谢谢!第 3 行应该是 == FALSE,因为如果观察结果重复,duplicated() 返回逻辑 TRUE - 我正在寻找非重复行。我总是得到dim(tweets.df) 等于我的n= - 你从dim(df.undup) 得到604 作为行数吗?感谢您输入有关日期限制的信息 - 这可以解释 >1000 个结果,但不能解释(必然?)重复。
  • 糟糕,意思是
  • 对,那部分是我想要的。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2014-03-29
  • 2014-07-01
  • 2014-01-20
  • 1970-01-01
  • 2012-10-19
  • 2021-01-09
相关资源
最近更新 更多