【发布时间】:2014-01-30 17:59:55
【问题描述】:
从 searchTwitter 输出中删除重复项工作正常,问题是 searchTwitter() 函数提供的原始推文数量始终为 100,无论 n=1000 或 n=3000。
这是我使用的代码:
tweets <- searchTwitter("#rstats", n = 1000)
tweets.df <- do.call("rbind", lapply(tweets, as.data.frame))
df.undup <- tweets.df[duplicated(tweets.df) == FALSE,]
dim(df.undup)
生成的数据框总是有 100 行,这意味着原始推文的数量是 100。
dim(df.undup)
tweets [1] 100 12
我的问题是:这是否与 twitter API 有关,我该如何解决这个问题。
我在 Mac OS X 10.7.5 上使用 R 版本 2.15.3。
【问题讨论】:
-
自从 API 切换后我也遇到了类似的问题,但没有时间调试,所以我暂时切换到 Python(非常相似的步骤/过程)。我相当确定它与 API 相关。 (顺便说一句,在 10.8.3 上使用 2.15.3)。我认为他们在开发中修复了它(看看 (stackoverflow.com/questions/15548316/…)
标签: r twitter duplicates