【发布时间】:2013-03-11 00:13:39
【问题描述】:
尝试通过从 Twitter REST API 中拉取来创建与关键字相关联的 Twitter 用户名数据框。但是在许多搜索词(例如#rstats)上使用searchTwitter() 的查询,即使对于像n = 1000 这样的大样本,也会返回高度(>90%)的重复推文。
一个具体的例子是:
tweets <- searchTwitter("#rstats", n = 1000)
tweets.df <- do.call("rbind", lapply(tweets, as.data.frame))
df.undup <- df[duplicated(tweets.df) == FALSE,]
dim(df.undup)
我想知道如果搜索词相对稀缺,这是否是由于分页限制造成的?
【问题讨论】:
-
开发版中修复了一个错误,可能会解决此问题。试试看(通过 github 或我的网站),看看是否有帮助。