【发布时间】:2012-04-04 07:25:59
【问题描述】:
这是对此处提供的关于使用sqldf()的答案的跟进
https://stackoverflow.com/a/1820610
在我的特定情况下,我有一个超过 1.1 亿行的制表符分隔文件。我想选择匹配 460 万个标签 ID 的行。
在下面的代码中,标签ID在tag.query
但是,虽然该示例适用于较小的查询,但它不能处理上述较大的示例:
sql.query <- paste('select * from f where v2 in (', tag.query, ')', sep='')
selected.df <- sqldf(sql.query, dbname = tempfile(), file.format = list(header = F, row.names = F, sep="\t", skip=line.where.header.is))
对替代方法有什么建议吗?
【问题讨论】:
-
@screechOwl。 sqldf 确实使用了一个实际的数据库。事实上,它可以使用 4 个不同的实际数据库。
-
我的错,我没有意识到它有索引功能。谢谢。