【发布时间】:2018-07-19 17:27:00
【问题描述】:
我需要向一个新数据库中插入大量数据。就像 lot 的数据一样,在这个查询的上下文中,甚至纳秒也算在内。我正在使用 activerecord-import 批量插入 Postgres,但这对于这个问题的范围并不重要。这是我需要的:
对于现有数据库中的每条记录,我需要一个如下所示的数组:
[uuid, timestamp, value, unit, different_timestamp]
问题是 uuid 存储在我循环访问该对象的父对象上,因此 #pluck 对除此之外的每个组件都有效。更烦人的是它存储为实际的 uuid,而不是字符串,并且还需要在新数据库中存储为 uuid(不是字符串)。我不确定,但我认为在#pluck 内使用SELECT 会返回一个字符串。
但也许更大的问题是我需要在再次插入之前对value 的值进行转换。这是一个简单的转换,实际上只是 value / 28 或其他东西,但我发现很难将其转换为 #pluck 而不附加 #each_with_object 或其他东西(这会大大减慢速度)
这是现在的查询。根据上面概述的阻塞加载整个记录对我来说似乎真的很愚蠢。我希望有一个替代方案。
Klass.find_each do |klass|
Data.where(token: klass.token).find_each do |data|
data << [
klass.uuid,
data.added_at,
data.value / conversion,
data.unit,
data.created_at
]
end
end
不,父级和Data 现在没有关联,这不是一个选项,所以我不能急切加载或只是调用Klass.data(在此转换后它们将被链接)。
所以理想情况下,这就是我正在寻找的:
Data.where(token: klass.token).pluck(:added_at, :value, :unit, :created_at)
但使用上述参数。
【问题讨论】:
-
你不能完全绕过AR,直接说
insert into target_table (...) select ...吗?您可以在select中包含文字、计算、连接等。如果您正在导入数据,那么可能会导入到临时表中,然后在数据库中进行合并。如果您正在处理大量数据并试图加快处理速度,那么 ORM 是您最不想涉及的事情,您希望将逻辑推送到数据库中。 -
@muistooshort 遗憾的是,我必须在这个 rake 任务的某个级别上使用 activerecord,因为我们正在从各种对象中提取信息,一些相关的和一些不相关的,这些对象必须保持这些关联(或形成新的关联) ),我需要做的转换是可变的,并且取决于数据类型。不过公平地说,这里的瓶颈不是 INSERT 语句,它由
activerecord-importgem 以相当有效的方式处理。瓶颈在于我们需要将对象加载到内存中,而不仅仅是我们关心的列。
标签: ruby-on-rails ruby postgresql activerecord activerecord-import