【问题标题】:Compare two sets with large amount of data to find the same values比较具有大量数据的两组以找到相同的值
【发布时间】:2013-03-22 11:40:08
【问题描述】:

好的,问题看起来像这样。我有一组n 数据库行与空列position。我需要使用该集合(来自 3 个单独的列)中的地址数据(不同的组合等 - 没关系)将它们与另一组 m 元素(也来自数据库,其中包含地址数据和需要位置)。

因为这些集合非常大(大约百万条记录,并且操作经常执行),我需要一些非常快速的算法来比较这两个集合并找到我需要的数据。

我试图找到一些东西,但我不知道它是否是任何众所周知的数学问题(也许是图论?)。

[编辑]

结构太大,无法在此处描述。但我会为此做一个例子。

设置 1。

|[ID] | [CITY] | [STREET] | [POSTCODE] | [LOCATION] |
|-----|--------|----------|------------|------------|
| 1   | City1  | Street1  | 00000      | NULL       |
| 2   | City2  | Street2  | 11111      | NULL       |
| 3   | City3  | Street3  | 22222      | NULL       |

设置 2。

|[ID] | [SOME_KIND_OF_ADDRESS]              | [LOCATION] |
|-----|-------------------------------------|------------|
| 1   | Street 1 in City 1, 00000 blah blah | SOME_XY1   |
| 2   | Street 2 in City 1, 00001 blah blah | SOME_XY2   |
| 3   | Street 2 in City 2, 11111 blah blah | SOME_XY3   |
| 4   | Street 1 in City 4, 33333 blah blah | SOME_XY4   |

现在对于Set 1 中的每个元素,我想尝试在Set 2 中找到一些东西。在这种情况下,只会匹配 City2, Street2City1, Street1。所以结果将如下所示:

|[ID] | [CITY] | [STREET] | [POSTCODE] | [LOCATION] |
|-----|--------|----------|------------|------------|
| 1   | City1  | Street1  | 00000      | SOME_XY1   |
| 2   | City2  | Street2  | 11111      | SOME_XY3   |

【问题讨论】:

  • 请提供您的结构、数据和预期结果的示例
  • 1) 为什么结果中没有 SOME_XY1? 2)如果邮政编码总是很常见,那么您可以分组比较它们。这会快 N^2 倍(当您有 N 个不同的邮政编码时)
  • 1.我的坏 xD 对不起。 2、以后postcode可以和some_kind_of_address一起加入,所以又会出现问题。我现在明白了,我的例子有点混乱。我会改正的
  • 好的,我进行了编辑,现在一切都应该更清楚了:)
  • 要比较地址,您必须解析 Set 2 中的地址

标签: sql database algorithm graph set


【解决方案1】:

执行此操作的正确方法是解析集合 2 中的地址,然后在每个字段上创建索引。那么你的比较会非常快。

如果没有,您有什么选择?好吧,您基本上必须扫描第 2 组中的所有地址以进行比较。一些 SQL 引擎优化了字符串开头的比较(使用索引),因此一个比较可以使用索引。如果您有提取街道/城市/邮政编码的功能,那么某些数据库可以支持“功能”索引,其中元素不是函数调用的结果。

另一个选项是全文搜索。这将允许您使用称为倒排索引的结构搜索组件。

但是,我的建议是修复地址并提取您想要比较的部分。地址整改/标准化虽然不便宜也不快,但通常会通过大大简化此类请求在中期内收回成本。

【讨论】:

  • 是的,这将是最好的主意。然后我可以缓存索引数据以备将来使用,因为Set 2 很少更改。谢谢
【解决方案2】:

我会使用以下算法:

  1. 对表 A、B 进行排序
  2. 在表的开头创建 2 个指针(ptrA、ptrB)
  3. 虽然(ptrA 未结束,ptrB 未结束)

{

if (ptrA->value=ptrB->value) update column position
if (ptrA->value>ptrB->value) move prtB forward
else move ptrA forward

}

【讨论】:

  • 对数据进行排序是一个想法,但需要修改。请看我的例子。来自Set 2 的数据可以用一种奇怪的形式表示(我的意思是地址),这取决于数据的来源。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-03-11
  • 2021-03-13
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多