【发布时间】:2017-01-24 14:54:27
【问题描述】:
我很确定在某个时候有人问过这个问题并得到了回答,但我是一个新手,真的缺乏有效找到问题和解决方案的词汇。我有一个简单的任务,由于内部内存限制,我无法在 Excel 中执行,但我对 SQL 或 R 的了解不够,无法弄清楚如何在其中任何一个平台上执行。
我有两张表,一张有带有唯一 ID 号的唯一条目,另一张有这些 ID 号的多个副本,每个都显示不同的数字(代表职业生涯中的每个新薪水)。我正在尝试将每个薪水映射到原始的唯一 ID 表,为每个可能的更改创建新列 (Salary1:Salary50)。最终,我还需要绘制每个更改的日期和差异以进行分析。这是一个例子:
这是唯一的 ID 表:
Table 1
ID Salary1 Salary2 Salary3 Salary4 Salary5
1 ? ? ? ? ?
2 ? ? ? ? ?
3 ? ? ? ? ?
4 ? ? ? ? ?
5 ? ? ? ? ?
这是带有重复 ID 的工资表和我想要的信息:
Table2
ID Salary SalaryDate
1 10 1/1/2014
1 11 1/1/2015
1 12 1/1/2016
2 12 1/1/2015
2 13 1/1/2016
3 10 1/1/2016
4 10 1/1/2014
4 12 1/1/2015
4 14 1/1/2016
5 10 1/1/2016
最终状态应该是这样的:
Table3
ID Salary1 Salary2 Salary3 Salary4 Salary5
1 10 11 12 0 0
2 12 13 0 0 0
3 10 0 0 0 0
4 10 12 0 0 0
5 10 0 0 0 0
我构建了一个多标准 Vlookup 以将所有内容提取到正确的列中,但数据集有超过 100,000 行要检查,因此它无法在内存方面完成它。谁能建议我如何在 Access、R、SPSS 中做同样的事情,或者我是否可以使用一些高效的 Excel-VBA 代码?
感谢您的帮助!
【问题讨论】:
标签: r excel vba ms-access spss