【问题标题】:Problems with an m:m Merge (Stata)m:m 合并的问题(Stata)
【发布时间】:2021-01-28 17:07:38
【问题描述】:

我正在尝试合并两个具有不同来源失业率的数据集,第一个数据集的结构如下:

它有 30 多个变量,但我仅将其作为示例列出。此外,每次观测只测量一年,埃及是 2005 年。

year    country Gender  Unemployment
2005    EGY     Female    7.6
2005    EGY     Male      9.2
2005    EGY     Total      .
2006    EGY     Female    7.6
2006    EGY     Male       9
2006    EGY     Total      .

第二个的结构如下,但它来自年度调查,因此每个国家/地区每年都有三个条目(总计,男性,女性)。从 1995 年到 2019 年,每个国家/地区都有。

country Gender  year     Unemployment
EGY     Total   2005        12
EGY     Male    2005        7
EGY    Female   2005        17.5

因此,我尝试使用 1:1 和 1:m 合并来合并两个数据集,对于这两个数据集,我得到: “变量国家年份不能唯一标识主数据中的观察结果”

但是,合并使用 m:m,如下所示,

merge m:m  country year using "Documents\LMI.dta"

感谢尼克的建议,我合并了三元组:

merge 1:1 country year Gender cusing "Documents\LMI.dta"

而且效果很好!

【问题讨论】:

    标签: merge append stata


    【解决方案1】:

    从表面上看,您的数据集由 country year Gender 的三元组标识,因此具有这些变量的 merge 1:1 资格。所以,m:m 合并的缺点似乎是它是完全错误的。

    那句话并没有解决接下来的任何问题:

    1. Unemployment 在两个集合中都如此命名,那么您期望或希望 Stata 做什么?

    2. 在您的数据示例中,Unemployment 的值在不同的数据集中是不同的,尽管真实数据可能并非如此。

    【讨论】:

    • 谢谢!在将性别与国家年份包括在内后,它进行了 1:1 合并。关于第二点,即使是真实的失业率数据也确实不同,因为一个是通过模拟国际劳工组织估计来衡量的,而另一个来自国家统计机构。
    • 在这种情况下,它们是真正不同的变量,应该在你merge之前被赋予不同的名称。
    • 好点,是的,我已将它们重命名以反映其数据来源:ILO 与国家统计局。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-09-02
    • 2017-12-06
    • 1970-01-01
    • 1970-01-01
    • 2022-01-08
    • 2016-08-23
    相关资源
    最近更新 更多