【发布时间】:2018-07-12 21:01:45
【问题描述】:
我正在尝试进行分析,我试图根据三个不同的属性创建两个相似的样本。我想先创建这些样本,然后进行分析,看看这两个样本中哪个更好。分类变量是 sales_group、age_group 和 country。所以我想让两个样本,比如国家的比例、年龄和销售额在两个样本中都相似。
例如:样本 A 和 B 中包含以下变量: ID 国家/地区年龄销售额
样本A中国家的比例为:
美国- 58% 英国- 22% 印度-8% 法国- 6% 德国- 6%
样本B中国家的比例为: 印度- 42% 英国- 36% 美国-12% 法国-3% 德国- 5%
其他分类变量也是如此:age_group 和 sales_group
提前感谢您的帮助
【问题讨论】:
-
样本数据和期望的结果确实会有所帮助,对于“样本”的含义、样本的大小、拥有的数据量等提供一些定义或指导。
-
寻求帮助时,您应该包含一个简单的reproducible example,其中包含可用于测试和验证可能解决方案的示例输入和所需输出。