【发布时间】:2018-07-03 19:12:13
【问题描述】:
数据说明
数据反映了用户在回答有四个答案的问题时如何对在线图书推荐网站上的图书进行评分。用户可以选择多个答案。
目标是按性别获得分布图,其中X 轴作为答案(X1,X2..) 和Y 轴作为书籍数量以及密度叠加。男性和女性相互重叠会很棒。
book_id user_id rate X1 X2 X3 X4 Gender genre
40 001 4.5 0 1 0 0 male fiction
48 001 3.5 1 0 0 1 male fiction
54 001 4.0 1 0 0 0 male fiction
79 001 2.5 1 0 1 0 male non-fiction
80 001 4.5 0 0 1 0 male non-fiction
95 001 5.0 1 0 1 0 male non-fiction
95 002 3.0 0 0 0 1 Female non-fiction
99 002 4.5 0 0 1 0 Female non-fiction
02 002 0.5 0 0 0 0 Female non-fiction
05 002 4.5 1 0 1 0 Female non-fiction
54 002 4.0 0 1 0 0 Female fiction
79 002 2.5 1 0 1 0 Female non-fiction
80 002 4.5 0 0 1 0 Female non-fiction
07 002 4.5 1 0 1 0 Female fiction
07 003 5.0 1 0 1 0 Female fiction
09 003 4.0 0 0 1 0 Female auto-bio
54 003 4.0 1 0 0 0 Female fiction
79 003 2.5 1 0 1 0 Female non-fiction
80 003 4.5 0 0 1 0 Female non-fction
17 004 3.5 1 0 0 0 male auto-bio
21 004 5.0 1 0 1 0 male auto-bio
21 005 5.0 0 1 1 0 male auto-bio
17 005 0.5 0 0 0 1 male auto-bio
20 005 5.0 0 0 1 0 male fiction
20 006 1.5 0 0 0 1 male fiction
21 006 5.0 0 0 1 0 male auto-bio
21 007 2.0 1 0 0 0 male auto-bio
21 008 4.5 1 0 1 0 Female auto-bio
20 008 4.5 1 0 1 0 Female fiction
07 008 4.5 1 0 1 0 Female fiction
22 009 5.0 0 0 1 0 male fiction
54 009 4.0 1 0 0 0 male fiction
79 009 2.5 1 0 1 0 male non-fiction
80 010 4.5 1 0 1 0 male non-fiction
22 010 4.5 0 1 1 0 male fiction
22 011 0.5 0 0 1 0 Female fiction
28 011 3.5 1 0 0 0 Female auto-bio
两个用户可以对同一本书进行评分,并以相同或不同的方式回答问题。这会为每本书创建两条记录。考虑到这一点,如果按Gender 分组并对每一列求和,则可以从性别水平分布开始。
df %>% group_by(Gender) %>% summarize(x1 = sum(X1), x2 = sum(X2), x3=sum(X3),x4 =sum(X4))
Gender x1 x2 x3 x4
<fct> <int> <int> <int> <int>
1 Female 10 1 13 1
2 male 10 3 11 3
除了得到剧情之外:我还有以下问题: 也只是为了确认这不是女性答案 x1 的唯一书籍数量,因为同一本书可以由多个用户回答。反而会是多少女性选择一个具体的答案?
【问题讨论】:
-
你想显示分布的变量是什么?评级?我不清楚
X1等的总和与分布有何关系 -
@camille 我想展示一些具有 X1、X2 答案...并按性别分类的书籍。
标签: r ggplot2 dplyr histogram density-plot