【发布时间】:2016-07-21 18:32:53
【问题描述】:
我正在处理一个数据集,其中有学生对教师的评分。有些学生不止一次给同一位老师打分。 我想对数据做的是使用以下标准对其进行子集化:
1) 保留所有唯一的学生 ID 和评分
2) 在学生对老师进行两次评分的情况下,只保留 1 个评分,但要随机选择要保留的评分。
3) 如果可能的话,我希望能够在每个分析文件顶部的 munging 脚本中运行代码,并确保为每个分析创建的数据集完全相同(设置种子?)。
# data
student.id <- c(1,1,2,3,3,4,5,6,7,7,7,8,9)
teacher.id <- c(1,1,1,1,1,2,2,2,2,2,2,2,2)
rating <- c(100,99,89,100,99,87,24,52,100,99,89,79,12)
df <- data.frame(student.id,teacher.id,rating)
感谢您就如何前进提供任何指导。
【问题讨论】:
标签: r