【问题标题】:Use python to find best fit averages for multiple factos使用 python 找到多个因素的最佳拟合平均值
【发布时间】:2021-06-18 02:10:42
【问题描述】:

这不是一个非常具体的问题,但我想知道是否有人能指出我正确的方向。 本质上,我有一个 json 数据列表,如下所示:

[
    {"name":"Alex",
"Homework 1 grade":"98",
"Homework 2 grade":"48",
"Homework 3 grade":"38",
"Final grade":"94",
"Minutes spoken":"38",
"pass/fail":"Pass"},

{"name":"Tommy",
"Homework 1 grade":"38",
"Homework 2 grade":"53",
"Homework 3 grade":"92",
"Final grade":"47",
"Minutes spoken":"138",
"pass/fail":"Fail"},
]

这对成千上万的“学生”来说是这样,我想知道如何使用 python 来确定如何映射通过失败的公式。 (即:我怎么能算出“发言分钟数”占您通过/未通过的机会的 25%,而“期末成绩”占您通过/未通过的机会的 30%)

抱歉,这是一个含糊不清的问题,但我想知道是否有人知道我可以进一步学习如何做到这一点的起点?

【问题讨论】:

    标签: python modeling


    【解决方案1】:

    我的理解是你想知道“分钟发言”、“最终成绩”这两个变量或特征对“通过/失败”标签的贡献。

    首先,您可以尝试计算相关性。

    通过简单的谷歌搜索,我们发现两个变量之间的统计关系称为它们的相关性。相关性可以是正的,这意味着两个变量都向同一方向移动,也可以是负的,这意味着当一个变量的值增加时,其他变量的值会减小。而当它接近于零时,一个变量值的增减一般不会影响另一个变量值。

    使用 Python Library Pandas 将您的 JSON 数据转换为 DataFrame,然后计算每个变量与标签之间的相关性。

    看看这个帖子:Use .corr to get the correlation between two columns

    【讨论】:

    • 感谢您所做的一切!我会检查所有这些。
    猜你喜欢
    • 1970-01-01
    • 2014-08-22
    • 2015-08-21
    • 1970-01-01
    • 1970-01-01
    • 2014-08-29
    • 2018-03-16
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多