【问题标题】:Determine coefficients for some function确定某些函数的系数
【发布时间】:2013-04-28 12:55:33
【问题描述】:

我的任务可能与数据分析甚至神经网络有关。

我们有一个合作伙伴的数据源,即工作门户。源值是与特定员工相关的不同属性的数组:

  • 他\她的性别,
  • 年龄,
  • 多年经验,
  • 投资组合(完成的项目数量),
  • 专业和专业(网页设计、网页编程、管理等),
  • 许多其他(总共大约 20-30 个)

每个员工都有自己的工资(小时)率。所以,在数学上,我们有一些函数

F(attr1, attr2, attr3, ...) = A*attr1 + B*attr2 + C*attr3 + ...

系数未知。但是我们知道函数对指定参数的结果(假设我们知道一个有 20 年经验和 10 个作品集的男性程序员的工资是每小时 40 美元)。

所以我们必须以某种方式找到这些系数(A、B、C...),这样我们才能预测任何员工的薪水。这是最重要的目标。

另一个目标是找出哪些参数是最重要的——换句话说,哪些参数会导致函数结果发生重大变化。所以最后我们必须有这样的东西:“最重要的属性是多年的经验;然后是投资组合;然后是年龄等。”

可能存在不同职业之间差异太大的情况 - 例如,我们可能无法将网页设计师与经理进行比较。在这种情况下,我们必须将它们按组拆分,并分别为每个组计算这些评分。但最终我们需要找到每个群体都通用的“共享”论点。

我正在考虑神经网络,因为这是他们可能处理的事情。但我对他们完全陌生,完全不知道该怎么做。

我非常感谢任何帮助 - 使用哪些工具、什么算法,甚至是伪代码示例等。

非常感谢。

【问题讨论】:

  • 搜索词:线性回归、最小二乘和正规方程。
  • 好的,谢谢 DrC!我会尝试用谷歌搜索它。

标签: statistics regression data-processing


【解决方案1】:

这是(线性)回归的最基本示例。您正在使用线性函数对数据进行建模,并且需要估计参数。

请注意,这实际上是经典数理统计的一部分;还不是数据挖掘,但要老得多。

有多种方法。鉴于可能会有异常值,我建议使用 RANSAC。

至于重要性,这不是归结为“A B 还是 C 哪个最大”?

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2015-10-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-08-23
    相关资源
    最近更新 更多