【问题标题】:what is features and how to interpret in RFormula什么是特征以及如何在 RFormula 中解释
【发布时间】:2021-10-02 15:09:39
【问题描述】:

我试图了解 RFormula 在 MLflow 或 spark 中是什么。

我找到了这些:

https://george-jen.gitbook.io/data-science-and-apache-spark/rformula https://spark.apache.org/docs/latest/api/python/reference/api/pyspark.ml.feature.RFormula.html

但仍然无法理解如何完全解释 RFormula。我不知道如何解释下表

基于公式“y ~ x+ s”,y与x和s有关,但在表格中y=0且x=0且s=a时(即第三行),则特征为[0 ,1] 且 label 为 0,我该如何解释呢。

我找到了this,但仍然无法理解我解决这个问题的方法。

【问题讨论】:

  • 这个问题已经回答了,如下图:Click Here
  • 是的,但是正如我在问题中所说并且在问题中也提到了该链接,我无法遵循逻辑。我无法理解如何将 y、x、s 和特征放在一起以获得标签值

标签: r pyspark mlflow


【解决方案1】:

所以你的标签是 y。你用 rformula 解析 x 和 s。

x 保持不变:

+-----------+---+
|      x    | x |
+-----------+---+
|     1.0   |1.0|
|     2.0   |2.0|
|     0.0   |0.0|
+-----------+---+

s:

+-----------+---+
|       s   | s |
+-----------+---+
|       a   |1.0|
|       b   |0.0|
|       a   |1.0|
+-----------+---+

我希望我能回答你的问题。 Rformula 只是对字符串进行转换、标准化并解析成向量。

【讨论】:

  • 为什么x保持不变,你能解释一下吗?我应该如何解释你的答案中的“/”?为什么s会变成sth?
  • x 保持不变,因为你有不同的值,不需要标准化。如果你看 s,那么你会看到 a 两次。所以transformer需要给他同样的数值来标准化它们。
  • 感谢@JAdel,但我无法理解如何解释这些功能。你知道有很好解释的来源吗,我在这个话题上找不到太多
  • databricks.com/de/p/ebook/learning-spark-from-oreilly 获取这本免费书。有一个主题可以解释您要查找的内容。据我了解,标签以前就在那里。 Rformula 所做的只是转换您的数据框并添加一个名为 features 的新列,其中包含矢量化变量。
  • 感谢这本书,我将阅读第 10 章,希望我能更好地理解这一点,会及时通知您,谢谢
猜你喜欢
  • 2022-06-20
  • 2021-11-21
  • 2013-10-13
  • 1970-01-01
  • 2020-05-28
  • 2017-12-16
  • 2021-06-21
  • 2018-04-14
  • 2020-03-06
相关资源
最近更新 更多