【问题标题】:No examples after join in Rapidminer加入 Rapidminer 后无示例
【发布时间】:2020-05-31 17:48:07
【问题描述】:

您好,我正在处理一项任务,但我遇到了问题。 有两个数据集,第一个有一些航班信息,第二个有天气信息。我想预测航班是否会延误 15 分钟或更长时间(使用决策树)。我做了以下事情:

  • 导入航班数据--选择属性--拆分数据--解析号码

我选择了以下属性:day、dep_delay_15、dep_time_planned、dest_airport、dest_city、month、origin_airport、origin_city、origin_id 和 year。 在此之后,我使用 split 将 dep_time_planned 属性分成两部分(第一部分是小时,第二部分是分钟),我已经解析了这个。

  • 导入天气数据 -- 选择属性

在这里我选择了所有的属性。 在此之后,我加入了这些数据集,但在加入之后,所有示例都消失了(属性仍然存在)。我已经尝试了一切:左,右,内连接和外连接。我制作的关键属性对是:

  • origin_id, airport_id
  • 一天,一天
  • 月、月
  • dep_time_planned_1,小时
  • 年,年

有人可以帮帮我吗?

【问题讨论】:

  • 我发现问题不在于join,而是在join之后发生的。我使用的过滤器过滤了太多。我很困惑,因为在加入之后它已经说它是空的,但它不是。感谢您的回答!

标签: rapidminer


【解决方案1】:

在不知道属性的确切内容的情况下,很难说出确切的问题是什么。

一般来说,当您要执行连接时,您希望将两个具有公共 ID 属性(或列)的数据集耦合起来。不同类型的连接之间的区别在于,ID 对是如何处理的。 最常见的(并且适合您的情况)是内部连接,您只需要那些 ID 匹配的对。 所以我的猜测是 origin_idairport_id 之间的内部连接,但当然这两列需要相同的格式和内容(如“波士顿”、“柏林”或一种常见的数字格式)。 当它们不相同时,也找不到匹配项,结果为空。

从 RapidMiner 的角度来看,您应该确保这两个属性具有相同的数据类型,并且在您的预处理之后显然不为空。

有关 RapidMiner 及其使用的一般问题,您还可以在 RapidMiner 社区中发布问题: https://community.rapidminer.com/

最好, 大卫

【讨论】:

    【解决方案2】:

    您是否尝试使用将 2 个表合并为一个的乘法函数,如果您提供指向数据集的链接或数据的任何屏幕截图只是为了了解数据,那就太好了。因为 rapid miner 完全依赖于数据类型。 谢谢。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-10-01
      • 1970-01-01
      • 1970-01-01
      • 2014-06-29
      • 1970-01-01
      • 1970-01-01
      • 2016-02-20
      • 1970-01-01
      相关资源
      最近更新 更多