【问题标题】:Real time prediction of online data using Spark Streaming and Machine Learning使用 Spark Streaming 和机器学习实时预测在线数据
【发布时间】:2018-01-05 19:55:57
【问题描述】:

如何设计用于实时交易数据的架构以将其分类为欺诈与否?

随机森林分类器 ML 模型是使用 Scala 和 Spark MLLib 使用历史数据开发、训练和测试并持久化的。

实时事务数据正在使用 Apache Kafka 从一个主题获取,Spark Streaming 处理并写入另一个主题以供分类器 ML 模型进行预测。

我的担心: 如何使用上述机器学习模式提供和获取从 Kafka 主题收到的预测当前事务数据

使用经过训练和测试的 ML 模型获得预测的在线当前单笔交易数据的最佳做法是什么?

欢迎提出任何设计建议。

【问题讨论】:

  • IMO,您应该将获得的 ML 模型封装在一个对象(单例)中,并使用该对象映射即将到来的数据。
  • 谢谢@pcejrowski。我为模型创建了一个 scala 对象,并使用 1000 条记录进行了训练和测试(70:30)。有用!。现在我错过了为这个模型提供实时数据的链接。我是否应该将其作为测试数据提供给模型,例如。 val 预测 = model.transform(realTimeData)?
  • 是的,我想是的 :)

标签: apache-spark spark-streaming apache-spark-mllib random-forest


【解决方案1】:

【讨论】:

  • 谢谢@gosanjeev。
猜你喜欢
  • 2017-04-29
  • 1970-01-01
  • 2019-06-13
  • 2017-06-05
  • 2023-03-04
  • 1970-01-01
  • 1970-01-01
  • 2012-11-16
  • 1970-01-01
相关资源
最近更新 更多