【发布时间】:2018-01-05 19:55:57
【问题描述】:
如何设计用于实时交易数据的架构以将其分类为欺诈与否?
随机森林分类器 ML 模型是使用 Scala 和 Spark MLLib 使用历史数据开发、训练和测试并持久化的。
实时事务数据正在使用 Apache Kafka 从一个主题获取,Spark Streaming 处理并写入另一个主题以供分类器 ML 模型进行预测。
我的担心: 如何使用上述机器学习模式提供和获取从 Kafka 主题收到的预测当前事务数据?
使用经过训练和测试的 ML 模型获得预测的在线当前单笔交易数据的最佳做法是什么?
欢迎提出任何设计建议。
【问题讨论】:
-
IMO,您应该将获得的 ML 模型封装在一个对象(单例)中,并使用该对象映射即将到来的数据。
-
谢谢@pcejrowski。我为模型创建了一个 scala 对象,并使用 1000 条记录进行了训练和测试(70:30)。有用!。现在我错过了为这个模型提供实时数据的链接。我是否应该将其作为测试数据提供给模型,例如。 val 预测 = model.transform(realTimeData)?
-
是的,我想是的 :)
标签: apache-spark spark-streaming apache-spark-mllib random-forest