【发布时间】:2018-02-03 03:19:33
【问题描述】:
我是 Flink 的新手,我目前正在测试一个用例的框架,该用例包括丰富来自 Kafka 的事务,具有许多历史特征(例如,同一源和同一目标之间过去的事务数),然后为这个评分使用机器学习模型进行交易。
目前,功能都保持在 Flink 状态中,并且相同的工作是对丰富的事务进行评分。但我想将特征计算工作与评分工作分开,我不知道该怎么做。
可查询状态似乎不适合这个,因为需要作业 ID,但如果我错了,请告诉我!
我曾想过直接查询 RocksDB,但也许有更简单的方法?
对于 Flink 来说,将这项任务分成两个工作是一个坏主意吗?我们这样做是为了与 Kafka Streams 进行相同的测试,以避免复杂的工作(并检查它是否对延迟有任何积极影响)
一些额外信息:我正在使用 Flink 1.3(但如果需要,我愿意升级)并且代码是用 Scala 编写的
提前感谢您的帮助!
【问题讨论】:
标签: apache-flink