【发布时间】:2016-08-22 15:08:25
【问题描述】:
我想在 Spark Executors 内存(长期缓存)中维护一个缓存(HashMap),以便在执行器上运行的所有任务(在不同时间)都可以在那里进行查找,也可以更新缓存。
这在 Spark 流中可行吗?
【问题讨论】:
-
我的要求是我有一个远程键值数据存储(小 - 总大小约 50MB)。此数据可能会在一小时内更新一次,一小时内只需更改一次,例如添加、删除或更改新的键值对。我的 Spark Streaming 工作需要非常频繁地查找这家商店。所以我想将此键值数据存储在节点/执行器缓存中,以便始终在该执行器上运行的所有作业都可以查找此数据并在 10 分钟内刷新一次。有办法吗?
标签: caching apache-spark hashmap streaming executor