【发布时间】:2020-12-17 13:21:03
【问题描述】:
我对 Spark 比较陌生,在理解 Spark ML 方面有些困难。
我的问题是我有 3TB 的文本,我想在上面训练 Word2Vec 模型。我正在运行的服务器有大约 1TB 的内存,所以我暂时无法保存文件。
文件保存为我导入 Spark 的镶木地板。我的问题是 Spark ML 库是否分发 Word2Vec 培训?如果是这样,在处理这么大的文本文件时我需要担心什么吗?如果没有,是否有在训练 Word2Vec 时流式传输这些数据?
【问题讨论】:
-
大概训练是分布式的。你为什么要担心这个呢?
-
@mck 我担心如果没有分发培训,那么它会将文件保存在本地而不是从 RDD 访问它。
标签: python pyspark nlp apache-spark-mllib word2vec