【发布时间】:2020-08-01 19:32:13
【问题描述】:
当处理数以百万计的文档并将它们保存为空余文档以供以后使用(更多处理、可视化、提取特征)时,一种明显的扩展解决方案是并行/分布式处理。这意味着每个并行进程都有自己的词汇,这些词汇可能会随着时间的推移而扩展。
在保存文档时,显然不想将词汇与文档一起保存。所以 to_disk 可能是最好的选择。为了使用 from_disk 加载文档,我们需要一个词汇表,其中包含从文档处理的时间点开始的所有内容,或者以后以及正确的过程中的所有内容。
我认为保留多个词汇并在每个文档中存储该词汇的 id 有点丑陋和笨拙。一个更好的解决方案是在所有流程完成后从每个流程的最终词汇创建一个超级词汇。然后可以使用该词汇 处理任何文件。
所以问题是:是否已经有一种方法可以将一堆词汇合并成一个包含所有这些词汇的词汇?
【问题讨论】:
标签: spacy