【问题标题】:How to train millions of doc2vec embeddings using GPU?如何使用 GPU 训练数百万个 doc2vec 嵌入?
【发布时间】:2019-05-27 07:37:36
【问题描述】:

我正在尝试根据用户浏览历史(标记为 user_id 的 URL)训练 doc2vec。我使用chainer深度学习框架。

有超过 2000 万个嵌入(user_id 和 url)需要初始化,这些嵌入不适合 GPU 内部存储器(最大可用 12 GB)。 CPU 上的训练非常慢。

我正在尝试使用这里给出的 chainer 编写的代码 https://github.com/monthly-hack/chainer-doc2vec

如果有的话,请建议尝试的选项。

【问题讨论】:

  • 你自己发现了什么options to try(然后解雇了?)?

标签: deep-learning nlp word-embedding chainer


【解决方案1】:

也可以参考chainer官方word2vec的例子。

您是否已经尝试过使用 GPU 进行训练?通常只将batch size的数据提取到GPU显存中,因此数据总量(20M)不影响GPU显存限制。

【讨论】:

  • 20M 是在训练开始前需要初始化嵌入并复制到 gpu 的词汇量。数据大小不是问题,因为它可以批量处理。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-10-30
  • 1970-01-01
  • 2020-09-26
  • 1970-01-01
  • 2016-08-17
相关资源
最近更新 更多