【问题标题】:Is it possible to tokenize feature on the fly while training?是否可以在训练时动态标记特征?
【发布时间】:2022-03-01 22:13:48
【问题描述】:

我有包含特征列(字符串)和多个标签列(多标签分类)的 CSV 文件。数据集太大而无法放入内存,因此我必须使用 make_csv_dataset 以指定的批量大小加载它。问题是我不知道如何在不超载内存的情况下标记特征列,我可以实现一个 DataProvider 来在训练时动态标记数据吗?然后我可以批量标记它,所以内存不是问题。

【问题讨论】:

  • this 可能会有所帮助。
  • 嗨 pbartkow,您能否具体说明 make_csv_dataset 中面临的问题

标签: python tensorflow machine-learning nlp


【解决方案1】:

您可以使用“pyspark(在 python 中)”和“sparkly”(在 R 中)进行动态标记 请参考此issue 和此link 来解决您的问题。

【讨论】:

    猜你喜欢
    • 2019-06-21
    • 2020-06-03
    • 2016-09-16
    • 2013-02-05
    • 2011-10-08
    • 1970-01-01
    • 2021-02-22
    • 2018-05-26
    • 2020-03-29
    相关资源
    最近更新 更多