【问题标题】:How to write a configuration file to tell the AllenNLP trainer to randomly split dataset into train and dev如何编写配置文件告诉 AllenNLP 训练器将数据集随机拆分为训练和开发
【发布时间】:2021-03-13 09:26:41
【问题描述】:

AllenNLP 的官方文档建议在配置文件中指定“validation_data_path”,但如果想从单一来源构建数据集,然后以给定的比例随机拆分为训练和验证数据集怎么办?

AllenNLP 支持这个吗?非常感谢您的 cmets。

【问题讨论】:

    标签: allennlp


    【解决方案1】:

    AllenNLP 尚无此功能,但我们正在努力实现这一目标。

    与此同时,这是我为 VQAv2 阅读器所做的:https://github.com/allenai/allennlp-models/blob/main/allennlp_models/vision/dataset_readers/vqav2.py#L354

    此阅读器支持 Python 切片语法,例如,您可以将 data_path 指定为 "my_source_file[:1000]" 以从 my_source_file 获取前 1000 个实例。您还可以通过设置data_path: ["file1", "file2[:1000]", "file3[1000-"]] 来提供多个路径。您可能可以窃取该文件中的前两个块(第 354 到 369 行)并将它们放入您自己的数据集阅读器中以获得相同的结果。

    【讨论】:

      猜你喜欢
      • 2019-05-01
      • 2016-09-04
      • 2016-12-01
      • 2018-05-26
      • 2018-09-08
      • 2019-04-22
      • 1970-01-01
      • 2013-06-29
      • 2021-09-28
      相关资源
      最近更新 更多