【问题标题】:How many images per .tfrecord file (for training tensorflow object detection API)?每个 .tfrecord 文件有多少张图像(用于训练 tensorflow 对象检测 API)?
【发布时间】:2020-06-24 17:34:21
【问题描述】:

在对象检测 API using your own data set 文档中,描述了如何将整个训练集分片到多个文件中。然而,他们只说

“当你有超过几千个例子时,将你的数据集分片成多个文件是有益的:...”

我想知道作为要训练的图像数量的函数的大量分割。

就每个文件的实例数而言,是否存在最佳大小,还是文件大小更重要?

(以防万一发生任何变化,我最终想在 Google AI 平台上训练对象检测 API 模型。)谢谢。

【问题讨论】:

    标签: tensorflow tensorflow-datasets google-cloud-ml object-detection-api tfrecord


    【解决方案1】:

    (1) 文件数量多于worker/gpus 的数量,以便每个worker 可以读取自己的文件。

    (2) 尝试拥有每个数百 MB 的文件,因为 GCS 的吞吐量很高,但第一个字节的时间很长。

    【讨论】:

    • 所以没有理由拥有超过 {num_workers} 个文件?例如,如果我使用一个 TPU,一个巨大的 .tfrecord 文件就可以了吗?
    • 如果你只使用一个TPUcore,那么,是的,一个大文件就可以了。
    • 谢谢@Lak!您是否有任何指向支持您所有声明的任何文档的链接(无论如何这似乎都是合理的)?
    • TF 团队分片图像 TF 记录的经验法则是每个 tfrecord 文件 100 到 200 个图像。
    猜你喜欢
    • 1970-01-01
    • 2019-06-28
    • 2018-05-15
    • 1970-01-01
    • 1970-01-01
    • 2019-06-30
    • 2018-04-18
    • 2019-08-16
    • 1970-01-01
    相关资源
    最近更新 更多