【问题标题】:how to create cutomized dataset for google tensorflow attention ocr?如何为 google tensorflow attention ocr 创建自定义数据集?
【发布时间】:2018-02-27 10:34:58
【问题描述】:

我可以根据this question 创建 TFRecord 文件。但我不知道是应该将所有图像写入单个 TFRecord 文件还是创建多个 TFRecord 文件。另外,我不太了解日期集的config file。 “charset_filename”文件中应该包含哪些内容?它应该是数据集中所有可能字符的集合吗?在生成 TFRecord 文件时,我们将字符转换为整数 id,这个文件应该包含字符还是它们的 id?

【问题讨论】:

    标签: python tensorflow ocr


    【解决方案1】:

    我是否应该将所有图像写入单个 TFRecord 文件或 创建多个 TFRecord 文件

    它取决于训练数据的大小,并且会影响并行预取以填充队列。我建议每个分片约 1000 个样本(一个带有 num-of-total 后缀的 tfrecord 文件,例如/path/to/my/dataset-00000-of-00512)。

    “charset_filename”文件中应该有什么内容?

    它是一个文本文件,它定义了整数 id 和相应字符之间的映射。它具有以下格式: <id><TAB><character> 文件中的某一行应为 <nul> 字符定义一个 id - 模型在到达序列末尾时输出的特殊字符,以将输出填充到固定长度。

    例如,这里是 FSNS 数据集charset file 的摘录:

    0    
    133 <nul>
    1   l
    2   ’
    3   é
    4   t
    

    请注意,&lt;SPACE&gt; 字符的 id=0。

    它应该是数据集中所有可能字符的集合吗?

    是的。此文件应为数据集中的所有字符定义 id 到字符的映射。

    在生成 TFRecord 文件时,我们将字符转换为整数 id, 这个文件应该包含字符还是它们的 id?

    两者。文件中的每一行都应采用&lt;id&gt;&lt;TAB&gt;&lt;character&gt; 的形式。

    【讨论】:

    • 谢谢,这很有帮助。我已经设法在我的自定义数据集上进行模型训练。但是,亏损还在继续增加。尝试改变学习率,动量。结果是一样的。你能看看this question吗?
    猜你喜欢
    • 2018-10-01
    • 2019-09-03
    • 2017-12-12
    • 1970-01-01
    • 1970-01-01
    • 2021-02-28
    • 1970-01-01
    • 2019-06-19
    • 2018-07-29
    相关资源
    最近更新 更多