【问题标题】:how to create cutomized dataset for google tensorflow attention ocr?如何为 google tensorflow attention ocr 创建自定义数据集?
【发布时间】:2018-02-27 10:34:58
【问题描述】:
我可以根据this question 创建 TFRecord 文件。但我不知道是应该将所有图像写入单个 TFRecord 文件还是创建多个 TFRecord 文件。另外,我不太了解日期集的config file。 “charset_filename”文件中应该包含哪些内容?它应该是数据集中所有可能字符的集合吗?在生成 TFRecord 文件时,我们将字符转换为整数 id,这个文件应该包含字符还是它们的 id?
【问题讨论】:
标签:
python
tensorflow
ocr
【解决方案1】:
我是否应该将所有图像写入单个 TFRecord 文件或
创建多个 TFRecord 文件
它取决于训练数据的大小,并且会影响并行预取以填充队列。我建议每个分片约 1000 个样本(一个带有 num-of-total 后缀的 tfrecord 文件,例如/path/to/my/dataset-00000-of-00512)。
“charset_filename”文件中应该有什么内容?
它是一个文本文件,它定义了整数 id 和相应字符之间的映射。它具有以下格式:
<id><TAB><character>
文件中的某一行应为 <nul> 字符定义一个 id - 模型在到达序列末尾时输出的特殊字符,以将输出填充到固定长度。
例如,这里是 FSNS 数据集charset file 的摘录:
0
133 <nul>
1 l
2 ’
3 é
4 t
请注意,<SPACE> 字符的 id=0。
它应该是数据集中所有可能字符的集合吗?
是的。此文件应为数据集中的所有字符定义 id 到字符的映射。
在生成 TFRecord 文件时,我们将字符转换为整数 id,
这个文件应该包含字符还是它们的 id?
两者。文件中的每一行都应采用<id><TAB><character> 的形式。
【讨论】:
-
谢谢,这很有帮助。我已经设法在我的自定义数据集上进行模型训练。但是,亏损还在继续增加。尝试改变学习率,动量。结果是一样的。你能看看this question吗?