【发布时间】:2020-11-04 16:41:18
【问题描述】:
我在 Nvidia Tesla P100 上使用 tensorflow centernet_resnet50_v2_512x512_kpts_coco17_tpu-8 对象检测模型来提取 bounding box 和 keypoints 以检测人视频。使用 tensorflow.org 的预训练,我每秒可以处理大约 16 帧。有什么办法可以提高这个模型的评估速度吗?以下是我一直在研究的一些想法:
-
修剪模型图,因为我只检测到一种类型的对象(人)
- 尚未成功执行此操作。在构建模型时更改
label_map似乎不会提高性能。
- 尚未成功执行此操作。在构建模型时更改
-
硬编码输入大小
- 尚未找到执行此操作的好方法。
-
使用 TensorRT 之类的工具将模型编译为优化形式
- 最初转换为 TensorRT 的尝试没有任何性能提升。
-
批处理预测
- 看起来预训练模型的批量大小硬编码为 1,到目前为止,当我尝试使用
model_builder更改它时,我发现性能有所下降。 - 我的 GPU 利用率约为 75%,所以我不知道这里是否有很多收获。
- 看起来预训练模型的批量大小硬编码为 1,到目前为止,当我尝试使用
【问题讨论】:
标签: tensorflow tensorflow2.0 object-detection object-detection-api tensorrt