【问题标题】:What is image captioning and how is it used in Visual Question Answer?什么是图像字幕以及它如何在视觉问答中使用?
【发布时间】:2019-10-18 03:48:49
【问题描述】:

我正在努力解决这个问题,但遇到了困难。

据我了解:

Image Captioning 是生成图像文本描述的过程。它同时使用自然语言处理和计算机视觉来生成字幕。


来自this论文:

它直接模拟给定先前单词和图像生成单词的概率分布。


因此,如果我理解正确,使用一些将图像和先前文本作为输入的模型,它会生成下一个单词的概率。

以“用于生成图像描述的深度视觉语义对齐”paper 为例


但是如何在 VQA 中使用它(视觉问答是一个关于构建计算机系统来回答以图像和自然语言呈现的问题的研究领域。)?

问题的答案是否取自图像生成的标题?

【问题讨论】:

    标签: image-processing deep-learning computer-vision conv-neural-network recurrent-neural-network


    【解决方案1】:

    通常,您融合图像特征 (CNN) 和问题特征 (RNN),将它们传递到另一个网络,其中 softmax 输出对应于一个单词的答案。见这里:https://arxiv.org/pdf/1505.00468v6.pdf

    我可以想象尝试使用解码器网络为答案生成句子,但这些将更难评估。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2022-01-10
      • 2015-03-13
      • 2013-10-25
      • 2014-11-19
      • 1970-01-01
      相关资源
      最近更新 更多