【发布时间】:2019-10-18 03:48:49
【问题描述】:
我正在努力解决这个问题,但遇到了困难。
据我了解:
Image Captioning 是生成图像文本描述的过程。它同时使用自然语言处理和计算机视觉来生成字幕。
来自this论文:
它直接模拟给定先前单词和图像生成单词的概率分布。
因此,如果我理解正确,使用一些将图像和先前文本作为输入的模型,它会生成下一个单词的概率。
以“用于生成图像描述的深度视觉语义对齐”paper 为例
但是如何在 VQA 中使用它(视觉问答是一个关于构建计算机系统来回答以图像和自然语言呈现的问题的研究领域。)?
问题的答案是否取自图像生成的标题?
【问题讨论】:
标签: image-processing deep-learning computer-vision conv-neural-network recurrent-neural-network