非学无以广才,非志无以成学。
没有找到原文章,只读了预讲会的ppt。出自于香港理工大学曹自强,Faithful to the Original: Fact Aware Neural Abstractive Summarization。收录于AAAI 2018。
本文主要做了三个方面的工作:
(1)基于卷积神经网络的sequence to sequence框架,将主题模型整合进自动摘要模型中。使用了开放的信息抽取和依存分析技术从源文本中提取实际的事实描述。
(2)提出dual-attention sequence-to-sequence框架来强制以源文本和提取的事实描述为条件的生成。
目录
Fact Extraction | Dependency Parsing
生成摘要不仅要保持信息充分,更重要的是信息的忠实性。
与抽取摘要不同,生成式摘要在融合原文本的过程中往往会创造出虚假的事实。曹自强在报告中介绍,目前有近 30% 的最先进的神经系统都会受到这种问题的困扰。以前生成式摘要主要着眼于信息性的提高,但作者认为忠实性(也即「信」)是生成摘要的前提,非常重要。
Solution
将现有的事实编码到摘要系统中
1.从源头提取事实
OpenIE
依存分析
2.开发基于双重注意力的seq2seq模型,以迫使生成的生成条件同时使用源文本和提取的事实
Fact Extraction | OpenIE
1.(主题;谓词;对象)三元组
2.为一模一样的关系保留最长的三倍句子
Fact Extraction | Dependency Parsing
1.标签(州长;依赖)元组
2.选择与预测相关的标签(例如,nsubj,dobj)和重要的修改器(例如,amod)
Statistics of Facts
原文中的单词在摘要中被使用的可能性要高出40%
1.真正概况句子的意思
2.支持基于理解的压缩摘要的实践
Summarization Model
1.Two encoders (sentence and facts)
2.A dual-attention decoder
3.A context selection gate network (learn the importance of the sentence and facts)
Framework
Data and Setting
Dataset
Evaluation
Informativeness Automatic ROUGE
Faithfulness Manual annotation with FAITHFUL, FAKE and UNCLEAR labels
Informativeness Performance
我们的模型比其他方法获得更高的ROUGE分数,门网络优于连接,主要是由于事实的简洁本质。
Faithfulness Performance
s2s倾向于将单词复制到谓词附近并将其视为主语和宾语,事实确实指定了谓词和它的主语和宾语之间的关系。
Conclusion
摘要首先研究了抽象概括的忠实问题;使用相对成熟的技术来提取事实;开发双重注意力机制的s2s模型,以生成内容丰富且忠实的摘要。
为了避免在生成摘要中产生虚假事实,作者使用了开放的信息抽取和依存分析技术从源文本中提取实际的事实描述,然后提出 dual-attention sequence-to-sequence 框架来强制以原文本和提取的事实描述为条件的生成。实验表明,他们的方法可以减少 80% 的虚假事实。
LINK
AAAI 2018预讲会在哈工大成功举办,25篇顶会文章讲了什么(下)