【问题标题】:Generating articles automatically自动生成文章
【发布时间】:2013-12-23 12:24:11
【问题描述】:

这个问题是为了学习和理解特定技术是否存在。以下是场景。

我们将提供 200 个英文单词。软件可以添加额外的 40 个单词,即 200 个单词的 20%。现在,使用这些,软件应该编写对话,有意义的对话,没有语法错误。

为此,我调查了SpintaxArticle Spinning。但是你知道他们做什么,拿现有的文章重写。但这不是最好的方法(是吗?如果是请告诉我)。那么,有没有什么技术可以做到这一点呢?可能是谷歌使用的语义理论?有什么经过验证的人工智能方法吗?

请帮忙。

【问题讨论】:

  • 我闻到一股腥味......
  • @DannyBeckett:为什么会这样?\
  • 因为很多垃圾邮件都是这样写的。
  • 似乎给贫困学生一些儿童读物会更好。
  • @DonReba:不,不同的人做不同的事情。让我们从这里停止讨论,因为它超出了主题

标签: math nlp artificial-intelligence computer-science spintax


【解决方案1】:

首先,请注意:这是自然语言生成 (NLG) 研究的前沿,最先进的研究出版物还远远不够好代替人类老师。对于以英语为第二语言 (ESL) 的学生来说,这个问题尤其复杂,因为他们倾向于在将知识翻译成英语之前先用母语思考。如果我们忽略这个可怕的前奏,正常的处理方法如下:

NLG 由三个主要部分组成:

  1. 内容策划
  2. 句子规划
  3. 表面实现

内容规划:此阶段将高级沟通目标分解为结构化的原子目标。这些原子目标足够小,只需一个通信步骤即可实现(例如,在单个子句中)。

句子规划:在这里,实际的lexemes(即具有明确语义的单词或单词部分)被选为原子交流目标的一部分。词位通过谓词-论元结构连接起来。句子规划阶段还决定了句子的边界。 (例如,学生应该写“我去了那里,但她已经走了。”或“我去那里看她。她已经离开了。”……注意不同的句子边界和不同的词位,但两个答案都表明同义。)

Surface Realization:通过结合function words(限定词、助词等)和变形,将句子规划步骤中获得的半成形结构变形为适当的形式。

在您的特定场景中,已经提供了大部分单词,因此选择词位将相对简单。连接词位的谓词-论元结构需要使用合适的概率学习模型(例如hidden Markov models)来学习。保证最终语法结构正确的表面实现,应该是语法规则和statistical language models的结合。

在高层次上,请注意,内容规划与语言无关(但很可能与文化有关),而最后两个阶段与语言有关。

作为最后一点,我想补充一点,40 个额外单词的选择是我忽略的,但它与这个过程的其他部分一样重要。在我看来,这些额外的词应该根据它们与 200 个给定词的句法关系来选择。

关于更多细节,以下两篇论文提供了一个良好的开端(完整的流程架构、示例等):

  1. Natural Language Generation in Dialog Systems
  2. Stochastic Language Generation for Spoken Dialogue Systems

为了更好地理解组合关系的概念,我发现Sahlgren's article on distributional hypothesis 非常有帮助。他工作中的分布方法也可以用来学习我前面提到的谓词-论元结构。

最后,添加一些可用的工具:看看this ACL list of NLG systems。我没有用过它们,但我听说过关于 SPUD 和 OpenCCG 的好消息。

【讨论】:

  • 嗨,非常感谢。这是很棒的信息!如果我需要进一步的帮助,我会尽快回复您
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2013-07-17
  • 1970-01-01
  • 2017-08-22
  • 1970-01-01
  • 2015-06-02
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多