任何树都可以转换为保留其组成部分的二叉树。这是一个适用于nltk.Tree 输入的简单解决方案:
from nltk import Tree
from functools import reduce
def binarize(tree):
"""
Recursively turn a tree into a binary tree.
"""
if isinstance(tree, str):
return tree
elif len(tree) == 1:
return binarize(tree[0])
else:
label = tree.label()
return reduce(lambda x, y: Tree(label, (binarize(x), binarize(y))), tree)
如果您想要普通元组而不是 Tree,请将最后一个 return 语句替换为:
return reduce(lambda x, y: (binarize(x), binarize(y)), tree)
例子:
>>> t = Tree.fromstring('''(ROOT (S (NP (NNP Oracle))
(VP (VBD had) (VP (VBN fought) (S (VP (TO to)
(VP (VB keep) (NP (DT the) (NNS forms))
(PP (IN from) (S (VP (VBG being) (VP (VBN released))))))))))))''')
>>> bt = binarize(t)
>>> print(t)
(ROOT
(S
(NP (NNP Oracle))
(VP
(VBD had)
(VP
(VBN fought)
(S
(VP
(TO to)
(VP
(VB keep)
(NP (DT the) (NNS forms))
(PP (IN from) (S (VP (VBG being) (VP (VBN released))))))))))))
>>> print(bt)
(S
Oracle
(VP
had
(VP
fought
(VP
to
(VP (VP keep (NP the forms)) (PP from (VP being released)))))))
这将确保二进制结构,但不一定是正确的结构。大覆盖解析器会生成非二进制分支,因为某些附件选择非常困难。 (考虑经典的“我看到带望远镜的女孩”;PP“带望远镜”在物体内部,还是 VP 的一部分?)。所以请谨慎行事。