【发布时间】:2011-03-04 15:40:03
【问题描述】:
我正在使用 dbpedia 提取框架。看起来很不错,我很高兴构建维基百科页面的 AST 并提取链接(使用 WikiParser)。然而,虽然我从解析中得到了一个很好的结构化树,但我注意到文本节点仍然包含许多格式标记(例如,用于斜体的撇号、粗体等)。出于我的目的,这些没有帮助 - 我只想要纯文本。
我可以花一些时间编写自己的代码来删除它,但我假设这样的东西对 dbpedia 很有用 - 并且它存在于库中的某个地方。我对吗?如果是这样 - 剥离到纯文本的额外功能在哪里?
否则 - 有没有人知道任何其他(最好是 scala)包来去除 mediawiki 标记?
编辑
应要求提供更多详细信息。以下标记:
''An italicised '''bit''' of text'', <b>Some markup</b>
来自 dbpedia 作为 TextNode 的内容,但未触及。我希望能够将其简化为:
An italicised bit of text, Some markup
或者可能是更结构化的 AST,其中包含表示原始文本每个部分的附加节点,可能(在每个节点上)使用要应用的格式类型(例如斜体、粗体等)进行注释。
事实上,dbpedia 解析的最终结果仍然充满了标记。
希望对您有所帮助。
【问题讨论】:
-
有趣的问题。假设您不介意从 Scala 调用 Java 库,我已经大胆地添加了 Java 标记。祝你好运!
-
为了帮助您获得答案,您可以粘贴一些您尝试转换为纯文本的文本节点内容的有意义的 sn-p。另外,您将它放入什么确切的对象/结构中?它是特定于 dbpedia 的结构还是 java?如果是 dbpedia,您可以提供指向 javadoc 的链接。
-
@huynhjil,我正在遍历(以及我已经创建)的来自 dbpedia 的数据结构总结如下:wiki.dbpedia.org/DeveloperDocumentation/WikiParser?v=hdy。 Javadoc 详细信息已链接到此页面。
标签: java scala dbpedia mediawiki-templates