【发布时间】:2012-09-10 14:11:21
【问题描述】:
我想创建一个语义文本分析器。为此,我需要在数据库中存储大量词根——大约十万个单词的基本语言词汇。 是否有任何模式或通用架构以及我应该使用哪种数据库 - 关系或 nosql(可能是 mongodb)?
有 26 个字母,每个字母可以有数千个单词。如果使用关系数据库,我应该为每个字母创建 26 个不同的表,或者如果使用 nosql,我应该将它们全部存储在一起吗?
【问题讨论】:
-
为什么不简单地创建一个或 26 个文本文件,然后加载一次。这看起来您必须将整个数据集加载到内存中,不是吗?
-
我不这样做,所以你需要一个数据库。我会选择一个符合要求的数据结构,例如特里en.wikipedia.org/wiki/Trie
-
史蒂夫,卢卡斯,我不认为将数据存储在数据库中不是一个好主意。我需要不同时期(不同世纪)的基础词汇来尝试识别文本的写作时间。
标签: mysql mongodb database-design database nosql