【发布时间】:2011-03-07 18:18:45
【问题描述】:
朋友们,
我们将开展一项知识保存项目,以扫描超过 100 万本书籍。我们需要一些关于实现数据库来存储和检索元数据以及使用它来跟踪每个对象(书籍)的扫描状态的建议
你们能否建议我们应该使用 SQL 还是 NoSQL(元数据可能因项目而异,例如该项目可能有 15 个字段)
我们正在考虑基于 Lucene/Solr 或一些可扩展 RDF 数据库的东西
任何开源解决方案,我们能够定义自定义元数据字段并使用搜索功能存储信息?
【问题讨论】:
-
我们在考虑 Apache Cassandra、Apache Jackrabbit、openCalais、ApacheUIMA、MongoDB、CouchDB、Doap、okfn(开放知识基金会)、mulgara.org、Lucene(Nutch、Solr、Hounder)、Sphinx、 zettair、Terrier、Galago、Minnion、MG4J、Wumpus、RDBMS(mysql、sqlite)、Indri、Xapian、grep、Blacklight、OKKAM(研究项目,一个提供可扩展和可持续基础设施的大型集成项目,称为实体名称系统(ENS),用于系统地重用全局和唯一实体标识符)
-
更多 - SIREn: Efficient semi-structured Information Retrieval for Lucene, hxxp://sig.ma/, SCRIBO - Semi-automatic and Collaborative Retrieval of Information Based on Ontologies, AllegroGraph RDFStore 是一个现代的, 高性能、持久化 RDF 图数据库, hxxp://openpipe.berlios.de (openpip),
-
您能否就添加书籍的频率和查询频率等方面的预期负载给出一些概念?您希望有数十个并发用户,还是数百万个?
-
你最后做了什么?我现在面临着一个非常相似的困境——大量图像、可变图像大小、自定义元数据等。
标签: metadata nosql rdf semantics scanning