【问题标题】:suggest database for storing metadata regarding 200 million images (1 million books) (NoSQL? SQL?)建议用于存储有关 2 亿张图像(100 万本书)的元数据的数据库(NoSQL?SQL?)
【发布时间】:2011-03-07 18:18:45
【问题描述】:

朋友们,

我们将开展一项知识保存项目,以扫描超过 100 万本书籍。我们需要一些关于实现数据库来存储和检索元数据以及使用它来跟踪每个对象(书籍)的扫描状态的建议

  1. 你们能否建议我们应该使用 SQL 还是 NoSQL(元数据可能因项目而异,例如该项目可能有 15 个字段)

  2. 我们正在考虑基于 Lucene/Solr 或一些可扩展 RDF 数据库的东西

  3. 任何开源解决方案,我们能够定义自定义元数据字段并使用搜索功能存储信息?

【问题讨论】:

  • 我们在考虑 Apache Cassandra、Apache Jackrabbit、openCalais、ApacheUIMA、MongoDB、CouchDB、Doap、okfn(开放知识基金会)、mulgara.org、Lucene(Nutch、Solr、Hounder)、Sphinx、 zettair、Terrier、Galago、Minnion、MG4J、Wumpus、RDBMS(mysql、sqlite)、Indri、Xapian、grep、Blacklight、OKKAM(研究项目,一个提供可扩展和可持续基础设施的大型集成项目,称为实体名称系统(ENS),用于系统地重用全局和唯一实体标识符)
  • 更多 - SIREn: Efficient semi-structured Information Retrieval for Lucene, hxxp://sig.ma/, SCRIBO - Semi-automatic and Collaborative Retrieval of Information Based on Ontologies, AllegroGraph RDFStore 是一个现代的, 高性能、持久化 RDF 图数据库, hxxp://openpipe.berlios.de (openpip),
  • 您能否就添加书籍的频率和查询频率等方面的预期负载给出一些概念?您希望有数十个并发用户,还是数百万个?
  • 你最后做了什么?我现在面临着一个非常相似的困境——大量图像、可变图像大小、自定义元数据等。

标签: metadata nosql rdf semantics scanning


【解决方案1】:

免责声明:从未尝试过此类项目

我从 MSSQL 服务器的“文件流”类型中看到了非常好的性能。它使用 NTFS 文件 API 来存储二进制数据,并在表的行中保留一个指针。

如果您在元数据上没有结构,您可以使用 XML,但如果您确实有重复结构,则将其推入关系数据中,然后您可以使用索引等来帮助您获得性能。

Filestream Type

【讨论】:

    【解决方案2】:

    可以使用任何数据库和一些自定义代码创建这样的解决方案,但使用 CMS(内容管理系统)可能会更容易。 CMS 解决方案隐藏了底层数据库的详细信息,并允许您使用一组可扩展的元数据来描述您的文档。

    您使用哪种 CMS 系统取决于您的预算、内部专业知识和您的需求等因素。我一直在使用 Alfresco(商业开源),部分原因是我的公司已经决定使用它,但如果我要做一个低预算的网站,我可能会考虑非企业版。哦,Alfresco 利用 Lucene 进行搜索。

    如果您的需求非常基本,那么一个用于元数据的数据库、一个用于图像的文件系统和一些用于服务器的代码就足够了。避免尝试将图像存储在数据库中,因为根据我的经验,这不是数据库最擅长的。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-05-14
      • 1970-01-01
      • 1970-01-01
      • 2015-12-04
      • 1970-01-01
      • 2018-11-29
      • 2010-11-27
      • 2011-05-09
      相关资源
      最近更新 更多