【问题标题】:Data model for storing millions of tweets用于存储数百万条推文的数据模型
【发布时间】:2014-06-11 09:14:58
【问题描述】:

我目前出于与分析相关的原因存储了大约 2 亿条推文。它需要大约 300 G 的 MySQL 数据库。未来仍将持续增长。我对这些数据执行了很多搜索查询和分析查询。到目前为止,MySQL 正在按预期执行。将来我想横向扩展并保留现有的全文查询能力和分析查询能力。我应该查看哪些选项(关系/NoSQL)? 我目前使用 solr 进行全文搜索。

【问题讨论】:

  • 你到底在存储什么——你能比“推文”更精确一点吗?
  • 我获取推文字段并将它们存储在 MySQL 表中。比如谁发了推文,他们发了什么推文等等,标签,关注者数量,关注数量等。

标签: mysql search solr nosql


【解决方案1】:

最终(很快)您将拥有太多数据,单个服务器无法高效处理。

Cloudera 已将 Hadoop 与 Solr 集成,将全文搜索与 HDFS 中的分布式数据服务器集群相结合。这样您就可以通过添加更多服务器来继续扩展。

http://www.cloudera.com/content/cloudera/en/products-and-services/cdh/search.html

【讨论】:

  • 您是否建议使用 cloudera 搜索作为唯一的数据存储,而不是按照我当前的模型(MySQL + Solr)使用两个数据源?
  • 取决于是否需要对同一数据进行全文搜索之外的SQL查询。
猜你喜欢
  • 2023-03-16
  • 2011-09-11
  • 1970-01-01
  • 2019-07-04
  • 1970-01-01
  • 1970-01-01
  • 2012-04-14
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多