【发布时间】:2010-10-28 01:45:56
【问题描述】:
我们有一个应用程序可以为它创建请求的文本日志文件。日志文件中非常典型的内容,以空格分隔(日期、时间、url、http 代码、ip、用户代理等)。
目前,我们每天在文本日志文件中生成大约 50 万条条目。
我们目前正在通过 sed/awk/grep 对文本文件进行大量分析。但是,这并不能真正扩大规模,尤其是当我们希望开始跨多天报告时:
例如 - 该 IP 地址在过去 5 天内点击该 URL 的次数 - 有多少百分比的请求导致特定 URL 达到 500 次
定期导入 mysql 数据库并使用 select/group-bys 提取此类数据很容易。但是,即使有几十万行,查询也相对较慢。
对于一些新的 no-sql 数据库(Casandra、Dynamo、BigTable),我是一个 n00b,但它们中的任何一个都非常适合这个吗?我正在继续阅读它们,但也许这个工作人员有一些建议。
谢谢!
【问题讨论】: