【发布时间】:2018-03-29 09:43:01
【问题描述】:
我完全是 hadoop 主题的初学者 - 如果这是一个愚蠢的问题,我很抱歉。 我的虚构场景是,我有多个带有多个日志位置的网络服务器 (IIS)。我想集中这些日志文件,并根据我想分析应用程序和网络服务器的健康状况的数据。
由于 hadoop 的生态系统超越了多种工具,我不确定我的解决方案是否有效。
所以我认为我将日志文件移动到 hdfs,在目录上创建一个外部表和一个内部表,并通过配置单元(插入到 ...select from)将数据从外部表复制到内部表(使用由于注释行以 # 开头的一些过滤) 当数据存储在内部表中时,我会从 hdfs 中删除以前移动的文件。
技术上可行,我已经尝试过了 - 但这是合理的方法吗? 如果是的话 - 我将如何自动化这些步骤,因为现在我通过 Ambari 手动完成了所有工作。
感谢您的意见
体重
【问题讨论】: