【问题标题】:Newbie: Hadoop IIS Logs - Reasonable approach?新手:Hadoop IIS 日志 - 合理的方法?
【发布时间】:2018-03-29 09:43:01
【问题描述】:

我完全是 hadoop 主题的初学者 - 如果这是一个愚蠢的问题,我很抱歉。 我的虚构场景是,我有多个带有多个日志位置的网络服务器 (IIS)。我想集中这些日志文件,并根据我想分析应用程序和网络服务器的健康状况的数据。

由于 hadoop 的生态系统超越了多种工具,我不确定我的解决方案是否有效。

所以我认为我将日志文件移动到 hdfs,在目录上创建一个外部表和一个内部表,并通过配置单元(插入到 ...select from)将数据从外部表复制到内部表(使用由于注释行以 # 开头的一些过滤) 当数据存储在内部表中时,我会从 hdfs 中删除以前移动的文件。

技术上可行,我已经尝试过了 - 但这是合理的方法吗? 如果是的话 - 我将如何自动化这些步骤,因为现在我通过 Ambari 手动完成了所有工作。

感谢您的意见

体重

【问题讨论】:

    标签: hadoop iis logging


    【解决方案1】:

    是的,这是非常好的方法。

    除了提前设置 Hive 表之外,还有什么需要自动化的?

    您想按计划执行任务吗?使用 Oozie、Luigi、Airflow 或 Azkaban。

    因为您拥有高度可用的 Web 服务而从其他 Windows 服务器提取日志?例如,使用 Puppet 配置日志收集代理(与 Hadoop 无关)

    注意,如果您只关心日志文件收集,我可能会使用 Elasticsearch 而不是 Hadoop 来存储数据,使用 Filebeat 来持续监视日志文件,使用 Logstash 来应用每个消息级别的过滤,以及使用 Kibana 来进行可视化.如果将 Elasticsearch 用于快速索引/搜索和 Hadoop 用于归档,您可以在日志消息摄取和消息编写者/消费者之间插入 Kafka

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-06-07
      • 1970-01-01
      • 2013-08-14
      • 1970-01-01
      • 1970-01-01
      • 2011-09-24
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多