【问题标题】:Maximum file size that can be processed using Hadoop in 'pseudo distributed' mode可以在“伪分布式”模式下使用 Hadoop 处理的最大文件大小
【发布时间】:2011-07-22 03:20:47
【问题描述】:

我正在使用这种配置的 Ubuntu 11.04 机器上处理一个包含 7+ 百万行 (~59 MB) 的文件:

Intel(R) Core(TM)2 双核 CPU E8135 @ 2.66GHz,2280 MHz 内存:2GB 磁盘:100GB

即使跑了 45 分钟,我也没有看到任何进展。

删除 hdfs://localhost:9000/user/hadoop_admin/output packageJobJar: [/home/hadoop_admin/Documents/NLP/Dictionary/dict/drugs.csv, /usr/local/hadoop/mapper.py, /usr/local/hadoop/reducer.py, /tmp/hadoop-hadoop_admin/hadoop -unjar8773176795802479000/] [] /tmp/streamjob582836411271840475.jar tmpDir=null 22 年 11 月 7 日 10:39:20 信息 mapred.FileInputFormat:要处理的总输入路径:1 22 年 11 月 7 日 10:39:21 信息流。StreamJob:getLocalDirs():[/tmp/hadoop-hadoop_admin/mapred/local] 22 年 11 月 7 日 10:39:21 信息流。StreamJob:正在运行的作业:job_201107181559_0099 11/07/22 10:39:21 INFO streaming.StreamJob:要终止此作业,请运行: 22 年 11 月 7 日 10:39:21 信息流。StreamJob:/usr/local/hadoop/bin/../bin/hadoop 作业 -Dmapred.job.tracker=localhost:9001 -kill job_201107181559_0099 11/07/22 10:39:21 INFO streaming.StreamJob:跟踪 URL:http://localhost:50030/jobdetails.jsp?jobid=job_201107181559_0099 22 年 11 月 7 日 10:39:22 信息流。StreamJob:地图 0% 减少 0%

pseudo distributed 模式下使用Hadoop 可以处理的最大文件大小是多少。

更新:

我正在使用Hadoop Streaming 做一个简单的字数统计应用程序。我的mapper.pyreducer.py 花了50 Sec 处理一个220K 行(~19MB)的文件。

【问题讨论】:

    标签: hadoop mapreduce


    【解决方案1】:

    问题解决了,我没有杀死之前的作业,所以这个作业加入了队列,这就是它延迟的原因。我用了 bin/hadoop -kill <job_id> 杀死所有挂起的作业。 ~140 Sec 处理了pseudo distributed mode 中的整个文件(~59 MB)

    【讨论】:

      【解决方案2】:

      大小限制实际上取决于您拥有的可用存储空间的大小。为了给你一个想法,我已经在单个节点上处理几个 GiB 大小的输入文件(gzip 压缩的 apache 日志文件)已经有一段时间了。唯一真正的限制是需要多少时间,以及这对您来说是否足够快。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2016-08-12
        • 1970-01-01
        • 2011-02-07
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多