【发布时间】:2011-07-22 03:20:47
【问题描述】:
我正在使用这种配置的 Ubuntu 11.04 机器上处理一个包含 7+ 百万行 (~59 MB) 的文件:
Intel(R) Core(TM)2 双核 CPU E8135 @ 2.66GHz,2280 MHz 内存:2GB 磁盘:100GB即使跑了 45 分钟,我也没有看到任何进展。
删除 hdfs://localhost:9000/user/hadoop_admin/output packageJobJar: [/home/hadoop_admin/Documents/NLP/Dictionary/dict/drugs.csv, /usr/local/hadoop/mapper.py, /usr/local/hadoop/reducer.py, /tmp/hadoop-hadoop_admin/hadoop -unjar8773176795802479000/] [] /tmp/streamjob582836411271840475.jar tmpDir=null 22 年 11 月 7 日 10:39:20 信息 mapred.FileInputFormat:要处理的总输入路径:1 22 年 11 月 7 日 10:39:21 信息流。StreamJob:getLocalDirs():[/tmp/hadoop-hadoop_admin/mapred/local] 22 年 11 月 7 日 10:39:21 信息流。StreamJob:正在运行的作业:job_201107181559_0099 11/07/22 10:39:21 INFO streaming.StreamJob:要终止此作业,请运行: 22 年 11 月 7 日 10:39:21 信息流。StreamJob:/usr/local/hadoop/bin/../bin/hadoop 作业 -Dmapred.job.tracker=localhost:9001 -kill job_201107181559_0099 11/07/22 10:39:21 INFO streaming.StreamJob:跟踪 URL:http://localhost:50030/jobdetails.jsp?jobid=job_201107181559_0099 22 年 11 月 7 日 10:39:22 信息流。StreamJob:地图 0% 减少 0%在pseudo distributed 模式下使用Hadoop 可以处理的最大文件大小是多少。
更新:
我正在使用Hadoop Streaming 做一个简单的字数统计应用程序。我的mapper.py 和reducer.py 花了50 Sec 处理一个220K 行(~19MB)的文件。
【问题讨论】: