My hadoop jobs don't start
This is configured to use an existing DFS and to unpack a tarball with a cut down 0.16.0 config I have looked in the mom logs on the client machines and am not getting anything meaningful.


The hadoop ports are biased by 1000 to allow another cluster to run on this machines, running and older version of hadoop.

Using Python: 2.5.1 (r251:54863, Feb 24 2008, 12:00:38)
[GCC 4.1.0 20060304 (Red Hat 4.1.0-3)]

[2008-02-25 21:56:38,611] DEBUG/10 hod:144 - ('hdimg01', 63059)
[2008-02-25 21:56:38,612] INFO/20 hod:216 - Service Registry Started.
[2008-02-25 21:56:38,615] DEBUG/10 hadoop:425 - allocate /tmp/hod 27 27
[2008-02-25 21:56:38,618] DEBUG/10 torque:72 - ringmaster cmd: /data1/hadoop-0.16.0-dfs/contrib/hod/bin/ringmaster --hodring.tarball-retry-initial-time 1.0 --hodring.cmd-retry-initial-time 2.0 --$[2008-02-25 21:56:38,620] DEBUG/10 torque:44 - qsub -> /usr/bin/qsub -l nodes=27 -W x= -l nodes=27 -W x= -N "HOD" -r n -d /tmp/ -q batch
[2008-02-25 21:56:38,822] DEBUG/10 torque:54 - qsub stdin: #!/bin/sh
[2008-02-25 21:56:38,823] DEBUG/10 torque:54 - qsub stdin: /data1/hadoop-0.16.0-dfs/contrib/hod/bin/ringmaster --hodring.tarball-retry-initial-time 1.0 --hodring.cmd-retry-initial-time 2.0 --hodr$[2008-02-25 21:56:38,835] DEBUG/10 torque:76 - qsub jobid: 13.hdimg01 [2008-02-25 21:56:38,837] DEBUG/10 torque:87 - /usr/bin/qstat -f -1 13.hdimg01 [2008-02-25 21:56:39,362] DEBUG/10 torque:87 - /usr/bin/qstat -f -1 13.hdimg01 [2008-02-25 21:56:39,390] INFO/20 hadoop:447 - Hod Job successfully submitted. JobId : 13.hdimg01. [2008-02-25 21:56:49,438] DEBUG/10 torque:87 - /usr/bin/qstat -f -1 13.hdimg01 [2008-02-25 21:56:49,463] ERROR/40 torque:96 - qstat error: exit code: 153 | signal: False | core False
[2008-02-25 21:56:49,464] INFO/20 hadoop:451 - Ringmaster at : None.
[2008-02-25 21:56:49,465] INFO/20 hadoop:530 - Cleaning up job id 13.hdimg01, as cluster could not be allocated.
[2008-02-25 21:56:49,467] DEBUG/10 torque:131 - /usr/bin/qdel 13.hdimg01
[2008-02-25 21:56:49,490] CRITICAL/50 hod:253 - Cannot allocate cluster /tmp/hod
[2008-02-25 21:56:50,434] DEBUG/10 hod:391 - return code: 6
You have new mail in /var/spool/mail/XXXX


--
Jason Venner
Attributor - Publish with Confidence <http://www.attributor.com/>
Attributor is hiring Hadoop Wranglers, contact if interested
[hod]
stream                          = True
java-home                       = /usr/java/jdk1.6.0
cluster                         = cluster-hdimg
cluster-factor                  = 1.8
xrs-port-range                  = 32768-65536
debug                           = 3
allocate-wait-time              = 3600
temp-dir                        = /tmp/hod

[ringmaster]
register                        = True
stream                          = False
temp-dir                        = /tmp/hod
http-port-range                 = 8000-9000
work-dirs                       = /tmp/hod/1,/tmp/hod/2
xrs-port-range                  = 32768-65536
debug                           = 3

[hodring]
stream                          = False
temp-dir                        = /tmp/hod
register                        = True
java-home                       = /usr/java/jdk1.6.0
http-port-range                 = 8000-9000
xrs-port-range                  = 32768-65536
debug                           = 3

[resource_manager]
queue                           = batch
batch-home                      = /usr
id                              = torque
#env-vars                       = 
HOD_PYTHON_HOME=/foo/bar/python-2.5.1/bin/python

[gridservice-mapred]
external                        = False
pkgs                            = /tmp/hod/
tracker_port                    = 8030
info_port                       = 51080
server_params                   = 
dfs.secondary.http.address=0.0.0.0:51090,dfs.datanode.address=0.0.0.0:51010,dfs.datanode.http.address=0.0.0.0:51075,dfs.http.address=0.0.0.0:51070,mapred.job.tracker.http.address=0.0.0.0:51030,fs.default.name=hdfs://hdimg01:55310/,mapred.child.java.opts=-Xmx512m,mapred.job.tracker=hdimg01:55311,dfs.replication=3,mapred.map.tasks=31,mapred.reduce.tasks=19,hadoop.tmp.dir=/data/0.16.0,attr.hadoop.root=/data/,mapred.tasktracker.map.tasks.maximum=7,mapred.tasktracker.reduce.tasks.maximum=7,mapred.job.tracker.persist.jobstatus.active=true,mapred.job.tracker.persist.jobstatus.hours=96,webinterface.private.actions=true

[gridservice-hdfs]
external                        = true
pkgs                            = /data/hadoop-0.16.0-dfs/
host                            = hdimg01
fs_port                         = 55310
info_port                       = 51070

Reply via email to