chrishkchris commented on issue #651: Add new example APIs URL: https://github.com/apache/singa/pull/651#issuecomment-609758264 I added two args in train_mpi,py and train_multiprocess.py to support all the distributed training options, but train.py don't need the argument because it doesn't have DistOpt Below are two examples for the use of arguments: ``` root@71ac539cda77:~/dcsysh/singa/examples/autograd# mpiexec -np 2 python3 train_mpi.py cnn mnist --op fp16 --lr 0.01 Starting Epoch 0: Training loss = 625.136963, training accuracy = 0.776893 Evaluation accuracy = 0.939704, Elapsed Time = 1.619492s Starting Epoch 1: Training loss = 235.280151, training accuracy = 0.920339 Evaluation accuracy = 0.947115, Elapsed Time = 1.517764s Starting Epoch 2: Training loss = 171.311310, training accuracy = 0.942508 Evaluation accuracy = 0.970252, Elapsed Time = 1.557606s Starting Epoch 3: Training loss = 139.594086, training accuracy = 0.953342 Evaluation accuracy = 0.972356, Elapsed Time = 1.541372s Starting Epoch 4: Training loss = 120.380058, training accuracy = 0.959852 Evaluation accuracy = 0.971655, Elapsed Time = 1.560016s Starting Epoch 5: Training loss = 104.767105, training accuracy = 0.965345 Evaluation accuracy = 0.979467, Elapsed Time = 1.525147s Starting Epoch 6: Training loss = 98.995010, training accuracy = 0.966730 Evaluation accuracy = 0.976963, Elapsed Time = 1.528173s Starting Epoch 7: Training loss = 88.012024, training accuracy = 0.970202 Evaluation accuracy = 0.977865, Elapsed Time = 1.515204s Starting Epoch 8: Training loss = 86.540741, training accuracy = 0.970519 Evaluation accuracy = 0.975361, Elapsed Time = 1.604774s Starting Epoch 9: Training loss = 80.653885, training accuracy = 0.973024 Evaluation accuracy = 0.982071, Elapsed Time = 1.633480s root@71ac539cda77:~/dcsysh/singa/examples/autograd# mpiexec -np 2 python3 train_mpi.py cnn mnist --op partialUpdate --lr 0.01 Starting Epoch 0: Training loss = 623.692139, training accuracy = 0.777694 Evaluation accuracy = 0.939804, Elapsed Time = 1.678683s Starting Epoch 1: Training loss = 235.369232, training accuracy = 0.920690 Evaluation accuracy = 0.948017, Elapsed Time = 1.567066s Starting Epoch 2: Training loss = 171.335693, training accuracy = 0.942157 Evaluation accuracy = 0.971855, Elapsed Time = 1.595140s Starting Epoch 3: Training loss = 139.396088, training accuracy = 0.953592 Evaluation accuracy = 0.971755, Elapsed Time = 1.661490s Starting Epoch 4: Training loss = 120.173752, training accuracy = 0.960019 Evaluation accuracy = 0.970753, Elapsed Time = 1.571710s Starting Epoch 5: Training loss = 105.472672, training accuracy = 0.965061 Evaluation accuracy = 0.978065, Elapsed Time = 1.570710s Starting Epoch 6: Training loss = 99.055389, training accuracy = 0.966930 Evaluation accuracy = 0.977163, Elapsed Time = 1.561047s Starting Epoch 7: Training loss = 88.166275, training accuracy = 0.970002 Evaluation accuracy = 0.976663, Elapsed Time = 1.665272s Starting Epoch 8: Training loss = 85.920563, training accuracy = 0.970469 Evaluation accuracy = 0.976162, Elapsed Time = 1.579652s Starting Epoch 9: Training loss = 79.568375, training accuracy = 0.973040 Evaluation accuracy = 0.982472, Elapsed Time = 1.605414s ```
---------------------------------------------------------------- This is an automated message from the Apache Git Service. To respond to the message, please log on to GitHub and use the URL above to go to the specific comment. For queries about this service, please contact Infrastructure at: [email protected] With regards, Apache Git Services
