<aside> 📌 실습 코드: https://github.com/lectura7942/llama2-pretrain-deepspeed
</aside>
<aside> 📌 GPT-NeoX 리포로 분산 학습하기: GPT-NeoX로 Llama 사전학습
</aside>
실행
Single-node multi-gpu (명시 안 하면 모든 gpu 사용)
deepspeed your_program.py <normal cl args> --deepspeed ds_config.json
Multi-node multi-gpu (명시 안 하면 hostfile에 적혀진 모든 노드와 모든 gpu 사용. hosfile 첫 번째 host를 master_addr로 삼는다.)
deepspeed --hostfile hostfile your_program.py <normal cl args> --deepspeed ds_config.json
<aside> 💥 Multi-node 환경에서는 아직 돌려보지 못했다.
</aside>
⚠️ Multi-node 사용할 시, 노드간 python, torch, cuda 버젼 동일한지 확인!
pdsh 설치하기
sudo apt-get -y install pdsh
parallel remote shell client
패키지 설치하기
pip install -r requirements.txt