📜 워드 보고서: https://docs.google.com/document/d/1yXIqIm255C2st_TFEokps6g7J5_IYX-UrgdNPb8gcXE/edit?usp=sharing
<aside> ⚠️ 본 문서를 읽기 전 ‣ README를 읽는 것을 추천한다. 본 문서에는 Llama-7B를 사전학습 하기 위해 수정해야 하는 것 위주로 적혀 있어 많은 내용이 생략되어 있다.
</aside>
Gpt-neoX 리포는 billion 단위 파라미터를 가진 LLM 학습을 위함. 병렬 학습 등 최적화 기법 통합해서 지원해줌. 추론을 위한 지원은 별로 없음. 공식 문서에도 HF 사용해서 추론하라고 권장한다.
분산 환경에서 메모리 및 communication 최적화를 도와주는 라이브러리인 DeepSpeed를 개선한 DeeperSpeed 사용.
본 문서에서 ‘GiLlama’란 GPT-NeoX 코드를 사용해서 학습시킨 Llama 모델을 명칭함.
Questions