4. 학습 진행 보기
서버가 관찰하는 6단계 타임라인과 MLflow 지표로 학습을 지켜봅니다
학습 실행 상세는 실시간으로 갱신됩니다. 서버가 단계·상태·로그가 바뀔 때마다 화면으로 바로 보내 주므로(SSE) 새로고침할 필요가 없습니다.
- 위쪽①에 모델·데이터셋·GPU·런타임 이미지와 설정 요약이, 오른쪽②에 학습 지표 그래프와 로그가 있습니다. ③ MLflow run 보기는 이 학습이 만든 MLflow Run 으로 갑니다.
학습 실행 상세: ① 실행 정보·설정 ② 학습 지표(MLflow) ③ MLflow run 보기 - 아래 진행 단계에서 지금 어디쯤인지 봅니다. 단계는 모든 학습에 똑같이 6개입니다.
진행 단계: 서버가 관찰하는 6단계 타임라인
6단계 타임라인
| 단계 | 화면 이름 | 무엇을 기다리나 |
|---|---|---|
queue | 실행 대기 | 학습 대기열의 차례. 동시에 도는 학습 수 한도(기본 1)와 GPU 슬롯이 비기를 기다립니다 |
runtime_prepare | 학습 환경 준비 | Kubernetes Job 생성, 파드 배치, 학습 이미지 내려받기 |
data_stage | 데이터셋 준비 | 데이터셋을 파드 안으로 옮김. 캐시에 이미 있으면 곧바로 끝납니다 |
train | 학습 | 학습 컨테이너 실행. 진행률은 MLflow 에 기록된 에포크 수로 계산합니다 |
register | 모델 레지스트리 등록 | 마법사에서 등록을 켰을 때, 학습이 남긴 모델을 새 버전으로 등록 |
finalize | 결과 정리 | 상태·종료 시각 기록, 알림 |
단계 상태는 시작 전 → 진행 중 → 완료 로 바뀌고, 문제가 있으면 실패·중지됨·건너뜀이 됩니다. 학습 전체 상태는 목록과 제목 옆 배지에 접수됨·대기 중·실행 중·완료·실패·중지됨으로 나옵니다.
학습 지표는 MLflow 에서 옵니다
그래프의 손실·mAP 같은 값은 학습 컨테이너가 MLflow 에 기록한 지표를 그대로 읽은 것입니다. 플랫폼이 표준출력을 해석해 지표를 만들지 않습니다. 그래서 다음과 같습니다.
- 학습이 막 시작했을 때는 첫 검증이 끝나기 전까지 그래프가 비어 있을 수 있습니다(지표 키가 그때 생깁니다).
- 같은 값은 실험 화면의 Run 상세, 또는 MLflow 클라이언트로도 똑같이 볼 수 있습니다.
로그 카드에는 학습 컨테이너의 표준출력이 실시간으로 쌓입니다. 로그 검색으로 찾고 전체 로그로 내려받습니다.
학습을 멈추거나 같은 설정으로 다시 돌리는 방법은 How-to 의 학습 중지하고 이어서 하기, 같은 설정으로 다시 학습을 보세요.
다음: 5. Run 비교와 모델 등록