학습 실행 상세는 실시간으로 갱신됩니다. 서버가 단계·상태·로그가 바뀔 때마다 화면으로 바로 보내 주므로(SSE) 새로고침할 필요가 없습니다.

  1. 위쪽①에 모델·데이터셋·GPU·런타임 이미지와 설정 요약이, 오른쪽②에 학습 지표 그래프와 로그가 있습니다. ③ MLflow run 보기는 이 학습이 만든 MLflow Run 으로 갑니다.
    학습 실행 상세: ① 실행 정보·설정 ② 학습 지표(MLflow) ③ MLflow run 보기
  2. 아래 진행 단계에서 지금 어디쯤인지 봅니다. 단계는 모든 학습에 똑같이 6개입니다.
    진행 단계: 서버가 관찰하는 6단계 타임라인

6단계 타임라인

단계화면 이름무엇을 기다리나
queue실행 대기학습 대기열의 차례. 동시에 도는 학습 수 한도(기본 1)와 GPU 슬롯이 비기를 기다립니다
runtime_prepare학습 환경 준비Kubernetes Job 생성, 파드 배치, 학습 이미지 내려받기
data_stage데이터셋 준비데이터셋을 파드 안으로 옮김. 캐시에 이미 있으면 곧바로 끝납니다
train학습학습 컨테이너 실행. 진행률은 MLflow 에 기록된 에포크 수로 계산합니다
register모델 레지스트리 등록마법사에서 등록을 켰을 때, 학습이 남긴 모델을 새 버전으로 등록
finalize결과 정리상태·종료 시각 기록, 알림

단계 상태는 시작 전진행 중완료 로 바뀌고, 문제가 있으면 실패·중지됨·건너뜀이 됩니다. 학습 전체 상태는 목록과 제목 옆 배지에 접수됨·대기 중·실행 중·완료·실패·중지됨으로 나옵니다.

학습 지표는 MLflow 에서 옵니다

그래프의 손실·mAP 같은 값은 학습 컨테이너가 MLflow 에 기록한 지표를 그대로 읽은 것입니다. 플랫폼이 표준출력을 해석해 지표를 만들지 않습니다. 그래서 다음과 같습니다.

  • 학습이 막 시작했을 때는 첫 검증이 끝나기 전까지 그래프가 비어 있을 수 있습니다(지표 키가 그때 생깁니다).
  • 같은 값은 실험 화면의 Run 상세, 또는 MLflow 클라이언트로도 똑같이 볼 수 있습니다.

로그 카드에는 학습 컨테이너의 표준출력이 실시간으로 쌓입니다. 로그 검색으로 찾고 전체 로그로 내려받습니다.

학습을 멈추거나 같은 설정으로 다시 돌리는 방법은 How-to 의 학습 중지하고 이어서 하기, 같은 설정으로 다시 학습을 보세요.

다음: 5. Run 비교와 모델 등록

2026-09-21 기준 플랫폼에 맞춰 작성했습니다.

© Geo-MLOps