Geo-MLOps 는 하나의 Kubernetes 클러스터에서 학습 Job·서빙·이미지 빌드를 돌립니다. 클러스터는 모든 테넌트가 함께 쓰는 자원이라, 이 제어판은 전역 관리자에게만 열립니다(서버의 모든 경로가 전역 관리자를 요구합니다). 클러스터에 연결되지 않았으면 각 화면이 Kubernetes 미연결 과 이유를 보여 줍니다.

클러스터 개요

활성 노드 수, 활성 Pod 수, Ready 비율과 노드 풀(노드 라벨로 묶은 무리)별 요약을 봅니다. 하루 한 번 훑어보는 화면입니다.

클러스터 개요

노드: cordon 과 drain

노드 목록에는 풀, 상태, CPU·메모리·GPU, Pod 수, 버전이 보입니다. 행을 누르면 옆 패널에 상태 조건·테인트·그 노드의 파드가 보여, 조치 전에 무엇이 영향을 받는지 확인할 수 있습니다.

노드
동작하는 일되돌리기
Cordon새 파드가 그 노드에 배치되지 않게 막습니다. 지금 도는 파드는 그대로Uncordon
Drain그 노드의 파드를 전부 내보냅니다(축출). 학습·서빙이 있으면 즉시 중단되고 다른 노드로 다시 배치됩니다되돌릴 수 없음
  1. 점검할 노드에서 Cordon 을 눌러 새 작업이 들어오지 않게 합니다.
  2. 도는 작업이 끝나기를 기다리거나, 기다릴 수 없으면 Drain 을 누릅니다. 노드 이름을 정확히 입력해야 실행됩니다.
    Drain 확인: 노드 이름을 입력해야 실행된다 (촬영에서는 실행하지 않음)
  3. 점검이 끝나면 Uncordon 으로 되돌립니다.

네임스페이스

클러스터의 모든 네임스페이스가 카드로 보이고, 카드를 누르면 그 네임스페이스의 워크로드 화면으로 갑니다. 테넌트마다 tenant-{코드 소문자} 네임스페이스가 하나씩 있습니다(예: tenant-demo). 공유 이미지 등 시스템 몫의 네임스페이스도 함께 보입니다.

네임스페이스

위 화면에서는 촬영용이 아닌 테넌트 네임스페이스를 가렸습니다.

워크로드

오른쪽 위에서 네임스페이스를 고르고, 종류 탭(Deployment, StatefulSet, DaemonSet, Job, CronJob, Pod)으로 봅니다.

워크로드
버튼하는 일
Restart롤아웃을 다시 시작합니다(파드를 차례로 새로 띄움). 확인을 거칩니다
Scale복제 수를 바꿉니다
Delete (Pod 탭)파드 하나를 지웁니다. 컨트롤러가 있으면 새로 뜹니다

스토리지

StorageClass 카드, PersistentVolume(클러스터 전체) 표, PersistentVolumeClaim(네임스페이스를 골라서) 표를 봅니다. 읽기 전용입니다. PVC 는 실제 사용량도 함께 보여, "Bound 100Gi" 이지만 꽉 차서 학습이 실패하는 볼륨을 찾을 수 있습니다. 통계가 없는 볼륨은 0 이 아니라 로 보입니다.

스토리지

2026-09-21 기준 플랫폼에 맞춰 작성했습니다.

© Geo-MLOps