AI/ML
AI 학습부터 GPU 운영까지 한 곳에서, GPU Live
2026년 10월 8일
원문에서 보기 ↗들어가며
오늘날 대규모 언어 모델 학습, 이미지 생성, 강화 학습 등 AI 워크로드가 빠르게 확산되면서 학습과 추론을 뒷받침할 GPU 인프라의 중요성도 함께 커졌습니다. 많은 조직이 GPU 클러스터를 구축하거나 확장하고 있지만, GPU 클러스터를 운영한다는 것은 단순히 하드웨어를 확보하는 데서 끝나지 않습니다. 이것은 자원을 누구에게 얼마나 배분할지, 학습 작업을 어떻게 실행하고 관리할지, 사용 이력을 어떻게 추적하고 통제할지까지 포함하는 일입니다.
그런데 이 과정에서 여러 가지 문제에 부딪히게 됩니다.
학습을 돌리려면 환경 구성부터 실행, 결과 저장, 자원 반환까지 사용자가 직접 챙겨야 합니다. 학습 도중 실패하면 처음부터 다시 해야 하고, 분산 학습에 필요한 GPU를 한 노드 안에서 확보하지 못하면 클러스터에 자원이 남아 있어도 대기해야 합니다. 한쪽 팀은 GPU가 모자라 대기열에 작업을 쌓아두는데, 다른 팀의 GPU는 며칠째 유휴 상태입니다. 여러 팀이 자원을 공유하면 누가 얼마나 썼는지 추적해야 하고, 공공·금융처럼 감사가 중요한 환경에서는 모든 변경 이력을 증빙할 수 있어야 합니다. 팀 간 자원과 권한을 격리하면서도 전체 활용률은 높여야 하는, 서로 충돌하는 요구사항이 동시에 존재하는 것입니다.
이 문제들은 어느 하나만 풀어서는 해결되지 않습니다. GPU 클러스터 운영은 자원 배분, 학습 실행, 운영 가시성, 접근 통제가 맞물려 돌아가기 때문입니다. NHN Cloud의 GPU Live는 이 문제들을 하나의 솔루션 안에서 풀려는 시도입니다.
GPU Live는 설치형 멀티테넌트 올인원 솔루션으로, AI 학습 실행(단일·분산)과 GPU 자원 운영·관리를 하나의 콘솔에서 처리하며, 온프레미스와 클라우드 어디에나 설치할 수 있습니다. 망분리가 필수인 공공·금융 환경부터 다수 팀이 GPU를 공유해야 하는 기업·연구기관까지, GPU를 쓰는 조직이라면 누구나 사용할 수 있습니다.
여기에서는 GPU Live의 동적 할당 기술, 학습 실행 자동화, 운영·통제 도구, 솔루션 구조, 그리고 실제 사용 흐름까지 살펴보고자 합니다.
학습 실행
워크로드 End-to-End 자동 실행
GPU Live에서 워크로드는 학습에 필요한 컨테이너 이미지, GPU 자원, 실행 방식을 하나로 묶은 작업 단위입니다. 하나의 워크로드는 하나 이상의 인스턴스로 구성됩니다. 사용자가 하는 일은 이 워크로드를 정의하는 것뿐입니다. 인프라 할당, 학습 실행, 결과 저장, 자원 반환까지의 전체 라이프사이클을 솔루션이 자동으로 처리합니다.
노드 구성과 실행 방식
워크로드는 노드 구성과 실행 방식의 조합으로 나뉩니다.
노드 구성은 단일 과 분산 중 선택합니다. 단일은 GPU 1대로 작업하므로 설정이 간단하고 디버깅이 쉽습니다. 분산은 여러 GPU로 대규모 분산 학습을 실행하며, 노드 간 통신이 수반됩니다.
실행 방식은 인터랙티브 와 배치 중 선택합니다. 인터랙티브는 Jupyter·SSH로 접속해 코드를 직접 작성하고 실행하는 방식으로, 모델 실험·데이터 탐색에 적합합니다. 배치는 학습 스크립트를 등록해 실행 후 자동 종료하는 방식으로, 검증된 학습이나 평가 작업을 자동으로 돌리는 데 적합합니다.
| 구분 | 인터랙티브 | 배치 |
|---|---|---|
| 단일 | GPU 1대로 Jupyter/SSH 접속하여 작업 | GPU 1대로 스크립트 실행 후 자동 종료 |
| 분산 | 여러 GPU로 분산 환경 구성, SSH 접속 | 여러 GPU로 분산 스크립트 실행 후 자동 종료 |
학습 효율을 높이는 장치
학습 설정에 드는 시간을 줄이기 위한 장치도 마련되어 있습니다. 실행 중인 단일 워크로드는 스냅샷을 저장해 동일 환경으로 새 워크로드를 만들 수 있고, 기존 워크로드의 설정을 복사해 빠르게 재사용할 수도 있습니다. 워크로드 생성 시 자동 재실행을 켜두면 학습이 실패했을 때 최대 3회까지 자동으로 다시 실행되므로, 새벽에 끊긴 작업을 아침에 사람이 직접 재투입하지 않아도 됩니다. 학습 데이터는 Web SFTP를 통해 대용량 파일도 업로드·다운로드할 수 있습니다.
자원 운영
GPU 1장 단위 동적 할당과 빈패킹
GPU 클러스터 운영에서 가장 흔한 방식은 정적 할당입니다. 팀이나 프로젝트 단위로 GPU를 고정 배정하는 방식입니다. 운영이 단순하고 예측 가능하다는 장점이 있지만, 구조적으로 자원 낭비를 피할 수 없습니다. 학습 작업의 디버깅·휴지 시간, 부서 간 사용 패턴 차이 때문에 클러스터 어딘가에는 항상 놀고 있는 GPU가 있고, 그 GPU를 다른 팀에 넘겨줄 수 있는 방법은 없습니다.
동적 할당은 이 문제를 해결합니다. GPU를 공통 풀로 관리하고, 워크로드가 발생할 때 온디맨드로 자원을 배정하고 끝나면 회수하는 방식입니다. 같은 물리 자원으로 더 많은 워크로드를 처리할 수 있습니다. 다만 동적 할당이 제대로 동작하려면 스케줄링, 쿼터 관리, 유휴 자원 회수, 장애 시 워크로드 안정성 유지 등 여러 요소가 함께 갖춰져야 합니다.
GPU Live는 Kubernetes 표준 인터페이스(Device Plugin, Topology Manager 등)와 검증된 오픈소스 컴포넌트를 기반으로 동적 할당을 구현하되, 그 위에 GPU 워크로드에 최적화된 자원 배분 정책을 자체적으로 설계한 구조입니다. 멀티테넌시 격리, 쿼터 관리, 유휴 자원 회수, 라이프사이클 정책까지 GPU 워크로드 운영에 맞춰 설계된 자원 배분 정책을 지원합니다.
GPU Live는 GPU를 노드별로 고정 배정하지 않고 단일 풀로 관리합니다. 워크로드가 요청되면 GPU를 동적으로 할당하고, 끝나면 즉시 회수합니다. 여기서 핵심은 빈패킹(Bin Packing) 정책입니다. 신규 워크로드를 이미 GPU가 사용 중인 노드에 우선 배치해 빈 노드를 보존합니다. 분산 학습 작업은 한 노드 안에서 다수 GPU를 한 번에 확보해야 하기 때문입니다. 빈패킹 없이는 클러스터에 가용 GPU가 충분해도 분산 학습이 대기열에 머무는 상황이 발생할 수 있습니다.
👉 GPU Live의 동적 할당 기술에 대한 더 자세한 내용은 NHN FactoryX 기술 백서에서 확인할 수 있습니다.
분산 학습을 위한 갱 스케줄링(Gang Scheduling)
멀티 노드 분산 학습에서 가장 흔한 문제는 인스턴스의 절반만 시작되고 나머지는 대기하는 상황입니다. 동기식 분산 학습은 모든 인스턴스가 동시에 시작해야 의미가 있는데, 일부만 스케줄링되면 이미 할당된 GPU는 동기화 지점에서 무한 대기하며 자원만 점유합니다. GPU Live는 갱 스케줄링을 적용해 모든 인스턴스가 동시에 가용할 때만 일괄 스케줄링합니다. 부분 시작으로 인한 자원 낭비를 구조적으로 차단하는 것입니다.
유휴 GPU 자동 회수
GPU를 할당받아 놓고 실제로 사용하지 않는 경우는 생각보다 많습니다. GPU Live는 GPU 사용률과 유지 시간을 기준으로 유휴 워크로드를 자동 회수합니다. 워크로드 정상 종료 시 즉시 회수, 일정 시간 이상 GPU 사용량이 임곗값 이하인 워크로드의 정책 기반 회수, 프로젝트 만료나 자원 정책 위반 시 강제 회수까지 자동으로 수행됩니다. 회수된 자원은 즉시 풀로 반환되어 다른 워크로드에 배정됩니다. 콘솔에는 회수 조건을 충족한 워크로드마다 회수까지 남은 잔여 시간이 표시되므로, 사용자는 회수 전에 상태를 확인할 수 있습니다.
시스템·조직·프로젝트 계층 격리와 역할 기반 접근 제어
하나의 GPU 클러스터를 여러 조직과 프로젝트가 공유할 때, 가장 먼저 드는 걱정은 '내 자원을 남이 가져가면?'입니다. GPU Live는 시스템(System)→조직(Organization)→프로젝트(Project) 3계층 구조로 자원 쿼터, 멤버 권한, 워크로드 가시성을 독립적으로 격리합니다. 역할은 SuperAdmin부터 Project Viewer까지 6개로 나뉘며, 실행·승인·감독·조회 권한이 분리됩니다. 금융·공공 환경에서 요구하는 직무 분리(SoD)를 기본으로 충족합니다.
| 역할 | 범위 | 대표 권한 |
|---|---|---|
| SuperAdmin | 전체 | 모든 권한, 조직/프로젝트 쿼터 설정, 강제 삭제 |
| Org Manager | 조직 | 조직 설정, 멤버 관리, 프로젝트 생성/삭제, 프로젝트 쿼터 설정 |
| Org Viewer | 조직 | 조직 내 조회 전용 |
| Project Manager | 프로젝트 | 프로젝트 설정, 멤버·워크로드·스토리지 관리 |
| Project Member | 프로젝트 | 워크로드 생성·실행 |
| Project Viewer | 프로젝트 | 프로젝트 조회 전용 |
소속마다 다른 역할을 부여할 수 있고, 상위 역할은 하위 역할의 권한을 자동으로 상속합니다.
감사 로그 — 수정 불가, 자동 마스킹
모든 변경 사항이 자동 기록되며 수정이 불가능합니다(Append-only). '누가 언제 무엇을 했는가'를 감사 시점에 즉시 제출할 수 있습니다. 탈퇴한 사용자의 개인정보는 자동 마스킹되어 개인정보 보호 요건도 함께 충족합니다. 감사 로그는 조직 또는 프로젝트 기준으로 SuperAdmin이 CSV로 내려받을 수 있습니다(1회 최대 1개월 범위).
모니터링·미터링·알림
GPU Live는 자원 모니터링, 미터링, 알림을 하나의 콘솔에 통합합니다. 자원 모니터링은 NVIDIA DCGM 표준 지표를 기반으로 실시간 상세 지표를 제공하며, 조직·프로젝트·워크로드 계층별로 화면이 분리되어 있습니다. 미터링은 5분 주기로 사용량을 수집하고, SuperAdmin 또는 Org Manager가 일별 CSV로 내려받아 과금 근거나 내부 정산 자료로 활용할 수 있습니다.
알림은 콘솔 화면을 보고 있지 않아도 상황을 놓치지 않도록 설계되어 있습니다. 워크로드 시작·종료 시 이메일이 발송되고, 워크로드 상태 변경이나 스토리지 마운트·유실·삭제는 웹 실시간 알림으로 전달됩니다. 노드 점검이 발생하면 영향받는 프로젝트에 1분 이내로 이메일이 발송됩니다.
GPU Live 시작하기
GPU Live에서 학습을 실행하는 흐름은 6단계입니다. 사용자는 학습 설정에만 집중하고, 인프라 배정·반환은 솔루션이 자동으로 처리합니다.

1. 회원가입·로그인
GPU Live 콘솔에 접속해 계정을 만들고 로그인합니다.
- 로그인 화면 하단의 회원가입을 클릭해 계정을 생성합니다.
- 가입한 계정의 이메일과 비밀번호를 입력한 뒤 로그인을 클릭해 콘솔에 접속합니다.
- 가입 후 관리자가 조직 또는 프로젝트에 멤버로 추가해야 콘솔을 이용할 수 있습니다.
- 로그인 5회 실패 시 계정이 자동 차단됩니다. 비밀번호를 잊었거나 계정이 차단된 경우, 비밀번호 재설정을 클릭해 비밀번호를 새로 설정한 뒤 로그인할 수 있습니다.
2. 작업 영역 선택
로그인하면 '어디서 시작할까요?' 시작 화면이 표시됩니다. 좌측 상단의 선택기에서 소속된 조직 또는 프로젝트를 선택하면 해당 영역의 자원과 워크로드가 열립니다. 조직 영역에서는 전체 자원 현황을 조회하고, 프로젝트 영역에서 실제 워크로드를 생성·실행합니다.

조직 영역 접근 권한이 없는 계정은 조직 항목에 접근 권한 없음으로 표시되며, 소속 프로젝트만 선택할 수 있습니다.
3. 데이터 준비
워크로드에 마운트할 스토리지를 생성하고, 학습에 사용할 데이터를 스토리지에 올립니다.
- 스토리지 생성 을 클릭해 스토리지를 생성합니다. 생성 직후 상태가 연결됨으로 표시되면 워크로드에 마운트할 수 있습니다.
- 스토리지 상세에서 Web SFTP 연결을 클릭하면 브라우저에서 바로 파일을 업로드·다운로드할 수 있습니다. 별도 클라이언트를 설치할 필요가 없습니다.

워크로드 내부 볼륨(루트 디스크)에 저장한 데이터는 보존이 보장되지 않습니다. 워크로드 종료 시는 물론, 실행 중에도 내부 볼륨 용량이 한도를 넘으면 데이터가 사라질 수 있습니다. 학습 데이터·체크포인트 등 보존이 필요한 파일은 반드시 스토리지에 저장합니다.
4. 워크로드 생성
워크로드는 독립적으로 연산을 실행하는 환경 단위입니다. GPU & 리소스 설정 → 추가 설정 → 검토 단계를 거쳐 생성할 수 있습니다. 워크로드 화면에서 워크로드 생성을 클릭하면 3단계 폼이 시작됩니다.
- 워크로드 생성을 클릭합니다.
- 01 GPU & 리소스 탭에서 워크로드의 기본 정보와 GPU 및 워크로드의 유형, 워크로드에서 사용할 인스턴스 또는 GPU 개수를 설정합니다.
- 02 추가 설정 탭에서 스토리지 마운트, 환경 변수 등을 설정합니다. 워크로드 실행 방식을 배치로 선택한 경우 이 단계에서 실행 스크립트를 입력합니다.
- 03 검토 탭에서 앞서 설정한 구성을 최종 확인한 뒤 생성합니다.

분산 워크로드는 필요한 GPU가 모두 확보되어야 생성·실행됩니다. 자원이 부족하면 확보될 때까지 대기합니다(갱 스케줄링).
5. 접속·실행
워크로드의 상태가 실행 중 이 되면 접속해 학습을 진행할 수 있습니다. 앱 연결(Jupyter)·SSH·SFTP 방식으로 접속할 수 있으며, 필요한 정보는 모두 인스턴스 상세에서 확인할 수 있습니다.
- Jupyter : 인스턴스 상세에서 Jupyter Notebook 또는 JupyterLab의 열기를 클릭합니다.
- SSH : PEM 키 다운로드를 클릭해 키 파일을 받고, 표시된 SSH 명령어를 그대로 복사해 접속합니다.
- SFTP: SSH와 동일한 접속 정보로 FileZilla 등 SFTP 클라이언트에서 워크로드 인스턴스에 파일을 전송할 수 있습니다.
6. 확인·정리
학습이 끝나면 결과를 확인하고 자원을 정리합니다. 워크로드가 종료되면 GPU는 자동으로 반환되므로 별도 반납 절차는 없습니다.
- 모니터링: GPU 사용률 등 실시간 지표를 시계열로 확인합니다. 조직 영역에서는 프로젝트별 필터로 비교할 수 있고, 프로젝트 영역에서는 해당 프로젝트 범위로 고정됩니다.
- 작업 이력: 워크로드 생성·수정·삭제 등 주요 작업이 작업 일시·유형·대상·작업자 단위로 기록됩니다. 감사 추적이 필요한 환경에서 증빙으로 활용할 수 있습니다.

관리자 시점
관리자는 일반 사용자와 동일하게 회원가입·로그인, 작업 영역 선택을 거친 뒤 역할에 따라 할 수 있는 작업이 달라집니다.
- 조직 관리자: 조직 오버뷰에서 GPU 유형별 분포와 활용 현황을 확인하고, 프로젝트를 생성해 GPU·스토리지 쿼터를 분배하며, 조직 멤버를 초대하고 역할을 부여하고, 자원 회수 규칙과 조직 설정을 관리합니다.
- 프로젝트 관리자: 프로젝트 오버뷰에서 워크로드 현황과 종료 사유 분포를 확인하고, 프로젝트 멤버 초대·역할 부여, 워크로드·스토리지·이미지 저장소 관리, 자원 회수 규칙과 프로젝트 설정을 담당합니다.
두 관리자 모두 모니터링·작업 이력으로 현황 점검과 감사 추적을 수행합니다.
솔루션 전체 구조
GPU Live의 아키텍처는 4계층으로 구성됩니다.

사용자가 콘솔에서 워크로드 유형을 선택해 워크로드를 생성하면 GPU Live가 내부적으로 GPU 자원을 할당하고 네트워크·스토리지 리소스를 준비해 실행 환경을 제공합니다. 이 과정에서 역할 기반 권한 처리, 실시간 모니터링은 물론 유휴 GPU 자원에 대한 자동 회수까지 솔루션이 일괄 처리하므로 사용자는 인프라 운영을 신경 쓰지 않고 학습에만 집중할 수 있습니다.
마치며
이 글에서는 GPU 클러스터를 운영할 때 마주할 수 있는 문제들을 짚은 뒤, GPU Live가 이를 어떻게 풀어내는지 살펴보았습니다. 워크로드 라이프사이클을 자동으로 처리하는 학습 실행, 빈패킹·갱 스케줄링·유휴 자원 회수로 같은 물리 자원에서 더 많은 워크로드를 소화하는 동적 할당, 3계층 격리와 6개 역할 RBAC·감사 로그로 멀티테넌트 환경의 통제 요건을 충족하는 운영 도구, 그리고 이 모든 것이 하나로 맞물리는 솔루션 구조까지, GPU Live는 AI 학습 실행과 GPU 자원 운영을 하나의 콘솔에서 완결합니다.
GPU Live는 NHN Cloud의 AI 풀스택 브랜드 NHN FactoryX에서 플랫폼 영역을 담당하고 있습니다. NHN FactoryX는 NHN Cloud가 7년 이상의 GPU 인프라 운영 경험을 바탕으로 만든 AI 워크로드를 위한 풀스택 환경으로, 수랭식 데이터 센터부터 HPC 클러스터, GPUaaS 플랫폼, 그 위의 AI 서비스까지를 하나의 통합 운영 모델로 제공합니다. GPU 운영을 위한 플랫폼뿐만 아니라 인터커넥트·냉각·스토리지 등 인프라 설계에 대한 정보가 필요하거나, 이 글에서 간략하게 다룬 동적 할당 기술에 대한 보다 자세한 구현 원리가 궁금하다면 NHN FactoryX 기술 백서를 참고할 수 있습니다.
긴 글을 읽어 주셔서 감사합니다.
👉 도입 문의: NHN Cloud 고객지원

