GPUBASE | ACRYL

GPUBASE

GPUBASE

GPU는 확보했습니다.
문제는 제대로 쓰고 있느냐입니다.

대부분 사람들은 모르는
GPU 인프라의 실제 상태

GPU 메모리가 점유되어 있어도 코어는 유휴 상태일 수 있습니다.
대부분의 조직은 이 차이를 구분하지 못합니다.

100 % GPU 할당률

모니터링 화면에는 사용 중으로 표시

50 60 % 실효 가동률

실제로 연산하는 비율

21 억원 / 년 유휴 비용

GPU 100장 기준 (H100)

AI 인프라 운영의
5가지 한계

GPU·네트워크·스토리지를 통합 추적하는 시스템이 없기 때문입니다.
막대한 GPU 자본 투자에도 운영은 5가지 구조적 한계에 부딪힙니다.

  1. 낮은 GPU 활용률

    평균 50~60%. 할당된 100%에서도 실제 코어 활용은 절반에 그칩니다.

    01
  2. 자원의 분절화

    GPU와 네트워크가 워크로드에 따라 파편화되고, 대기 시간이 늘어납니다.

    02
  3. 네트워크 병목 발생

    단일 경로 의존, 학습과 추론을 넘어 SLA가 깨집니다.

    03
  4. 이기종 가속기 복잡성

    구성형 NVIDIA·AMD·국산 NPU 환경의 운영 SW 투입이 늘어납니다.

    04
  5. 인프라 종속성

    기존 솔루션은 특정 벤더·클라우드·워크로드에 묶입니다.

    05

Layer-1

USER INTERFACE

Web GUI (관리자 · 사용자) SDK (CLI / API) Job 제출 · 상태 조회 · 이력 관리

Layer-2

GPUBASE CORE

Booster GPU 성능 최적화
Control Tower GPU 자원 격리·통합
Monitor Tower Full-stack 통합 관제

JONATHAN DRIVE (데이터) · Clustering · Logging · Failure Analysis

Layer-3

ORCHESTRATION

VMware · OpenStack Kubernetes · SLURM Job 오케스트레이션 · 상태 제어

Layer-4

H/W INFRASTRUCTURE

GPU · NPU · DPU RDMA · InfiniBand 이기종 인프라 통합

3 PLATFORM MODULES

3개 모듈 · 한 플랫폼

서버에 설치해 적용합니다. 학습·추론 코드는 수정하지 않습니다.

GPU 성능 최적화

SETUP — VM/물리 서버 설치 · 학습·추론 코드 무변경

  • 다중경로 전송 기술 특허 1건 · 국제 학술지 게재
  • AI 트래픽 우선순위 제어 특허 4건 · 최상위 국제 학회 발표
  • JONATHAN vLLM Engine 특허 3건

GPU 자원 격리·통합

SETUP — Container / FaaS 환경 · 이기종 가속기 통합 운영

  • 하드웨어 격리 + 소프트웨어 분할 MIG 한계 보완
  • 이기종 연합학습 클러스터 국내 최초 · 데이터 이동 최소화
  • CLI / API SDK Multi-tenant 자원 배분

Full-stack 통합 관제 비용

SETUP — 관리자/사용자별 맞춤 · 클러스터 전체 + 노드 상세 뷰

  • Full-stack 모니터링 SM 점유율·메모리·전력·RDMA·IOPS
  • 비용 분석 대시보드 LLM 서빙 · 임베딩 · 배치DB 항목별
  • 부서별 원가 배분 토큰 정산 기반 Chargeback
  • Web GUI Dashboard 설치 없이 브라우저 접근

슬라이싱은
시작점일 뿐입니다.

GPU 활용률 93% · 네트워크 활용률 98%는
세 자원이 함께 움직여야 가능합니다.

SLA 보장

학습이 추론을 밀어내지 않는 일.

시장 평균

Best-effort sharing — 트래픽이 커지면 SLA가 깨짐

GPUBASE

PeRF- AI 트래픽 차등서비스 기술

부하 256× 환경에서 추론 변동 10% 미만

자원 분할

하나의 GPU를 목적에 맞게 나누는 일.

시장 평균

고정 분할 — 워크로드 변화에 즉시 대응하기 어려움

GPUBASE

MIG 또는 SW 기반 GPU 분할 기술

이기종 가속기 통합 운영

통신 경로

GPU 사이 데이터를 빠르게 보내는 일.

시장 평균

단일 경로 RDMA — 클러스터 전체가 한 경로 속도에 묶임

GPUBASE

UL-MPRDMA — 다중 경로 RDMA

분산 학습 1회 60초 → 33초

경쟁 솔루션과의 차원별 비교

하드웨어부터 오케스트레이션까지, 운영 환경과 연결되는 호환성을 기준으로 비교합니다.

경쟁 솔루션과 GPUBASE 기능 비교
항목 A. 하드웨어 분할 도구 B. K8s 확장형 GPU 가상화 플랫폼 C. HPC 스케줄러 · 통합 관리 포털 GPUBASE
차원 1 · 자원 분할
정적 슬라이싱
동적 미세분할 - -
컨테이너 · VM 통합
차원 2 · 통신 경로
RDMA 지원
다중 경로 RDMA - - -
클러스터 통신 최적화 - -
차원 3 · SLA 보장
QoS 우선순위
학습 · 추론 동시 SLA - - -
부하 자동 선점 - - -
+ α
이기종 가속기 통합 - 특정 벤더 한정
학술 검증 - - -
글로벌 CSP 실증 - - -
부서별 Chargeback -
운영 비용 가시화 -

Before vs After

다중 경로 최적화

특허 출원 11건

GPU 활용률 :

개선 효과

P99 최대
45%
평균
34%

PeRF 트래픽 차등 제어

특허 출원 4건

부하 결과

추론 변동
<10%

JONATHAN vLLM Engine

특허 출원 3건

GPU 부하 높음 · 속도 우선 GPU 부하 낮음 · 품질 우선

부하 결과

추론 길이
자동 조절

가속기·클라우드·프레임워크 호환성

벤더·가속기·클라우드 환경에 종속되지 않고 보유한 인프라와 운영 구조를 그대로 활용합니다.

ACCELERATORS

NVIDIA A100 · H100 · H200 · B200AMD Instinct MI SeriesGoogle Cloud TPU국산 NPU 가속기Rebellions ATOMFuriosaAI RNGDDeepX Edge SoC

CSP · DEPLOYMENT

AWSMicrosoft AzureGoogle CloudNaver CloudOn-premisesPrivate CloudHybrid

AI FRAMEWORKS

PyTorchTensorFlowDeepSpeedMegatron-LMvLLMONNXTensorRTTriton Inference

ORCHESTRATION · FABRIC

Kubernetes (K8s)VMware · OpenStackSLURMBare-Metal · FaaSRoCEv2 · InfiniBand (NDR/HDR)Ethernet · GPUDirectGPUDirect Storage

조직 유형별 활용 시나리오

운영 환경과 목적에 맞춰 GPU 자원을 배치하고, 성과를 수치로 확인합니다.

CSP · 클라우드

고객별 GPU 격리 배분 + SLA 보장

Multi-tenant GPU 서비스 · 고객별 격리·SLA 보장

OBSERVABILITY

GPU와 보드 상태를 한 화면에서 확인하고 운영 기준을 통일합니다.

공통 분산 환경 운영

AI · HPC

분산 학습과 추론 워크로드에 필요한 자원을 유연하게 연결합니다.

딥러닝·대규모 학습

RESEARCH · AI

작은 실험부터 대규모 서비스까지 자원 흐름을 일관되게 관리합니다.

지속 가능한 AI 운영

측정된 운영 성과

추가 GPU 구매 없이 — 글로벌 CSP 3사 실증 · 자체 RoCEv2 클러스터 검증.

24.2×

美 1·2위 클라우드 성능 개선

93%

GPU 활용률 (대규모 글로벌 CSP 환경 실증 실측)

100%

추론 SLA 보장

86건

국내외 특허

학습 24.2× 가속 · 추론
SLA 안정 동시 달성

DeepSpeed + PEFT(LoRA) 분산학습 / vLLM 분산추론. KT Mi:dm 2.0(11B),
Qwen 2.5(72B), ALLM.H(27B) 실제 운영 모델로 부하 4단계(None-하-중-상) 정량 측정.

GPUBASE 적용 전후 성능 비교
검증 항목 부하 하 부하 중 부하 상
PT1 분산학습 (27B) 1.97× 가속 6.36× 가속 24.2× 가속
PT2 추론 응답시간 증가 없음 97.5% 억제 91.5% 억제
PT3 혼합부하 (학습+추론) - 학습 6.56× + 추론 SLA 안정 -
PT4 장애 복구 장애 발생 시 무중단 유지 · 자동 복구
PT5 혼합 워크로드 최대 2,000개 동시 실행 · GPU 활용률 최대 93% · 큐 대기시간 최대 93%↓
PT6 장애 감지·복구 장애 44초 이내 자동 감지 · 14~16초 이내 복구
PT7 All-Reduce 대역폭 저부하 +141% 중부하 +560% 고부하 +2,375%

다른 솔루션과 차이점

기존 솔루션과 GPUBASE 기능 비교
항목 기존 솔루션 클라우드 서비스 GPUBASE
GPU 자원 정책 제한적 서비스별 상이
Multi-tenant 부분 지원 상품 단위
vLLM Engine 별도 구성 제한적
관측성 도구 분산 콘솔 종속
확장성 환경별 설정 클라우드 종속

GPU 100장 기준
연간 ~21억원 절감

유휴 자원을 줄이고 필요한 만큼만 배분해 운영 비용을 낮춥니다.

도입 전 활용률

50%

실질적인 파워는 100장 중 50장 분의 파워만 사용하고
전력·냉각·공간 비용만 소비되며,
연간 유휴 비용 수십억원에 달하게 됩니다.

도입 후 활용률

93%

정책 기반 자원 분할과 통합 운영

23장

GPU 추가 구매 불필요

GPUBASE 적용 기준

~21억

연간 비용 절감

GPUBASE 적용 기준

30%

운영 효율 개선

GPUBASE 적용 기준

운영 환경에서 검증

REFERENCE 01

대기업 S사 · 프라이빗 클라우드

  • 국내 1위 EPC사 민간 폐쇄형 프라이빗 클라우드
  • GPU 클러스터 환경에서 GPUBASE 공급 · 운영
  • Transparent 설치 → 기존 워크로드 중단 없이 적용

REFERENCE 02

정부부처 · 공공

  • 공공 보안 환경 요건 대응
  • 정부부처·지자체 AI 데이터센터 다년 운영
  • 망분리·인증 환경에서 안정적 운영 실적

호환 생태계

  • AWS
  • Microsoft Azure
  • Megazone
  • DAEWON CTS
  • KT
  • SKT
  • Rebellions
  • FuriosaAI
  • MangoBoost
  • LG전자
  • NVIDIA

우리 환경에는 어떤 구성이 맞습니까?

3개 등급으로 환경과 규모에 맞춰 도입. Transparent 설치 · 4~6주 일정.

Standard

Booster Only

VM 기반 · Single-tenant

가장 빠른 효과 확인. Transparent 설치, 기존 워크로드 변경 없이 GPU 성능 최적화.

  • Booster (다중경로 · PeRF · vLLM Engine)
  • Transparent 설치 · 학습/추론 코드 수정이 불필요

Professional

Booster + Control Tower

GPU 가속부터 관리까지.

워크로드 변경없이 GPU 성능 최적화, GPU 분할 관리.

  • Standard 포함
  • Control Tower (MIG+자체 미세분할)
  • 이기종 연합학습

Enterprise

Full Module

공공 · 대규모 · 보안 환경

공공 보안 환경 운영 · Full-stack 관제 + 이상 징후 자동 분석.

  • Professional 포함
  • Monitor Tower (통합 GUI · Alert)
  • Failure Analysis · 감사 추적

귀사의 GPU는
몇 장이나 일하고 있습니까?

다운타임 없는 설치 · 4–6주 도입 · 진단 리포트로 의사결정 가속.