AI 스토리지
대규모 AI 학습과 추론을 위한 고성능 데이터 인프라.
ExaStor는 GPU에 데이터를 빠르고 안정적으로 공급해
AI 워크로드의 성능과 효율을 극대화합니다.
AI 인프라의 성능은 데이터에서 완성됩니다
AI 학습과 추론 환경에서는 GPU 성능 만으로 전체 인프라의 성능을 높일 수 없습니다.
대규모 데이터를 GPU에 얼마나 빠르고 안정적으로 공급하느냐가 AI 워크로드의 처리 속도와 GPU 활용률을 결정합니다.
GPU 대기 시간
스토리지의 데이터 공급 속도가 GPU 연산 속도를 따라가지 못하면 고가의 GPU 자원이 유휴 상태에 놓입니다.
데이터 증가와 성능 저하
학습 데이터와 체크포인트가 증가하면 저장 용량뿐 아니라 처리량과 메타데이터 성능도 함께 확장되어야 합니다.
복잡한 데이터 운영
데이터 수집·학습·보호·아카이빙 환경이 분리되면 데이터 이동과 관리 복잡성이 증가합니다.
AI/HPC 워크로드를 가속하는 고성능 AI 스토리지
ExaStor는 Lustre 병렬 파일 시스템과 스케일아웃 아키텍처를 기반으로, 대규모 GPU 클러스터에 데이터를 빠르고 안정적으로 공급하는 글루시스의 AI 스토리지입니다.
AI 데이터와 메타데이터를 여러 스토리지 타깃에 분산하고 다수의 GPU 서버에서 발생하는 입출력을 병렬로 처리해, 스토리지 병목과 GPU 대기 시간을 줄입니다.
원본 데이터, 학습 데이터셋, 체크포인트 및 아카이브 데이터를 하나의 글로벌 네임스페이스에서 관리하며, 단일 노드부터 시작해 용량과 성능을 함께 확장할 수 있습니다.
GPU 활용 극대화
고대역폭 데이터 공급으로 GPU 대기 시간을 줄이고 AI 학습과 추론의 처리 효율을 높입니다.
병렬 데이터 처리
Lustre 기반 병렬 파일 시스템으로 다수의 GPU 서버에서 발생하는 대규모 입출력을 동시에 처리합니다.
메타데이터 가속
분산 메타데이터와 소형 파일 최적화 기술로 대규모 파일 환경의 병목을 완화합니다.
단일 노드부터 시작해 데이터 증가에 따라 용량과 처리량을 함께 확장할 수 있습니다.
데이터 배치 최적화
데이터 특성과 접근 패턴에 맞는 저장 계층을 활용해 성능과 비용을 최적화합니다.
엔터프라이즈 데이터 보호
고가용성, 스냅샷, 원격 복제 및 데이터 무결성 검증으로 AI 데이터와 서비스의 연속성을 보호합니다.
시스템 아키텍처
AI/ML 워크로드에 최적화된 고성능 분산 파일 스토리지
고성능 병렬 파일 시스템
AI/ML 워크로드와 HPC 환경에서는 여러 클라이언트가 같은 데이터에
동시에 접근합니다.
ExaStor는 Lustre 파일시스템을 채택해 파일을 모든 노드에 오브젝트 단위로
분산 저장하고, 하나의 이름 공간(글로벌 싱글 네임스페이스)으로 제공합니다.
각 클라이언트의 입출력을 여러 노드가 병렬로 처리하므로, 학습 구간에서
GPU가 데이터를 기다리는 시간을 줄일 수 있습니다.
NVIDIA® GPUDirect® Storage
GPUDirect Storage는 GPU 메모리와 스토리지 사이에 직접 데이터 경로를 만드는
NVIDIA의 기술입니다.
ExaStor는 이 경로를 지원해 CPU와 시스템 메모리를 거치는 복사 단계를 없애고,
GPU에서 동작하는 애플리케이션을 위한 분산 파일시스템 입출력 드라이버 모듈을
제공합니다.
고속 체크포인트 쓰기
학습 중 체크포인트를 저장하는 동안에는 모델 상태 전체가
한꺼번에 스토리지로 내려오고, 저장이 끝날 때까지 GPU는 기다립니다.
ExaStor는 이 버스트 쓰기를 여러 데이터 노드에 동시에 나눠 받고,
메타데이터 캐싱으로 저장에 걸리는 시간을 줄입니다.
저장이 빨라지면 체크포인트를 더 자주 만들 수 있어, 장애가 나도
다시 계산해야 하는 구간이 짧아집니다.
플래시 기반 확장 캐시
일부 SSD 드라이브를 RAM의 보조 캐시 공간으로 할당해,
RAM의 캐시 공간이 포화될 경우 보조 캐시로 할당한 SSD에서
빠른 읽기를 수행합니다. 기존 하드디스크에 비해 월등한 읽기 속도를
제공하고 RAM 공간을 절약하여 비용을 절감할 수 있습니다.
하드웨어 이중화
듀얼 컨트롤러 기반의 하드웨어 이중화로 특정 컨트롤러에 장애 발생 시
다른 컨트롤러로의 자동 페일오버를 통해 단일 노드만으로 다운타임 없는
서비스 연속성을 보장합니다.
데이터 동기화 방식에서 발생할 수 있는 Split-brain 위험을 원천 차단합니다.
(※ DC 모델에 한함)
이중화 아키텍처
지원합니다. 리소스 간 상호 연관성을 최소화하고 Active-Active 복잡도를
낮춰 부분 Failover를 통한 신속한 장애 복구가 가능합니다.
Multi-Rail 네트워크
병렬 네트워크 I/O를 지원합니다. 네트워크 트래픽 부하를 로드 밸런싱으로 분산하고
필요에 따라 대역폭을 확장할 수 있어 네트워크 과부하를 방지하고 성능을 최적화 할 수 있습니다.
Flexa Snapshot Manager
스토리지 클러스터의 스냅샷을 생성합니다.
COW 기반으로 수정되는 부분만 반영해 스냅샷을 빠르게 생성하고,
파일 시스템 하단에서 동작해 메타데이터 성능에 대한 영향을 최소화합니다.
스케일아웃 아키텍처
단일 시스템만으로 수십 PB 단위의 용량 확장이 가능하고 병렬 확장과 동시에
입출력 성능이 선형적으로 증가합니다. 도입 규모를 최소화하고
비즈니스 요구사항이나 데이터 증가에 따라 비용 효율적인 스토리지 관리가 가능합니다.
스케일업 확장
인클로저를 지원하여 고용량/고집적 아카이빙 스토리지 구성이 가능합니다.
E484 모델과 스케일업 확장 시 최대 408개의 디스크 장착 및
8.16PB 물리 용량 구성이 가능합니다.
유연한 볼륨 관리
실제 물리적 용량 이상으로 논리 공간을 할당할 수 있습니다.
물리적 용량의 효율성을 제공하고 유연하고 탄력적인 용량 관리가 가능합니다.
스토리지 공간 효율화
감소시키고 저장 공간을 효율적으로 활용할 수 있습니다. 압축된 데이터에 대한
무결성 검사를 수행해 데이터 손상 여부를 감지하고 데이터 신뢰성을 유지합니다.
멀티 프로토콜 지원
접근할 수 있도록 NFS, CIFS, GPUDirect Storage, POSIX-Compliant,
Restful-API 등 다양한 프로토콜을 지원합니다.
성능 모니터링
대역폭을 확인할 수 있습니다. 전체 노드 및 컨트롤러 별 네트워크 입출력 성능,
파일 시스템 사용량 및 전력 사용량, 컨트롤러 별 CPU/메모리 사용률 등을
실시간으로 모니터링합니다.
상태 모니터링
접속 현황 등을 모니터링합니다.
전용 관리 소프트웨어를 통해 시스템에 장착된 디스크의 상태를 실시간으로 확인하고
위치를 스캔하여 효율적으로 관리할 수 있습니다.
일체형 구성
DC(Dual Controller) 일체형
- 듀얼 컨트롤러 HW 기반의 컨트롤/데이터 노드 일체형 구성
- 단일 섀시 내에서 HA(Active-Active) 구성으로 고가용성 지원
- NVMe SSD 기준 노드 당 최대 40GB/s 성능 제공
- 최소 1노드 도입 및 1노드 단위로 유연한 확장 가능
- NVMe 올플래시 또는 SAS 하이브리드 구성 가능
SC(Single Controller) 일체형
- 싱글 컨트롤러 HW 기반의 컨트롤/데이터 노드 일체형 구성
- 초기 1노드부터 도입 및 1노드 단위로 유연한 확장 가능
- 노드 간 미러링(Mirroring) 구성 시 고가용성 지원
- NVMe 올플래시 또는 SAS/SATA 하이브리드 구성 가능
분리 확장형 구성
SC(Single Controller) 분리 확장형
- 컨트롤 노드 + 데이터 노드 분리형 구성
- 노드 이중화는 기본 4노드(1SET), 4노드 단위 확장 가능
- 2노드 단위 HA 구성, 4노드 기준 3+1 노드 이중화 구성
- SAS 인터페이스 기반 논리 디스크 공유
- SAS/SATA 하이브리드 구성 가능