개요
AI 워크로드에 최적화
모델을 학습시키거나 미세 조정해야 하는 팀이 있는가 하면 기존 개방형 모델을 프로덕션에 투입해야 하는 팀도 있습니다. ROCm은 AMD GPU에서 두 가지 경로를 모두 지원하며, 분산 학습 워크플로와 대규모 AI 추론을 최적화하고 서비스로 제공하고 운영하는 소프트웨어를 함께 제공합니다.
AI 추론
ROCm을 통한 프로덕션 AI 추론
완전한 오픈 소스 추론 스택을 사용하여 AMD GPU에 주요 개방형 모델을 배포합니다. 사전 구축된 컨테이너와 업스트림 프레임워크 지원으로 빠르게 실행하세요.
원하는 엔진 선택
개방형 모델을 서비스로 제공해 보세요
AMD ROCm은 업스트림 프레임워크 지원, vLLM 및 SGLang 컨테이너 등을 갖춘 포괄적인 추론 스택을 제공합니다. 모델을 애플리케이션에 통합하기 전에 검증된 추론 소프트웨어로 시작할 수 있습니다.
설치 공간 절감
메모리와 서비스 제공 효율 향상
ROCm은 양자화된 모델 패키지에 네이티브 저정밀도 실행과 최적화된 트랜스포머 핫패스 커널을 결합해 튜닝 부담을 줄이면서 실제 서비스 환경의 처리율과 효율을 극대화합니다.
늘어나는 수요에 대응
여러 GPU와 노드로 추론 확장
모델이나 요청량이 서버 한 대로 감당하기 어려워지면 여러 AMD Instinct™ GPU에 나누어 서비스를 제공하세요. 지원되는 배포 환경에서는 프리필과 디코드를 분리할 수 있어 팀이 각 단계에 리소스를 따로 할당할 수 있습니다.
플릿 관리
Kubernetes에서 추론 운영
ROCm은 AMD GPU Operator, 내장 텔레메트리, 모듈형 드라이버 아키텍처를 통해 Kubernetes와 통합되며, 보안 환경과 에어 갭 환경 전반에서 자동 배포, 관측 가능성, 예측 가능한 수명 주기 관리를 지원합니다.
AI 훈련
AMD GPU의 포괄적인 AI 학습
통합 워크플로부터 클러스터 규모의 안정성까지, Primus는 대규모 모델 학습을 간소화하고 가속합니다.
프레임워크 유연성
재현 가능한 학습 실행
Megatron-LM, PyTorch TorchTitan, JAX MaxText용 AMD Primus 레시피로 통합 워크플로를 구성해 AMD Instinct™ GPU에서 학습을 시작하세요. 하나의 CLI와 재사용 가능한 구성으로 실험을 다시 실행하고 변경 사항을 비교해 보세요.
GPU 가동률 유지
트랜스포머 학습 병목 해소
Primus는 최적화된 커널과 통신을 고려한 가속 기술로 학습 처리율과 GPU 활용률을 높입니다. 팀은 Primus 스택 전체를 통해 이러한 기능을 사용하거나 Primus Turbo를 맞춤형 학습 환경에 연결해 활용할 수 있습니다.
작업을 계속 진행
확장형 분산 학습
모델이 서버 한 대로 감당하기 어려워지면, Primus가 여러 AMD Instinct™ GPU와 노드에 나누어 학습을 진행하도록 지원합니다. Primus-SaFE는 토폴로지를 고려한 배치와 자동 재시도를 활용해 클러스터가 커지는 과정에서 장시간 작업이 중단되더라도 복구할 수 있도록 지원합니다.
먼저 점검하고 계속 확인
엔터프라이즈 지원 학습 운영
Primus는 대규모 학습 작업을 시작하기 전에 팀이 노드 상태를 점검할 수 있도록 지원합니다. 학습이 진행되는 동안에는 텔레메트리와 대시보드로 성능과 클러스터 상태를 한눈에 파악할 수 있어 팀이 문제를 더 빠르게 찾아내고 해결할 수 있습니다.
최신 뉴스
ROCm을 사용한 AI 개발의 최신 발전에 대해 읽어 보세요.
지원 하드웨어
개발자 리소스
최신 ROCm 소식을 받아 보세요.
각주
©2024 Advanced Micro Devices, Inc. All rights reserved. AMD, AMD Arrow 로고, AMD ROCm, AMD Instinct, EPYC, Radeon Instinct 및 그 조합은 Advanced Micro Devices, Inc.의 상표입니다. PyTorch는 PyTorch의 상표 또는 등록 상표입니다. 본 발행물에 사용된 기타 제품 명칭은 참조용으로만 사용되며, 각 회사의 상표일 수 있습니다.
- ROCm이 지원하는 Radeon 부품의 전체 목록은 https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html에서 확인할 수 있습니다.
©2024 Advanced Micro Devices, Inc. All rights reserved. AMD, AMD Arrow 로고, AMD ROCm, AMD Instinct, EPYC, Radeon Instinct 및 그 조합은 Advanced Micro Devices, Inc.의 상표입니다. PyTorch는 PyTorch의 상표 또는 등록 상표입니다. 본 발행물에 사용된 기타 제품 명칭은 참조용으로만 사용되며, 각 회사의 상표일 수 있습니다.
- ROCm이 지원하는 Radeon 부품의 전체 목록은 https://rocm.docs.amd.com/en/latest/reference/gpu-arch-specs.html에서 확인할 수 있습니다.