AI 네트워킹이란?

AI 네트워킹은 대규모 AI를 지원하는 고성능 패브릭입니다. GPU, 가속기, 시스템을 연결하여 학습, 추론, 에이전틱 AI 워크로드가 성장함에 따라 필요한 처리율, 동기화, 성능 일관성을 제공합니다.

중요한 현실

AI 워크로드의 규모와 복잡성이 증가함에 따라 시스템 성능은 점점 더 네트워킹에 의존하고 있습니다. 프런트 엔드 네트워킹부터 스케일 업 및 스케일 아웃 패브릭까지, 각 레이어에 따라 AI 인프라가 얼마나 효율적으로 작동하는지가 결정됩니다.

네트워킹에서 시작되는 대규모 성능

Data center with glowing lights

최적화된 성능

프런티어 AI 모델은 가속기의 활용도를 최대화할 수 있도록 높은 대역폭과 낮은 지연율로 가속기 간에 데이터를 전송하는 네트워크를 필요로 합니다.

Abstract teal and orange light streaks overlaid with scrolling source code, suggesting data flow or AI processing

프로그래밍 기능

AI 프로토콜은 빠르게 변화합니다. 프로그래밍 가능한 네트워크는 인프라의 유연성을 유지하고 다음 단계를 대비할 수 있습니다.

Teal and orange network lines and nodes connected across a dark textured surface, symbolizing data connectivity

개방형

개방형 시스템은 조직의 손에 선택권을 주며, 모든 규모에서 유연한 인프라 구축과 비용 최적화를 지원합니다.

확장형 AI 네트워킹의 7가지 아키텍처 원칙

전략적 네트워킹 선택이 전반적인 AI 성능, 인프라 비용, 확장성, 미래의 성장에 어떤 영향을 미치는지 알아보세요.

필요

프런트 엔드: AI 팩토리 피드 공급

프런트 엔드 네트워킹은 안정적인 대규모 수집을 위해 사용자와 데이터를 AI 인프라에 연결합니다.

스토리지, 보안, 네트워킹 서비스를 동시에 가속화하면서 AI 워크로드를 위한 컴퓨팅 리소스를 유지합니다.

핵심 기술:

스케일 업: 통합 AI 시스템

UALoE 및 긴밀하게 결합된 소프트웨어를 사용하면 텐서 병렬화, 대형 모델 및 복원력 있고 효율적인 워크로드를 지원하는 고대역폭 네트워킹으로 많은 GPU가 하나의 컴퓨팅 리소스로 작용하는 스케일 업 도메인을 실현할 수 있습니다.

72개의 GPU를 통합하고 지속적인 운영을 위한 대체 연결, 자동화된 장애 응답, 워크로드 격리를 통해 복원력이 뛰어난 네트워킹을 제공합니다.

핵심 기술:

스케일 아웃 및 스케일 어크로스: 분산된 AI

스케일 아웃 네트워킹은 최대 규모의 학습 및 추론을 여러 데이터 센터에 분산할 수 있도록 대역폭, 효율성, 복원력을 제공합니다.

랙, 데이터 센터, 지역에 전반에 분산된 AI를 가속화하여 예측 가능한 성능, 빠른 복구, 낮은 인프라 비용을 제공합니다.

핵심 기술:

사용 사례

모델 학습

과제

수십억 개 규모의 매개변수 모델을 학습시키려면 수십만 개의 GPU에서 정밀하고 지연율이 낮은 동기화가 필요합니다.

해결책

초저지연 집단 통신으로 학습 속도를 높이고 클러스터 활용성을 개선할 수 있습니다.

Radiating teal and orange light streaks with sparkling particles, suggesting high-speed data transfer

분산 추론

과제

실시간으로 수백만 개의 추론 요청에 응답하려면 예측할 수 없는 수요 하에서 일관된 저지연 성능이 필요합니다.

해결책

지연율이 낮은 확정적 네트워킹으로 수요 변동이 심한 상황에서도 추론 응답을 빠르고 일관되게 유지할 수 있습니다.

Abstract background

에이전트 AI

과제

에이전틱 AI 워크로드는 여러 복잡한 서비스 간의 지속적인 조율에 의존합니다.

해결책

인프라 서비스 가속화로 대규모 AI 워크플로 전반에서 효율적인 실행, 낮은 지연율의 통신 및 향상된 활용성을 지원할 수 있습니다.

Teal and orange particle mesh forming a flowing wave over blurred cityscape lights

프로덕션 AI를 위한 스케일 업 시스템의 중요성

AI가 개별 노드를 넘어 확장됨에 따라, 스케일 업 네트워킹은 많은 GPU를 하나의 컴퓨팅 리소스에 연결하고 네트워크 장애 시 학습 및 에이전틱 워크로드를 계속 실행할 수 있도록 높은 가용성을 제공합니다.

이러한 AI 워크로드는 재시작에 민감한 경우가 많으므로, 스케일업 네트워킹은 활성 작업 중단이나 누적된 진행 상황의 손실 없이 장애로부터 네트워크를 신속하게 복구할 수 있는 복원력을 제공해야 합니다.

AI 네트워킹을 위한 AMD 포트폴리오

AMD는 최신 AI 인프라의 성능, 확장성, 복원력 요구를 충족하도록 설계된 광범위한 AI 네트워킹 기술 포트폴리오를 제공합니다.

AMD AI 네트워킹 소프트웨어 스택

성숙한 다세대 소프트웨어 스택을 갖춘 Helios Management Software는 상태 모니터링, 원격 측정, RAS 및 자동화를 통해 지능형 패브릭 상태 관리를 지원합니다.

Abstract blue digital circuit pathway with glowing light source and pixel-like data patterns

AMD Pensando™ DPU

네트워킹, 보안 및 스토리지 서비스는 동시에 실행되어 클라우드 및 AI 배포 전반에 걸쳐 확정적 성능과 효율적인 리소스 활용을 가능하게 합니다.

AMD Helios Rackscale

AMD Helios 랙스케일 솔루션: 하이퍼스케일 AI를 위한 선도적인 랙 성능1

AMD Helios 랙스케일 솔루션 디자인은 최신 AMD Instinct™ GPU, AMD EPYC™ 서버 CPU, AMD Pensando™ 네트워킹을 결합한 완전 통합 AI 인프라이며 대규모 추론, 프런티어 모델 학습 및 미세 조정을 지원하는 개방형 산업 표준을 사용하여 설계되었습니다.

개방형 생태계 및 표준

AMD는 업계 최고의 조직들과 협력하여 AI를 발전시키고 있습니다.

Open Compute Project logo
Ultra Accelerator Link logo
Ultra Ethernet Consortium logo

자주 묻는 질문

자주 묻는 질문

AI 네트워킹은 스케일 업 및 스케일 아웃 아키텍처 전반에서 실행되는 동기화된 대용량 GPU 통신에 최적화되어 있으며, 기존 워크로드에서 필요하지 않았던 추가적인 지능형 정체 관리, 빠른 복구, 심도 깊은 관찰력을 제공합니다.

AI NIC는 GPU-GPU 통신을 최적화하고 지연율을 줄이고 확장 시 안정성을 향상하는 프로그래밍 가능한 로직 및 전용 가속을 추가합니다.

스케일 업은 노드 또는 긴밀하게 연결된 시스템 내에서 성능을 극대화하는 것을 의미합니다. 스케일 아웃은 데이터 센터 내의 클러스터와 포드 전반으로도 확장됩니다. 스케일 어크로스는 여러 개의 지리적으로 분산된 데이터 센터를 단일 통합 시스템으로 운영할 수 있도록 통합 관리 및 오케스트레이션을 지원합니다.

AMD는 검증된 이더넷 표준을 기반으로 하고 광범위한 파트너 생태계 관계를 유지하여 상호 운용성을 보장하면서 공급업체에 유연성을 제공합니다.

UALoE(Ultra Accelerator Link over Ethernet)는 스케일 업 네트워크 패브릭용 랙 스케일 시스템에 사용됩니다. 이를 통해 많은 GPU가 하나의 통합 시스템으로 작동할 수 있습니다. 긴밀하게 결합된 GPU의 성능을 제공하는 동시에 프로덕션 AI가 필요로 하는 안정성과 개방성을 유지하며, 모든 것이 미래에 대비한 유연성을 위해 이더넷 표준을 기반으로 구축됩니다.

AMD 소프트웨어 스택에는 자동화된 데이 0/데이 2 운영을 위한 AMD 클러스터 컨트롤러(ACC), GPU 분할 및 격리를 위한 AMD 패브릭 매니저(AFM), 신뢰할 수 있는 스위치 운영을 위한 AMD 패브릭 운영 체제(AFOS)가 포함되어 있습니다. 이 기능들을 함께 사용하면 수동 구성이 필요 없으며 대규모 AI 클러스터를 실제 운영 환경에서 실용적으로 운영할 수 있습니다.

문의하기

AMD 영업 대리점에 문의하세요.

각주
  1. 계산은 2025년 6월, AMD 퍼포먼스 랩에서 AMD Instinct™ MI455X 72xGPU “Helios” AI 랙의 예상 메모리 용량/대역폭, 스케일 업/아웃 대역폭 사양을 바탕으로 NVIDIA “Vera Rubin” 72xGPU “Oberon” 랙의 공개적으로 발표된 사양을 비교하여 수행했습니다. 서버 제조업체별 구성에 따라 다른 결과가 나올 수 있습니다. MI350-045A
    계산은 2025년 9월, AMD 퍼포먼스 랩에서 AMD Instinct™ MI455X 72xGPU “Helios” AI 랙의 FP8/FP4 데이터 유형 및 예상 사양을 바탕으로 NVIDIA “Vera Rubin” 72xGPU “Oberon” AI 랙의 공개적으로 발표된 사양을 비교하여 수행했습니다. 프로덕션 실리콘에 따라 실제 결과는 다를 수 있습니다. 서버 제조업체별 구성에 따라 다른 결과가 나올 수 있습니다. MI350-046B