AMD Pensando™ DPU
네트워킹, 보안 및 스토리지 서비스는 동시에 실행되어 클라우드 및 AI 배포 전반에 걸쳐 확정적 성능과 효율적인 리소스 활용을 가능하게 합니다.
AMD 네트워킹 기술이 AI 성능을 어떻게 향상하는지 알아보세요
프런티어 AI 모델은 가속기의 활용도를 최대화할 수 있도록 높은 대역폭과 낮은 지연율로 가속기 간에 데이터를 전송하는 네트워크를 필요로 합니다.
AI 프로토콜은 빠르게 변화합니다. 프로그래밍 가능한 네트워크는 인프라의 유연성을 유지하고 다음 단계를 대비할 수 있습니다.
개방형 시스템은 조직의 손에 선택권을 주며, 모든 규모에서 유연한 인프라 구축과 비용 최적화를 지원합니다.
전략적 네트워킹 선택이 전반적인 AI 성능, 인프라 비용, 확장성, 미래의 성장에 어떤 영향을 미치는지 알아보세요.
프런트 엔드 네트워킹은 안정적인 대규모 수집을 위해 사용자와 데이터를 AI 인프라에 연결합니다.
스토리지, 보안, 네트워킹 서비스를 동시에 가속화하면서 AI 워크로드를 위한 컴퓨팅 리소스를 유지합니다.
핵심 기술:
UALoE 및 긴밀하게 결합된 소프트웨어를 사용하면 텐서 병렬화, 대형 모델 및 복원력 있고 효율적인 워크로드를 지원하는 고대역폭 네트워킹으로 많은 GPU가 하나의 컴퓨팅 리소스로 작용하는 스케일 업 도메인을 실현할 수 있습니다.
72개의 GPU를 통합하고 지속적인 운영을 위한 대체 연결, 자동화된 장애 응답, 워크로드 격리를 통해 복원력이 뛰어난 네트워킹을 제공합니다.
핵심 기술:
스케일 아웃 네트워킹은 최대 규모의 학습 및 추론을 여러 데이터 센터에 분산할 수 있도록 대역폭, 효율성, 복원력을 제공합니다.
랙, 데이터 센터, 지역에 전반에 분산된 AI를 가속화하여 예측 가능한 성능, 빠른 복구, 낮은 인프라 비용을 제공합니다.
핵심 기술:
모델 학습
수십억 개 규모의 매개변수 모델을 학습시키려면 수십만 개의 GPU에서 정밀하고 지연율이 낮은 동기화가 필요합니다.
초저지연 집단 통신으로 학습 속도를 높이고 클러스터 활용성을 개선할 수 있습니다.
분산 추론
실시간으로 수백만 개의 추론 요청에 응답하려면 예측할 수 없는 수요 하에서 일관된 저지연 성능이 필요합니다.
지연율이 낮은 확정적 네트워킹으로 수요 변동이 심한 상황에서도 추론 응답을 빠르고 일관되게 유지할 수 있습니다.
에이전트 AI
에이전틱 AI 워크로드는 여러 복잡한 서비스 간의 지속적인 조율에 의존합니다.
인프라 서비스 가속화로 대규모 AI 워크플로 전반에서 효율적인 실행, 낮은 지연율의 통신 및 향상된 활용성을 지원할 수 있습니다.
AMD는 최신 AI 인프라의 성능, 확장성, 복원력 요구를 충족하도록 설계된 광범위한 AI 네트워킹 기술 포트폴리오를 제공합니다.
성숙한 다세대 소프트웨어 스택을 갖춘 Helios Management Software는 상태 모니터링, 원격 측정, RAS 및 자동화를 통해 지능형 패브릭 상태 관리를 지원합니다.
AMD Helios 랙스케일 솔루션 디자인은 최신 AMD Instinct™ GPU, AMD EPYC™ 서버 CPU, AMD Pensando™ 네트워킹을 결합한 완전 통합 AI 인프라이며 대규모 추론, 프런티어 모델 학습 및 미세 조정을 지원하는 개방형 산업 표준을 사용하여 설계되었습니다.
AMD는 업계 최고의 조직들과 협력하여 AI를 발전시키고 있습니다.
자주 묻는 질문
AI 네트워킹은 스케일 업 및 스케일 아웃 아키텍처 전반에서 실행되는 동기화된 대용량 GPU 통신에 최적화되어 있으며, 기존 워크로드에서 필요하지 않았던 추가적인 지능형 정체 관리, 빠른 복구, 심도 깊은 관찰력을 제공합니다.
AI NIC는 GPU-GPU 통신을 최적화하고 지연율을 줄이고 확장 시 안정성을 향상하는 프로그래밍 가능한 로직 및 전용 가속을 추가합니다.
스케일 업은 노드 또는 긴밀하게 연결된 시스템 내에서 성능을 극대화하는 것을 의미합니다. 스케일 아웃은 데이터 센터 내의 클러스터와 포드 전반으로도 확장됩니다. 스케일 어크로스는 여러 개의 지리적으로 분산된 데이터 센터를 단일 통합 시스템으로 운영할 수 있도록 통합 관리 및 오케스트레이션을 지원합니다.
AMD는 검증된 이더넷 표준을 기반으로 하고 광범위한 파트너 생태계 관계를 유지하여 상호 운용성을 보장하면서 공급업체에 유연성을 제공합니다.
UALoE(Ultra Accelerator Link over Ethernet)는 스케일 업 네트워크 패브릭용 랙 스케일 시스템에 사용됩니다. 이를 통해 많은 GPU가 하나의 통합 시스템으로 작동할 수 있습니다. 긴밀하게 결합된 GPU의 성능을 제공하는 동시에 프로덕션 AI가 필요로 하는 안정성과 개방성을 유지하며, 모든 것이 미래에 대비한 유연성을 위해 이더넷 표준을 기반으로 구축됩니다.
AMD 소프트웨어 스택에는 자동화된 데이 0/데이 2 운영을 위한 AMD 클러스터 컨트롤러(ACC), GPU 분할 및 격리를 위한 AMD 패브릭 매니저(AFM), 신뢰할 수 있는 스위치 운영을 위한 AMD 패브릭 운영 체제(AFOS)가 포함되어 있습니다. 이 기능들을 함께 사용하면 수동 구성이 필요 없으며 대규모 AI 클러스터를 실제 운영 환경에서 실용적으로 운영할 수 있습니다.
AMD 영업 대리점에 문의하세요.