언어 바꾸기English
이전 목록

Google DeepMind, 분산 LoCo를 분리한 비동기 학습 아키텍처 ‘Decoupled DiLoCo’ 공개… 높은 하드웨어 장애율에서도 Goodput 88% 달성

Google DeepMind Introduces Decoupled DiLoCo: An Asynchronous Training Architecture Achieving 88% Goodput Under High Hardware Failure Rates

TL;DR AI

핵심 요약

1분
  1. 구글 딥마인드는 비동기·고장 격리형 컴퓨트 아일랜드로 학습을 분리하는 분산 학습 구조 ‘Decoupled DiLoCo’를 공개했다.

  2. 블로킹 동기화 대신 클러스터 간 압축 업데이트를 사용해, 먼 데이터센터 사이에서도 학습을 계속 진행할 수 있게 했다.

  3. 고장률이 높은 시뮬레이션에서 goodput 88%를 달성했고, 8개 데이터센터 기준 대역폭 요구량을 198Gbps에서 0.84Gbps로 줄였다.

  4. 이 방식은 칩 장애와 WAN 병목으로 인한 학습 중단을 줄여, 대규모 AI 모델 학습의 확장성과 복원력을 높일 수 있다.

원문 보기