AI 기초
연합 학습이란 무엇인가?
연합 학습은 여러 장치나 조직에 걸쳐 공유 모델을 훈련하면서 각 참여자의 원시 훈련 데이터를 로컬에 유지합니다. 코디네이터가 모델 파라미터를 배포하고, 클라이언트는 자체 기록에 대해 업데이트를 계산하며, 집계 단계에서 이러한 업데이트를 결합합니다.
데이터를 로컬에 보관하는 것은 유용하지만, 이는 프라이버시나 보안과 동의어는 아닙니다. 모델 업데이트가 정보를 유출할 수 있고, 손상된 클라이언트가 훈련을 오염시킬 수 있으며, 코디네이터는 여전히 인증, 전송 보안, 접근 제어 및 정의된 신뢰 모델이 필요합니다.
핵심 요점
- 연합 학습은 계산을 분산된 데이터로 옮기며, 원시 데이터셋을 하나의 중앙 트레이너로 이동시키지는 않습니다.
- 크로스 디바이스 시스템은 많은 간헐적인 장치를 포함하고, 크로스 사일로 시스템은 더 적고 안정적인 조직을 포함합니다.
- 보안 집계와 차등 프라이버시는 서로 다른 위험을 다루며 결합될 수 있습니다.
- 비IID 데이터, 제한된 대역폭, 신뢰할 수 없는 참여 및 악의적인 업데이트는 핵심 설계 제약 조건입니다.

연합 평균화 라이프사이클
전형적인 라운드는 코디네이터가 참여 가능한 클라이언트를 선택하고 현재 모델을 전송하면서 시작됩니다. 각 클라이언트는 제한된 단계 수만큼 로컬에서 훈련하여 파라미터 또는 그래디언트 업데이트를 생성합니다. 코디네이터는 일반적으로 로컬 샘플 수에 기반한 가중치를 적용해 참여 가능한 업데이트를 집계하고 새로운 공유 모델을 공개합니다.
각 라운드에서는 일부 클라이언트만 참여할 수 있습니다. 프로토콜은 연결 끊김, 버전 불일치 및 충전 중이거나 바쁘거나 오프라인인 장치와 같은 상황을 견딜 수 있어야 합니다. 통신이 연산을 압도할 수 있기 때문에, 업데이트 압축 및 라운드 횟수 감소가 순수 가속기 속도보다 더 중요할 때가 많습니다.
크로스 디바이스와 크로스 사일로 비교
크로스 디바이스 연합 학습은 많은 개인이 소유한 스마트폰, 센서 또는 브라우저를 포함할 수 있습니다. 클라이언트는 수가 많고 신뢰도가 낮으며 간헐적으로 이용 가능합니다. 크로스 사일로 연합 학습은 일반적으로 안정적인 인프라와 계약 기반 거버넌스를 갖춘 소수의 병원, 은행 또는 사업 부서를 연결합니다.
두 환경은 서로 다른 신원, 감사 및 장애 가정을 필요로 합니다. 크로스 사일로 프로젝트는 공유 스키마와 검증 프로세스를 협상할 수 있지만, 크로스 디바이스 서비스는 수백만 개의 소프트웨어 버전과 매우 불균형한 로컬 데이터셋을 처리해야 할 수 있습니다.
보안 집계, 차등 프라이버시 및 암호화
보안 집계는 서버가 각 클라이언트의 업데이트를 읽지 않고도 집계값을 복구할 수 있게 하는 암호화 프로토콜입니다. 차등 프라이버시는 기여도를 클리핑하고 보정된 노이즈를 추가함으로써 공개 결과가 특정 기록이나 참여자에 얼마나 의존할 수 있는지를 제한합니다.
두 메커니즘 모두 모든 위험을 해결하지는 못합니다. 보안 집계는 집계 자체를 무해하게 만들지는 않으며, 차등 프라이버시는 정확도와 프라이버시 사이의 트레이드오프를 요구하고 명시적인 프라이버시 예산을 통해 고려해야 합니다. 암호화는 전송 중이거나 저장된 데이터를 보호하지만, 모델로부터의 추론을 자체적으로 방지하지는 못합니다.
비IID 데이터와 모델 품질
클라이언트 데이터는 독립적이고 동일하게 분포하는 경우가 거의 없습니다. 키보드 모델은 각 사람의 어휘를 보며, 병원은 서로 다른 인구를 서비스하고, 공장은 서로 다른 장비를 사용합니다. 이러한 차이는 수렴을 늦추고 소규모 클라이언트 그룹의 성능 저하를 감추게 할 수 있습니다.
평가는 전역 메트릭, 클라이언트별 또는 코호트별 분포, 보정 및 실패 분석을 포함해야 합니다. 중앙 테스트 세트는 편리하지만 충분하지 않을 수 있습니다. 이는 연합 학습을 머신러닝 데이터 품질 및 구조화 및 비구조화 데이터 거버넌스와 연결합니다.
위협 및 운영 제어
악의적인 클라이언트는 중독된 업데이트를 제출할 수 있고, 시빌 클라이언트는 집계를 왜곡할 수 있으며, 손상된 서버는 표적 모델을 배포할 수 있습니다. 방어책으로는 인증된 등록, 이상 탐지, 견고한 집계, 업데이트 검증, 속도 제한 및 실용적인 경우 재현 가능한 소프트웨어 증명이 포함됩니다.
연합 학습은 보다 넓은 사이버 보안 프로그램의 일부분이어야 합니다. 팀은 코디네이터를 누가 제어하는지, 어떤 메타데이터가 수집되는지, 참여자가 어떻게 탈퇴할 수 있는지, 모델이 어떻게 롤백되는지, 프라이버시 또는 품질 테스트가 실패했을 때 어떤 조치가 취해지는지를 문서화해야 합니다.
연합 최적화와 데이터 이질성
연합 학습은 모델 또는 업데이트 작업을 참여 클라이언트에 전송하고 로컬에서 훈련한 뒤 원시 예시를 중앙화하지 않고 업데이트를 집계합니다. 연합 평균화에서는 선택된 클라이언트가 여러 로컬 최적화 단계를 수행하고 서버는 일반적으로 예시 수에 따라 가중 평균을 계산합니다. 통신 라운드, 로컬 epoch, 선택 및 학습률은 대역폭과 수렴 사이의 트레이드오프를 이룹니다. 크로스 디바이스 환경은 많은 신뢰할 수 없는 스마트폰이나 센서를 포함하고, 크로스 사일로 환경은 더 강력한 컴퓨팅, 신원 및 거버넌스를 갖춘 소수의 조직을 포함합니다.
클라이언트 데이터는 일반적으로 비독립적이며 고르지 않습니다: 사용자는 행동, 라벨 분포, 데이터 양, 이용 가능성에서 차이가 있습니다. 로컬 훈련은 호환되지 않는 방향으로 표류할 수 있어 단순 평균이 불안정하거나 활동량이 높은 클라이언트에 편향될 수 있습니다. 알고리즘은 근접 항, 적응형 서버 최적화, 클러스터링, 개인화 또는 제어 변수를 사용할 수 있습니다. 평가는 전역 및 클라이언트 수준 성능, 꼬리 클라이언트, 참여 빈도, 수렴, 통신 및 에너지를 보고해야 합니다. 좋은 평균은 소규모 또는 드문 클라이언트 집단이 더 나쁜 모델을 받는 사실을 감출 수 있습니다.
프라이버시, 보안 및 시스템 엔지니어링
데이터를 로컬에 보관하는 것만으로는 프라이버시를 보장하지 못합니다. 그래디언트와 업데이트는 멤버십이나 특징을 유출할 수 있으며, 최종 모델은 예시를 기억할 수 있습니다. 보안 집계는 서버로부터 개별 업데이트를 숨기고, 차등 프라이버시는 클리핑과 노이즈 추가로 정보 기여를 제한하지만, 두 방법 모두 유용성과 운영 복잡성을 변화시킵니다. 위협 모델, 프라이버시 단위, 예산 및 신뢰 구성 요소를 명시하십시오. 전송 중 암호화는 필요하지만 악의적인 클라이언트, 중독된 업데이트, 손상된 코디네이터 또는 추론 공격을 방지하지는 못합니다.
방어책으로는 인증된 클라이언트, 견고한 집계, 이상 탐지, 업데이트 제한, 일부 설계에서의 보안 엔클레이브, 그리고 깨끗한 데이터에 대한 검증이 포함됩니다. 시빌 공격자는 다수의 클라이언트를 생성할 수 있고, 백도어는 평균화 과정에서도 살아남을 수 있으며, 의심스러운 업데이트를 배제하는 것이 정당한 희귀 행동까지 차단할 위험이 있습니다. 클라이언트 코드를 버전 관리하고, 중단된 라운드를 지원하며, 재생 공격을 방지하고, 지연 클라이언트와 장치 제약을 고려한 설계를 해야 합니다. 동의, 보관, 지역 규정 및 삭제는 로컬 데이터와 파생된 업데이트에도 적용됩니다.
배포 및 거버넌스 사례
모바일 키보드는 다음 단어 예측을 로컬에서 훈련할 수 있지만, 배포 시에는 장치 성능 및 동의 기준을 충족하는 사용자 집단을 사용하고, 클리핑된 보호 업데이트를 수집하며, 고정된 기준 모델과 비교해야 합니다. 출시 전에 언어 및 방언 성능, 배터리 사용량, 데이터 사용 및 기억 위험을 검증하십시오. 클라이언트는 서명된 훈련 작업과 모델 업데이트가 필요하고, 서버는 감사 가능한 라운드 구성 및 롤백이 필요합니다. 연합 학습은 제약 하에 분산 학습을 위한 아키텍처이며, 대표 데이터, 프라이버시 엔지니어링 또는 책임을 대체하는 것이 아닙니다.
실제 사례: 병원 간 연합 학습
병원들은 스캔을 통합하지 않고도 공유 이미지 품질 모델을 훈련합니다. 공통 프로토콜은 장치 메타데이터, 라벨, 전처리, 클라이언트 자격, 로컬 epoch, 클리핑 및 보안 집계를 정의합니다. 각 병원은 환자 데이터를 보유하고 보호된 업데이트를 제출하며, 코디네이터는 로컬 보류 데이터셋을 사용해 각 라운드를 평가합니다. 결과는 사이트 수준 및 꼬리 성능을 보고하며, 단순히 볼륨 가중 평균만 제공하지 않습니다. 이는 작은 병원 및 장치 유형이 무시될 수 있기 때문입니다.
위협 모델은 악의적인 업데이트, 멤버십 유출, 손상된 클라이언트 및 코디네이터 접근을 포함합니다. 차등 프라이버시는 문서화된 예산과 테스트된 유용성으로 구성됩니다. 모델 및 작업 패키지는 서명되며, 병원은 철회를 할 수 있고 업데이트는 감사 가능합니다. 중독되거나 불안정한 라운드가 자동으로 배포된 모델을 교체하지는 않습니다. 프로젝트는 로컬 기준선과 임상 검토를 유지하며, 연합 아키텍처를 보다 넓은 동의, 보안 및 거버넌스 의무 내의 하나의 프라이버시 제어로 간주합니다.
구현 증거 및 운영 준비성
프로덕션 결정을 내리려면 성공적인 시연 이상의 것이 필요합니다. 대상 사용자, 운영 환경, 입력·출력, 의존성, 소유자 및 각 주요 실패의 결과를 정의하십시오. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 구축합니다. 일반적인 사례, 경계 조건, 잘못된 또는 누락된 입력, 분포 변화, 의존성 장애, 오용 및 소외될 가능성이 높은 그룹이나 환경을 테스트합니다. 작업 품질을 보정 또는 불확실성과 함께 측정하고, 지연 시간, 처리량, 자원 비용, 접근성, 프라이버시 및 보안을 측정합니다. 모든 변환 및 임계값을 기록하여 독립적인 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있게 합니다.
출시 전에 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 할당하십시오. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 의도적으로 주입된 실패를 통해 모니터링을 검증합니다. 운영 텔레메트리는 불필요한 민감 데이터를 수집하지 않으면서 입력 품질, 출력 동작, 모델 또는 규칙 버전, 의존성 상태, 인간 개입 및 확인된 결과를 보여줘야 합니다. 알림 임계값과 대응 담당자를 정의하고, 오프라인 성능이 지속될 것이라고 가정하지 말고 배포 후 실제 증거를 검토하십시오. 데이터 소스, 사용자, 모델, 벤더, 정책, 하드웨어 또는 목표가 변경될 때마다 재평가하십시오. 유지되는 시스템은 문서화된 복구, 사고 학습, 삭제 및 보관 절차와 함께 언제 비활성화하거나 교체해야 하는 명확한 시점이 필요합니다.
자주 묻는 질문
연합 학습이 개인 데이터가 유출되지 않음을 보장합니까?
아니오. 원시 데이터 이동을 줄이지만, 업데이트와 최종 모델이 여전히 정보를 드러낼 수 있습니다. 프라이버시를 보장하려면 위협 모델과 추가적인 기술·조직적 제어가 필요합니다.
중앙 집중형 훈련이 더 간단한 경우는 언제인가?
데이터를 법적으로 안전하게 중앙에 모을 수 있을 때, 중앙 집중형 훈련은 디버깅·재현·모니터링이 더 쉬운 경우가 많습니다. 연합 학습은 배포가 실제 요구사항일 때 정당화되며, 단순히 브랜드 목표를 위한 것이 아닙니다.












