사상 리더
인프라와 제품 팀을 연결하는 것: GenAI 플랫폼 구축에서 얻은 교훈

의심할 여지없이, 생성적 인공지능(이하 GenAI)은 최근 2년간 가장 인기 있는 주제였으며, 이제는 조직이 가장 중요한 일을 시작하고 GenAI 전략을 구현하는 때입니다. 자동화, 새로운 제품 디자인 생성, 콘텐츠 생성 등 다양한 도메인에서 목표를 달성하는 데 GenAI를 사용할 수 있습니다.
GenAI의 성공은 연구, 훈련, 추론 등의 작업에서 인프라와 서비스의 배포, 관찰 가능성, 비용 관리, 텔레메트리, 지연 시간 목표에 대한 긴밀한 조정이 필요합니다. 이러한 요소는 인공지능 작업에 대한 효율성을 높이고, 계산과 통신 간의 균형을 유지하며, GPU가 필요한 데이터를 항상 가지고 있도록 합니다.
그러나 인프라 엔지니어링과 소프트웨어 및 제품 팀 간에 구조적인 간격이 존재하는 경우가 많습니다. 인프라 엔지니어링은 컴퓨팅과 배포 스택에 중점을 두며, 소프트웨어와 제품 팀은 사용자에게 실제로 제공되는 애플리케이션을 구축하는 데 중점을 둡니다. 이러한 팀이 완전히 일치하지 않으면 배포 지연, 성능 문제, 사용성 문제가 발생할 수 있습니다.
이 간격은 실제로 어떻게 나타나며, 조직은 GenAI 성공을 위해 인프라와 제품 팀을 어떻게 조정할 수 있을까요?
미일치의 문제
인프라와 제품 팀이 미일치하면, 증상은 종종 명백하지만, 항상 kịp하게 해결되지 않는 경우가 있습니다. 미일치한 팀의 특징 중 하나는 지연 시간 기대 또는 모델 기능에 대한 가정의 불일치입니다. 예를 들어, 인프라 엔지니어링 팀은 실제 인프라 설계와 일치하지 않는 성능 수준을 가정하는 기능 또는 배포를 계획할 수 있습니다. 이는 늦은 단계의 재작업, 범위 변경 및 배포 지연으로 이어집니다.
미일치는 또한 비최적화된 인프라에 배포하여 발생하는 성능 저하로 인해 지연 시간 변동과 확장성 문제가 발생할 수 있습니다. 이는 훈련 또는 대규모 분산 추론 작업의 성능에 영향을 미칩니다. 또한 팀 미일치는 데이터 개인 정보 보호 및 규정 준수 요구 사항이 무시될 수 있으므로 다운스트림 보안 및 규정 준수 위험이 있습니다.
마지막으로, 팀 미일치는 제한이 명확하지 않은 경우 작업을 처리하는 데 사용하는 작업-around으로 인해 사용자 경험을 저하할 수 있습니다. 이는 반복 주기를 느리게 하고 기술 부채를 증가시킵니다. 물론, 제품과 인프라 팀 간의 미일치는 모든 소프트웨어 프로젝트에서 비용이 많이 드는 문제이지만, 특히 GenAI의 경우, 운영 비효율성, 경쟁 우위의 저하, 보안 위험 등이 더 높습니다.
성공으로 가는 다리
GenAI의 성공은 강력한 인프라를 갖는 것만이 아니라, 인프라와 제품 프로세스를 연결하는 전술적 프레임워크를 생성하는 것입니다. 예를 들어, 내부적으로 GPU 프로비저닝을 위한 셀프 서비스 API를 생각해 보십시오. 인프라 팀의 경우, 이러한 API는 접근을 표준화하고, 티켓 오버헤드를 줄이고, 규정 준수를 보장합니다. 제품 팀의 경우, 이러한 API는 계산에 대한 빠르고 예측 가능한 접근을 제공하여 큐에서 기다릴 필요가 없습니다. 결과적으로, 두 팀 모두 동일한 API “계약”에서 작업하여 병목 현상을 제거하고 기대를 명확히 합니다.
실시간 사용량 대시보드는 유사한 역할을 합니다. 이러한 대시보드는 인프라 엔지니어에게 시스템로드와 효율성을 표시하는 동시에 제품 팀에게 작업량이 실제로 소비되는 방식을 보여줍니다. 두 팀 모두 동일한 데이터를 볼 수 있으므로 성능 또는 병목 현상에 대한 논의가 더 협력적이고 적대적이지 않게 됩니다. 단일한 진실의 원천이 있습니다.
자동 스케일링은 또 다른 통일 메커니즘입니다. 자동 스케일링은 인프라 엔지니어에게 지속적인 소방을 면할 수 있게 하며, 제품 개발자가 작업량 피크 期間 동안 성능 상한을 맞지 않도록 합니다. 안정성과 민첩성 간의拔河戦이 공동 전략이 됩니다. 자동 스케일링은 운영 복원력과 제품 성능 목표와 일치하도록 관리됩니다.
마지막으로, 비용 통찰력은 공유된 관점에 금융적 차원을 추가합니다. 인프라 팀은 할당을 최적화하고 용량 계획을 정당화할 수 있으며, 제품 팀은 아키텍처 또는 모델 선택이 비용에 미치는 영향을 이해할 수 있습니다. 이러한 투명성은 공동 책임성을 촉진하며, 효율성을 숨겨진 문제가 아닌 집단적 책임으로 만듭니다.
그러나 일치는 공유 도구만으로는 불가능합니다. 또한 공유된 비전이 필요합니다. 여기서 공동 로드맵이 필요합니다. 각 팀은 전체적인 목표를 이해해야 하며, 이를 달성하기 위한 단계를 이해해야 합니다. 인프라의 경우, 이는 하드웨어와 소프트웨어의 기술적인 뿌리를 넘어 개발자와 최종 사용자가 실제로 시스템을 경험하는 방식을 이해하는 것을 의미합니다. 제품 팀의 경우, 이는 지연 시간, 비용, 모델 효율성 등과 같은 제약을 존중하는 것을 의미하며, 이러한 운영적 현실이 혁신을 지속 가능하게 만듭니다.
마지막으로, 모든 파트너십은 보안 및 규정 준수에 대한 상호적인 약속 없이는 지속될 수 없습니다. SOC2, HIPAA, ISO 또는 기타 프레임워크가 적용되든, 고객 기반 및 산업 垂直에 따라 특정 요구 사항이 다를 수 있지만, 책임은 공유됩니다. 인프라와 제품 팀 모두 이러한 의무를 내면화해야 하며, 규정 준수가 단순한 체크 박스 연습이 아니라 사용자와의 신뢰의 기초라는 것을 인식해야 합니다.
이러한 관행과 사고 방식을 결합하면 인프라와 제품이 일관된 단위로 결합되며, 공유 언어, 공유 가시성 및 공유 책임이 있습니다.
지식이 풍부한 팀
올바른 시스템을 갖는 것만큼 중요한 것은 올바른 사람을 갖는 것입니다. 이상적으로, 팀은 이미 GenAI를 알고 있는 구성원이나, 고성능 컴퓨팅 및 초대형 데이터 센터 배경을 가진 구성원으로 구성되어야 합니다. 실제로 중요한 것은 실용적인 경험과 GPU-as-a-Service 플랫폼을 구축하고 지원하면서 얻은 교훈입니다. 즉, GPU가 서로 어떻게 통신하는지,緊密하게 결합된 훈련이 어떻게 작동하는지, 지연 시간, 동기화 및 데이터 전달에 대한 민감성을 이해하는 것입니다.
모델이 계속 성장하고 배포가 확대되면서, 팀은 전체 고객 여정을 생각해 보아야 합니다. 이는 초기 연구 및 실험에서 시작하여 대규모 훈련, 미세 조정 및 최종 추론으로 이동합니다. 각 단계는 조금씩 다르며, 요구 사항은 변경됩니다. 모델 개발의 반복적인 특성은 지속적으로 GenAI 데이터 센터를 적합하게 유지하기 위해 필요한 인프라, 워크플로 및 기능을 가르쳐줍니다.
인프라와 제품 팀은 종종 자신의 버블 안에서 작동합니다. GenAI를 생산에 도입하려는 모든 회사에서 이는 변경되어야 합니다. 성공은 이러한 실로를 분해하고 플랫폼에 대한 공유 소유권을 생성하는 데 зависит합니다. 올바른 사람, 명확한 비전 및 실용적인 프레임워크가 있는 경우, 두 팀은 동일한 플레이북에서 일할 수 있습니다. 이는 더 빠르게 이동하고, 책임을 지키며, 궁극적으로 성공적인 GenAI 배포를 제공하는 플레이북입니다.












