사상 리더
AI 추론 강화: 고급 기술 및 모범 사례

실시간 AI 구동 애플리케이션의 경우, 자율 주행 자동차나 의료 모니터링과 같은 경우, 입력을 처리하는 데 추가로 1초가 걸릴 수 있습니다. 실시간 AI 애플리케이션은 신뢰할 수 있는 GPU와 처리 능력이 필요하지만, 이는 많은 애플리케이션에서 매우 비용이 많이 들고 비용이 많이 들었습니다. 그러나 이제는 그렇지 않습니다.
추론 최적화 프로세스를 채택함으로써, 기업은 단순히 AI 효율성을 최대화할 수 있을 뿐만 아니라 에너지 소비와 운영 비용을 줄일 수 있습니다(최대 90%). 또한 개인 정보 보호와 보안을 강화할 수 있으며, 고객 만족도를 높일 수 있습니다.
일반적인 추론 문제
기업이 AI 효율성을 관리할 때 직면하는 가장 일반적인 문제 중 일부는 GPU 클러스터의 비활용, 일반-purpose 모델을 기본값으로 사용하는 것, 그리고 관련 비용에 대한 통찰력이 부족합니다.
팀은 피크 로드에 대한 GPU 클러스터를 프로비저닝하지만, 70~80%의 시간에는 워크플로우가 불균일하기 때문에 사용되지 않습니다.
또한, 팀은 더 작은 오픈 소스 모델로 실행할 수 있는 작업에도 불구하고, 일반-purpose 모델(GPT-4, Claude)을 기본값으로 사용합니다. 그 이유는 사용자 정의 모델을 구축하는 데 필요한 지식과陡峭한 학습 곡선 때문입니다.
마지막으로, 엔지니어는 각 요청에 대한 실제 비용에 대한 통찰력이 부족하여, 큰 금액의 비용을 지불하게 됩니다. PromptLayer, Helicone과 같은 도구를 사용하면 이러한 통찰력을 제공할 수 있습니다.
모델 선택, 배치, 사용에 대한 제어가 없으면 추론 비용이 지수적으로 증가할 수 있습니다(최대 10배). 또한 자원을浪費하고, 정확도를 낮추고, 사용자 경험을 손상시킬 수 있습니다.
에너지 소비 및 운영 비용
GPT-4, Llama 3 70B 또는 Mixtral-8x7B와 같은 더 큰 LLM을 실행하려면 훨씬 더 많은 전력이 필요합니다. 평균적으로, 데이터 센터에서 사용되는 에너지의 40~50%는 컴퓨팅 장비를 구동하는 데 사용되며, 추가로 30~40%는 장비를冷却하는 데 사용됩니다.
따라서, 대규모로 추론을 실행하는 기업의 경우, 클라우드 제공업체보다 전제 제공업체를 고려하는 것이 더 유리합니다.这样하면 프리미엄 비용을 지불하지 않아도 되며 에너지를 더 많이 소비하지 않습니다.
개인 정보 보호 및 보안
시스코의 2025 데이터 개인 정보 보호 벤치마크 연구에 따르면, “64%의 응답자가 민감한 정보를 공개적으로 또는 경쟁사와 공유하는 것을 우려하지만, 거의 절반이 개인 직원 또는 비공개 데이터를 GenAI 도구에 입력한다”는 것으로 나타났습니다. 이로 인해 데이터가 불법적으로 로깅되거나 캐싱되는 경우, 비준수 위험이 증가합니다. 또한, 다른 고객 조직에 걸쳐 공유 인프라에서 모델을 실행하는 경우, 데이터 침해와 성능 문제가 발생할 수 있으며, 한 사용자의 행동이 다른 사용자에게 영향을 미칠 수 있습니다. 따라서, 기업은 일반적으로 자신의 클라우드에 배포된 서비스를 선호합니다.
고객 만족도
응답 시간이 몇 초 이상 걸리면, 사용자가 일반적으로 사용을 중단합니다. 따라서, 엔지니어는 제로 레이턴시를 위해 최적화를 시도합니다. 또한, 응용 프로그램은 “환상과 부정확성과 같은 장애물이 있을 수 있으며, 광범위한 영향을 받거나 채택될 수 있습니다”는 것으로 나타났습니다. 가트너 프레스 릴리스에 따르면.
이러한 문제를 관리하는 비즈니스 이점
배치 및 모델 크기 최적화를 통해 추론 비용을 60~80%까지 줄일 수 있습니다. vLLM과 같은 도구를 사용하거나, 서버리스 지불 방식을 사용하여 비용을 줄일 수 있습니다.
Cleanlab의 경우, Cleanlab은 신뢰할 수 있는 언어 모델(TLM)을 런칭하여, LLM 응답에 신뢰도 점수를 추가했습니다. 이는 높은 품질의 출력과 향상된 신뢰성을 제공하기 위해 설계되었습니다. 이는 기업 애플리케이션에서 중요한데, 이는 제어되지 않은 환상을 방지하기 위해서입니다. Inferless 이전에, Cleanlab은 GPU 비용이 증가한 것을 경험했습니다. 이는 GPU가 사용되지 않을 때에도 실행되고 있기 때문입니다. 전통적인 클라우드 GPU 제공업체의 일반적인 문제였습니다. 높은 레이턴시, 비효율적인 비용 관리, 복잡한 관리 환경이었습니다. 서버리스 추론을 사용하면, 비용을 90%까지 줄일 수 있었으며, 성능 수준을 유지할 수 있었습니다. 더욱 중요한 것은, 2주 내에 추가적인 엔지니어링 오버헤드 비용 없이 서비스를 시작할 수 있었습니다.
모델 아키텍처 최적화
GPT와 Claude와 같은 기초 모델은 일반성에 대해 훈련되며, 효율성이나 특정 작업에 대해 훈련되지 않습니다. 특정 사용 사례에 대해 오픈 소스 모델을 사용자 정의하지 않으면, 메모리와 컴퓨팅 시간을浪費합니다.
새로운 GPU 칩인 H100은 빠르고 효율적입니다. 이러한 칩은 대규모 작업을 실행할 때 특히 중요합니다. CUDA 코어가 더 많으면 처리 속도가 증가하며, 더 작은 GPU를 능가합니다. NVIDIA의 텐서 코어는 이러한 작업을 가속화하기 위해 설계되었습니다.
GPU 메모리도 모델 아키텍처를 최적화하는 데 중요합니다. 큰 AI 모델은大量의 메모리가 필요합니다. 이러한 추가 메모리는 GPU가 더 큰 모델을 실행할 수 있게 하며, 속도를 저하하지 않습니다. 반대로, VRAM이 적은 더 작은 GPU의 성능은 저하됩니다. 이는 데이터를 더 느린 시스템 RAM으로 이동하기 때문입니다.
모델 아키텍처를 최적화하는 데에는 여러 가지 이점이 있습니다. 첫째, 밀도 변환기를 LoRA-최적화 또는 FlashAttention 기반 변형으로 바꾸면, 응답 시간을 200~400 밀리초까지 줄일 수 있습니다. 이는 채팅봇이나 게임과 같은 경우에 중요합니다. 또한, 정량화된 모델(4비트 또는 8비트)은 더 적은 VRAM을 필요로 하며, 더 저렴한 GPU에서 더 빠르게 실행됩니다.
장기적으로, 모델 아키텍처를 최적화하면 추론 비용을 절약할 수 있습니다. 최적화된 모델은 더 작은 칩에서 실행할 수 있기 때문입니다.
모델 아키텍처를 최적화하는 과정에는 다음 단계가 포함됩니다.
- 양자화 — 정밀도를 줄임(FP32 → INT4/INT8), 메모리를 절약하고 컴퓨팅 시간을 가속화
- 프루닝 — 덜 유용한 가중치 또는 레이어를 제거(구조화 또는 비구조화)
- 蒸留 — 더 작은 “학생” 모델을 훈련하여 더 큰 모델의 출력을 모방
모델 크기 압축
더 작은 모델은 더 빠른 추론과 더 저렴한 인프라를 의미합니다. 큰 모델(13B+, 70B+)은 비싼 GPU(A100s, H100s), 높은 VRAM, 그리고 더 많은 전력이 필요합니다. 모델을 압축하면 더 저렴한 하드웨어에서 실행할 수 있습니다. 예를 들어, A10s 또는 T4s와 같은 하드웨어에서 레이턴시를 크게 줄일 수 있습니다.
압축된 모델은 또한 장치(전화, 브라우저, IoT)에서 추론을 실행하는 데 중요합니다. 더 작은 모델은 더 많은 동시 요청을 서비스할 수 있게 하며, 인프라를 확장할 필요가 없습니다. 1,000명 이상의 사용자가 있는 채팅봇의 경우, 13B에서 7B로 압축된 모델로 전환하면, GPU당 사용자 수를 두 배 이상 늘릴 수 있습니다.
전문 하드웨어 활용
일반-purpose CPU는 텐서 연산을 위해 설계되지 않았습니다. NVIDIA A100s, H100s, Google TPUs 또는 AWS Inferentia와 같은 전문 하드웨어는 LLM에 대해 더 빠른 추론(10~100배)을 제공하며, 에너지 효율성이 더 좋습니다. 요청당 100 밀리초를 절약하는 것은 일일 수백만 요청을 처리할 때 큰 차이를 만들 수 있습니다.
가상 예를 고려해 보십시오.
팀은 내부 RAG 시스템에 대해 LLaMA-13B를 표준 A10 GPU에서 실행하고 있습니다. 레이턴시는 약 1.9초이며, VRAM 제한으로 인해 배치 크기를 많이 늘릴 수 없습니다. 그래서 H100s로 전환하고, TensorRT-LLM을 활성화하고, 최적화된 주의를 사용하여 배치 크기를 8에서 64로 늘립니다. 결과는 레이턴시를 400 밀리초로 줄이고, 처리량을 5배 증가시킵니다.
이로 인해 동일한 예산으로 5배 더 많은 요청을 서비스할 수 있으며, 엔지니어를 인프라 병목 현상에서 해방시킬 수 있습니다.
배포 옵션 평가
다른 프로세스에는 다른 인프라가 필요합니다. 10명의 사용자를 가진 채팅봇과 일일 1백만 건의 쿼리를 처리하는 검색 엔진은 다른 요구 사항을 가지고 있습니다. 클라우드(AWS Sagemaker) 또는 DIY GPU 서버에 대한 비용-성능 비율을 평가하지 않고 모든 것을 투자하는 것은 낭비된 비용과 나쁨 사용자 경험으로 이어질 수 있습니다. 그러나 초기에 평가하여 지불 방식을 선택하면, 나중에 옵션이 제공됩니다.
평가는 다음 단계를 포함합니다.
- 모델 레이턴시와 비용을 플랫폼별로 벤치마크합니다. AWS, Azure, 로컬 GPU 클러스터 또는 서버리스 도구에서 A/B 테스트를 실행하여 복제합니다.
- 콜드 스타트 성능을 측정합니다. 이는 서버리스 또는 이벤트 주도 워크로드의 경우 특히 중요합니다. 모델이 더 빠르게 로드되기 때문입니다.
- 관찰 가능성과 확장성 한계를 평가합니다. 사용 가능한 메트릭을 평가하고, 쿼리당 초당 최대 쿼리 수를 확인합니다.
- 준수 지원을 확인합니다. 지리적 데이터 규칙 또는 감사 로그를 적용할 수 있는지 확인합니다.
- 총 소유 비용을 추정합니다. 이는 GPU 시간, 저장소, 대역폭 및 팀 오버헤드가 포함됩니다.
결론
추론은 비즈니스로 하여금 AI 성능을 최적화하고, 에너지 사용과 비용을 줄이고, 개인 정보 보호와 보안을 유지하며, 고객을 행복하게 하는 것을 가능하게 합니다.












