인터뷰
스카이멜의 네투 파타크, 공동 창립자 및 CEO – 인터뷰 시리즈

네투 파타크, 스카이멜의 공동 창립자 및 CEO는 스카이멜의 혁신적인 뉴로스플릿 기술로 AI 추론을 혁신적으로 발전시키고 있습니다. CTO 수샨트 트리파티와 함께 스카이멜의 미션은 AI 애플리케이션의 성능을 향상시키고 계산 비용을 줄이는 것입니다.
뉴로스플릿은 적응형 추론 기술로 사용자 기기와 클라우드 서버 간에 AI 작업을 동적으로 분산합니다. 이 접근 방식은 사용자 기기의 유휴 컴퓨팅 자원을 활용하여 클라우드 인프라 비용을 최대 60% 절감하고, 추론 속도를 가속화하고, 데이터 개인 정보를 보장하며, 무제한 확장성을 제공합니다.
로컬 컴퓨팅 파워를 최적화하여 뉴로스플릿은 AI 애플리케이션이 효율적으로 실행될 수 있도록 하며, 비용을 낮추고 사용자 경험을 개선합니다.
스카이멜을 공동 창립하게 된 영감과 뉴로스플릿으로 해결하려고 했던 주요 도전은 무엇입니까?
스카이멜의 영감은 우리의 보완적인 경험의 합류에서 비롯되었습니다. 수샨트 트리파티는 구글에서 음성 기반 AI 모델을 수십억 개의 안드로이드 기기에 배포하는 동안 사용자 기기에大量의 유휴 컴퓨팅 파워가 있지만 대부분의 회사가 사용자 경험을 손상하지 않도록 이러한 자원을 효과적으로 활용하는 데 필요한 복잡한 엔지니어링 도전을 극복할 수 없다는 것을 발견했습니다.
한편, 저는 레디스에서 기업과 스타트업에서 일하면서 지연 시간이 비즈니스에서 얼마나 중요한지 깊이 이해했습니다. AI 애플리케이션이 더 普及되면서 데이터를 생성하는 곳에서 처리를 더 가까이 가져가야 한다는 것이 명백했습니다.
수샨트와 저는 미래가 로컬 또는 클라우드 처리를 선택하는 것이 아니라 각 추론 요청에 따라 로컬, 클라우드 또는 하이브리드 처리를 무제한으로 적응할 수 있는 지능형 기술을 만드는 것이라는 것을 깨달았습니다. 이러한 통찰력으로 스카이멜을 설립하고 뉴로스플릿을 개발하여 전통적인 인프라 제한을 극복했습니다.
뉴로스플릿이 사용자 개인 정보와 성능을 유지하면서 컴퓨팅 자원을 동적으로 최적화하는 방법을 설명해 주시겠습니까?
로컬 AI 추론의 주요 함정은 정적 컴퓨팅 요구 사항입니다. 전통적으로 AI 모델을 실행하는 데 동일한 컴퓨팅 자원이 필요하지만 기기의 하드웨어 기능, 네트워크 대역폭, 사용자 행동 등이 다르기 때문에 이 접근 방식은 현실을 무시합니다.
뉴로스플릿은 기기의 하드웨어 기능, 현재 자원 사용, 배터리 상태, 네트워크 조건 등 다양한 기기 텔레메트릭스를 지속적으로 모니터링합니다. 또한 사용자 행동 패턴을 고려하여 개발자가 설정한 주요 성능 지표를 최적화합니다.
데이터 개인 정보가 중요할 때 뉴로스플릿은 원시 데이터가 기기에서 벗어나지 않도록 하여 로컬에서 민감한 정보를 처리하고 최적의 성능을 유지합니다. AI 모델을 지능적으로 분할, 트림 또는 분리하여 기기 메모리 공간에 50~100개의 AI 스텁 모델을 담을 수 있습니다. 이는 사용자가 기존 정적 계산 접근 방식보다 더 많은 AI 파워드 애플리케이션을 동시에 실행할 수 있음을 의미합니다.
뉴로스플릿의 적응형 추론이 AI 회사에 미치는 주요 이점은 무엇이며, 특히 오래된 GPU 기술을 사용하는 회사에는 어떤 이점이 있습니까?
뉴로스플릿은 AI 회사에 세 가지 변혁적인 이점을 제공합니다. 첫째, 인프라 비용을 두 가지 메커니즘을 통해 크게 줄입니다. 회사는 더 저렴한 오래된 GPU를 효과적으로 사용할 수 있으며 클라우드 GPU에서 전체 및 스텁 모델을 함께 적합시키는 우리의 고유한 능력으로 인해 GPU 사용률이 크게 향상됩니다.
둘째, 초기 원시 데이터를 사용자 기기에서 처리하여 성능을 크게 향상시킵니다. 이는 클라우드로 전송되는 데이터가 크게 줄어들어 네트워크 지연 시간을 크게 줄이고 정확성을 유지합니다. 이 하이브리드 접근 방식은 회사가 로컬 처리의 속도와 클라우드 컴퓨팅의 강점을 모두 얻을 수 있도록 합니다.
셋째, 초기 데이터 처리를 사용자 기기에서 처리하여 회사가 사용자 개인 정보 보호를 유지하면서 성능을 손상하지 않도록 합니다. 이는 개인 정보 보호 규정이 더 엄격해지고 사용자가 개인 정보에 더 민감해짐에 따라 점점 더 중요해지는 문제입니다.
스카이멜의 솔루션이 AI 추론에 대한 비용을 절감하면서 모델 복잡성이나 정확성을 손상하지 않는 방법은 무엇입니까?
첫째, 개별 AI 모델을 분할하여 사용자 기기와 클라우드 간에 계산을 분산합니다. 첫 번째 부분은 사용자 기기의 기기에서 실행되어 총 계산의 5%에서 100%를 처리할 수 있습니다. 클라우드 GPU에서 처리해야 하는 계산이 줄어듭니다.
이 분할은 클라우드 GPU가 감소된 계산 부담을 처리하도록 허용하여 더 저렴한 GPU 인스턴스를 사용할 수 있습니다. 예를 들어, 원래 모델이 전체 A100 GPU를 요구하는 경우 분할 후에는 30~40%의 GPU 용량만 필요할 수 있습니다.
스카이멜의 하이브리드(로컬 + 클라우드) 접근 방식이 시장의 다른 AI 인프라 솔루션과 어떻게 다른가요?
AI 랜드스케이프는 흥미로운 변곡점에 있습니다. 애플, 삼성, 퀄컴은 생태계 기능을 통해 하이브리드 AI의 힘을展示하고 있지만, 이는 폐쇄된 정원입니다. 그러나 AI는 사용자가 사용하는 기기에 의해 제한되어서는 안 됩니다.
뉴로스플릿은 기본적으로 기기, 클라우드, 신경망에 대해 중립적입니다. 이는 개발자가 일관된 AI 경험을 제공할 수 있음을 의미합니다. 사용자가 아이폰, 안드로이드 기기 또는 랩톱을 사용하거나 AWS, Azure 또는 Google (GOOGL ) Cloud를 사용하는지에 관계없이 개발자는 단일 버전의 AI 애플리케이션을 구축할 수 있습니다.
스카이멜의 오케스트레이터 에이전트는 뉴로스플릿을 보완하여 자율적으로 최적화되는 AI 배포 시스템을 만듭니다.
오케스트레이터 에이전트는 뉴로스플릿을 어떻게 보완하며, AI 배포 전략을 변환하는 데 어떤 역할을 하나요?
오케스트레이터 에이전트(OA)와 뉴로스플릿은 함께 자율적으로 최적화되는 AI 배포 시스템을 생성합니다.
1. 개발자가 경계를 설정합니다:
- 제약: 허용된 모델, 버전, 클라우드 제공자, 영역, 규정 규칙
- 목표: 대상 지연, 비용 제한, 성능 요구 사항, 개인 정보 요구 사항
2. OA는 이러한 제약 내에서 목표를 달성하기 위해 작동합니다:
- 요청에 대한 모델/API를 결정합니다.
- 실제 성능에 따라 배포 전략을 적응시킵니다.
- 지정된 목표에 대해 최적화를 위해 거래를 합니다.
- 필요에 따라 즉시 다시 구성할 수 있습니다.
3. 뉴로스플릿은 OA의 결정을 실행합니다:
- 실시간 기기 텔레메트릭스를 사용하여 실행을 최적화합니다.
- 유익할 경우 기기와 클라우드 간에 처리를 분할합니다.
- 현재 조건에서 각 추론이 최적으로 실행되도록 합니다.
이것은 기본적으로 자율적으로 최적화되는 AI 시스템을 갖는 것과 같습니다.
오케스트레이터 에이전트는 산업 전반에 걸쳐 AI 배포를 다시 정의할 것입니다. 어떻게 생각하시나요?
오케스트레이터 에이전트는 세 가지 중요한 도전을 해결합니다.
첫째, 회사가 최신 AI 발전을 쉽게 따라갈 수 있도록 합니다. 오케스트레이터 에이전트를 사용하면最新의 모델과 기술을 즉시 활용할 수 있습니다. 이는 AI 혁신이 가속화하는 세계에서 중요한 경쟁 우위입니다.
둘째, 오케스트레이터 에이전트는 각 사용자 상호작용에 대해 AI 모델의 선택을 동적으로 최적화합니다. 이는 고객 서비스 AI가 기술 질문에 대한 전문 모델과 청구 문의에 대한 다른 모델을 사용하여 더 나은 결과를 제공할 수 있습니다.
셋째, 오케스트레이터 에이전트는 성능을 최대화하고 비용을 최소화합니다. 에이전트는 사용자 기기 또는 클라우드에서 AI를 실행하는 것이 가장 합리적인지에 따라 자동으로 균형을 조정합니다. 개인 정보가 중요할 때 데이터를 로컬에서 처리하고, 추가 컴퓨팅 파워가 필요할 때 클라우드를 활용합니다. 모든 것이 사용자에게 보이지 않게 진행됩니다.
현재 오케스트레이터 에이전트의 개인 베타 테스트에 참여하고 있는 회사로부터 받은 피드백은 어떻습니까?
개인 베타 테스트에 참여한 회사의 피드백은 매우 좋습니다. 회사는 더 이상 인프라에 묶여 있지 않으며, 전환할 때 몇 개월의 리워크를 피할 수 있다는 사실에 매우 기뻐합니다. 뉴로스플릿의 성능 결과는 놀라울 정도로 좋으며, 곧 공개할 예정입니다.
생성형 AI의 빠른 발전과 함께, AI 인프라의 다음 주요 장애물은 무엇이며, 스카이멜은 어떻게 해결할 계획입니까?
미래는 단일 지배적인 AI 모델이 아니라 수십억 개의 모델이 있을 것입니다. 가장 강력한 일반 AI 모델을 만들더라도, 각기 다른 맥락, 선호도 및 요구 사항에 맞춘 개인화된 버전이 필요할 것입니다. 이는 최소 80억 개의 모델을 의미합니다.
이것은 오늘날의 일괄 처리 접근 방식에서 벗어난 것입니다. 미래는 수십억 개의 모델을 처리할 수 있는 지능형 인프라를 필요로 합니다. 스카이멜은 오늘날의 배포 도전만 해결하는 것이 아니라, 다음에 무엇이 오는지에 대한 기술 로드맵을 이미 구축하고 있습니다.
다음 5년 동안 AI 인프라가 어떻게 발전할 것으로 생각하시나요? 스카이멜은 이 발전에서 어떤 역할을 할 것이라고 생각하시나요?
AI 인프라 랜드스케이프는 근본적인 변화를 겪을 것입니다. 오늘날의 초점은 클라우드에서 일반적인 대규모 언어 모델을 확장하는 데 있습니다. 그러나 다음 5년 동안 AI는 깊이 개인화되고 상황에 맞게 됩니다. 이것은 단순히 세부 튜닝이 아니라, 특정 사용자, 기기 및 상황에 실시간으로 적응하는 AI를 의미합니다.
이로 인해 두 가지 주요 인프라 도전이 발생합니다. 첫째, 중앙 집중식 데이터 센터에서 모든 것을 실행하는 전통적인 접근 방식은 기술적으로나 경제적으로 지속 가능하지 않습니다. 둘째, AI 애플리케이션의 복잡성으로 인해 다중 모델, 기기 및 컴퓨팅 위치 간에 동적으로 최적화할 수 있는 인프라가 필요합니다.
스카이멜은 이러한 도전에 직면하여 인프라를 구축하고 있습니다. 뉴로스플릿은 AI를 실행하는 가장 합리적인 곳에서 실행할 수 있습니다. 사용자 기기에서 데이터가 생성되는 경우, 클라우드에서 더 많은 컴퓨팅 파워가 필요한 경우, 또는 둘 다에 걸쳐 있습니다. 이러한 결정은 실시간으로 변경 조건과 요구 사항에 따라 조정됩니다.
향후 성공적인 AI 애플리케이션은 모델의 크기나 접근할 수 있는 컴퓨팅 능력으로 정의되지 않을 것입니다. 대신, 개인화된 사용자 경험을 제공하고 자원을 효율적으로 관리할 수 있는 능력으로 정의될 것입니다. 이러한 수준의 지능형 최적화를 모든 AI 애플리케이션에 제공하는 것이 우리의 목표입니다.
감사합니다. 더 많은 정보를 원하는 독자는 스카이멜을 방문하십시오.












