인터뷰

Bing Xu, INT21 설립자 겸 CEO – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Bing Xu, INT21 설립자 겸 CEO는 GPU 최적화, 머신러닝 시스템, 자율 AI 에이전트를 아우르는 깊은 경험을 가진 AI 인프라 엔지니어이자 기업가이다. 2026년에 INT21을 설립하기 전, Xu는 NVIDIA에서 Distinguished Engineer로 근무하며 에이전트 기반 소프트웨어 개발에 참여하고 VibeTensor와 AVO 등 여러 세대의 코딩 에이전트를 만들었다. 그는 자신이 설립하고 CEO를 역임한 GPU 추론 스타트업 HippoML이 NVIDIA에 인수된 뒤 NVIDIA에 합류했다. 이전에는 Meta에서 Senior Staff Software Engineer로 재직하며 AITemplate을 만들고 프로덕션 워크로드 전반에 걸친 GPU 추론 효율성을 향상시켰으며, OctoML, Facebook AI, Apple, Turi 등에서 엔지니어링 및 연구 역할을 수행했다. 그의 경력은 현대 AI 시스템의 소프트웨어와 인프라를 지속적으로 개선하는 데 초점을 맞추어 왔다.

INT21은 자율 에이전트 군집을 활용해 AI 워크로드를 구동하는 소프트웨어를 지속적으로 개발, 테스트, 벤치마크 및 최적화하도록 설계된 자체 개선 AI 인프라를 구축하고 있다. 현재 집중하고 있는 분야는 Inference Engine Factory이며, 이는 특화된 에이전트들이 병렬로 최적화 전략을 탐색하고 CUDA와 PTX 커널, 드라이버, 서빙 인프라를 아우르는 완전한 추론 엔진을 구축하도록 한다. 성능은 대상 하드웨어에서 직접 검증된다. 회사 기술은 SwarmOS 위에 구축되었으며, 이는 클라우드 네이티브 플랫폼으로 다수의 에이전트가 측정 가능한 엔지니어링 목표를 중심으로 협업하고 세대 간 증거와 교훈을 유지한다. INT21은 처음에 PTX Kernel Factory를 통해 이 접근 방식을 시연했으며, NVIDIA Hopper와 Blackwell 하드웨어 전반에 걸쳐 GPU 커널을 생성하고 벤치마크했다. 이후 회사는 컴퓨팅 자원을 완전한 추론 엔진 최적화로 전환했다.

INT21을 설립하게 된 계기는 전문 인프라 엔지니어를 빠르게 채용해 AI 시스템을 구축·최적화하는 것이 지속적으로 어려웠기 때문이라고 들었습니다. 왜 단순히 더 나은 개발자 도구가 아니라, 이러한 작업을 스스로 수행할 수 있는 자율적이고 자체 개선되는 에이전트 군집이 해답이라고 확신하게 되었나요?

AI 인프라 분야의 인재 수요가 다양한 전문 분야에 걸쳐 공급을 훨씬 초과한다는 것은 잘 알려진 문제이며, 저 역시 직접 겪은 어려움이다. 그래서 나는 자체 개선 에이전트 군집을 하나의 옵션으로 고민하게 되었다. 지난 몇 년간 자체 개선 AI 솔루션을 연구해 왔으며, 기술이 이제는 매우 빠른 속도로 발전해 이러한 시스템이 인프라를 스스로 구축·운영·최적화할 만큼 충분히 성숙했다.

INT21의 핵심 철학은 인간과 마찬가지로 에이전트도 축적된 지식을 통해 점점 똑똑해진다는 것이다. 이는 기존 개발자 도구가 여전히 사람이 일할 수 있는 시간과 물리적으로 해결할 수 있는 문제에 제한되는 것과 근본적으로 다르다. 자체 개선 에이전트 군집을 활용하면 매 생산 사이클마다 더 빠르고, 더 정확하며, 더 효율적으로 작업할 수 있다. 우리 에이전트는 기존 프레임워크에 구속받지 않으며, 각 워크로드에 맞춰 처음부터 솔루션을 직접 구축할 수 있다.

INT21 이전에 HippoML을 설립했으며, 출시 14개월 만에 NVIDIA에 인수되었고 이후 NVIDIA에서 Distinguished Engineer로 근무했습니다. 이러한 경험을 통해 AI 인프라의 병목 현상이 무엇인지, 그리고 그것이 결국 INT21의 아키텍처와 사명에 어떻게 영향을 미쳤는지 무엇을 배웠나요?

HippoML에서는 고성능 생성 AI 추론에 특화하여 대규모 언어 모델을 더 빠르고 효율적으로 실행할 수 있는 소프트웨어 최적화 도구를 구축했다. 우리는 동유럽 등지의 유능한 계약자에 의존하지 않고는 규모를 확장할 수 없다는 것을 깨달았다. 이는 AI 추론 최적화 수요를 따라잡기 위해서였다.

NVIDIA에 인수된 뒤, 나는 회사 내부에서 에이전트 기반 개발 방식을 구축하기 시작했다. 우리는 연구를 발표하여 하네스(모델 주변의 인프라 레이어)가 실제로 에이전트 성능을 결정한다는 것을 증명했다. 이는 모델 자체를 찾는 것이 AI 인프라의 진정한 병목이 아니라, 이를 실행하는 시스템을 최적화하는 것이 핵심이라는 증거였다.

모델이 개선되면 그 주변 인프라도 그에 맞게 확장되어야 한다. 그러나 인간이 주도하는 최적화 사이클은 속도를 따라가지 못한다. 하나의 모델 아키텍처에 대한 학습 루프를 최적화하고 배포한 뒤, 모델 아키텍처가 바뀌거나 새로운 GPU 세대가 등장하면 다시 시작해야 한다. 현재는 매주 새로운 모델 업데이트가 등장하는 상황에서 이러한 기존 방식은 지속 가능하지 않다. 이 깨달음이 자체 개선 인프라가 다음 돌파구라는 확신을 주었고, 결국 INT21을 설립하게 되었다.

INT21은 자신들의 접근 방식을 “자체 개선 인프라”라고 설명합니다. 이는 연구자들이 기본 AI 모델 자체를 더 강력하게 만들려는 재귀적 자체 개선과는 크게 다릅니다. 귀하의 접근 방식은 어떻게 작동하며, 기존 모델 주변 시스템을 개선하는 것이 왜 더 빠르게 의미 있는 성과를 낼 수 있다고 보시는지 설명해 주세요.

재귀적 자체 개선 접근 방식은 독점 모델을 학습하고, 연구팀을 구성하며, 막대한 자본을 조달하는 데 초점을 맞춘다. 이는 모델이 자체 학습 과정을 스스로 이해하도록 요구하기 때문에 수년이 걸리고 비용도 천문학적이다.

우리의 접근 방식은 다르다. INT21에서는 최첨단 모델 자체를 개선하려는 것이 아니라, 모델과 성능 사이에 위치한 인프라 레이어인 하네스를 최적화하는 에이전트 군집을 구축한다. 이는 Nvidia에서 내가 수행한 연구가 증명했듯이, 하네스가 복잡한 작업에서 에이전트 성능을 결정한다는 의미다. 에이전트는 최첨단 모델의 기능을 이해할 필요 없이 10% 효율성 향상을 찾을 수 있다. 설계 공간을 탐색하고, 측정하고, 검증하며, 효과적인 방안을 유지하면 된다.

두 접근 방식을 비유하자면, 하나는 발전소를 건설하는 것이고 다른 하나는 이미 존재하는 전기를 활용해 건설하는 것이다. 우리는 더 빠르게 움직이며 실제적이고 즉각적인 수요를 해결할 수 있다. 그리고 오늘날 자체 개선 인프라에서 이미 의미 있는, 측정 가능한 성과를 보고 있다.

INT21은 최근 Inference Engine Factory를 출시했으며, 이는 개별 GPU 커널을 넘어 완전한 추론 엔진까지 개념을 확장한다. 에이전트 군집이 자율적으로 추론 엔진을 구축·최적화한다는 것이 실제로 무엇을 의미하며, 전통적으로 가장 많은 전문 인력이 필요했던 과정은 어떤 부분인가요?

추론 엔진은 모델을 하드웨어에서 실행시키는 소프트웨어이다. 이는 한 번에 수십 가지 설계 결정을 내려야 하는 복잡한 시스템으로, 예를 들어 어떤 연산을 단일 커널에 함께 실행할지, 코어 간 작업 스케줄을 어떻게 할지 등을 결정한다. 이러한 결정들은 서로 얽혀 있어 하나를 바꾸면 다른 모든 것을 다시 테스트해야 한다.

전통적으로 엔지니어가 각 모델마다 모든 것을 손수 튜닝한다. 비디오, 음악, 음성 생성은 다단계·다규모 아키텍처이며, 기존 프레임워크가 없어 도전적이다. INT21의 에이전트 군집은 개별 커널부터 전체 추론 엔진까지 전체 스택을 엔드 투 엔드로 구축한다. 우리의 비디오 및 오디오 생성 스택은 인간의 코드 리뷰 없이도 동일한 동시성 설정에서 최첨단 추론 솔루션을 능가한다.

귀하의 PTX Kernel Factory는 특정 워크로드에서 기존 베이스라인보다 최대 59% 뛰어난 구현을 만들어냈습니다. 기술적인 수준에서, 인간이 최적화한 구현이나 기존 컴파일러가 놓치는 성능 향상을 에이전트들은 어디서 찾고 있나요?

우리 PTX Kernel Factory는 KDA(Kimi Linear Attention) 대비 최대 59%까지 최고의 베이스라인을 능가했다. 이는 자체 개선 에이전트 군집이 수천 가지 변형을 짧은 시간 안에 탐색할 수 있기 때문이며, 이는 인간 엔지니어가 수행하기엔 너무 힘들고 비용이 많이 든다.

차이점은 인간이 작성한 커널은 GPU용으로 사전 구축된 도메인 특화 언어(DSL), 템플릿, 컴파일러에 의존한다는 것이다. DSL은 일반적인 패턴에 잘 맞지만, KDA와 같은 새로운 워크로드가 등장하면 범용 컴파일러가 최적화를 수행하지 못한다. 우리 에이전트는 이러한 추상화를 완전히 우회하므로 DSL이나 컴파일러의 가정에 제한받지 않는다. 사전에 정의된 패턴에 얽매이지 않고 전체 설계 공간을 자유롭게 탐색할 수 있는 것이 성능 향상의 원천이다.

AI가 생성한 인프라는 특이한 검증 문제를 만든다: 최적화가 더 빠르지만 미묘하게 잘못된 경우가 있다. 에이전트 군집은 어떻게 테스트하고, 벤치마크하고, 실패를 거부하며, 성공적인 발견을 보존하는가? 그리고 이러한 피드백 루프가 시스템을 단순한 AI 코딩 에이전트가 아니라 진정한 자체 개선 시스템으로 만드는 데 얼마나 중요한가?

피드백 루프는 핵심이다. 최적화가 특정 가정 하에서만 올바르거나 특정 입력 분포에만 적용된다면 무가치하기 때문이다. INT21에서는 피드백 루프가 철저히 검증된다.

우리는 모델, 배포 제약 조건 및 중요한 서비스 지표에서 시작한다. 그런 다음 자체 개선 에이전트 군집이 동시에 구성 및 최적화 경로를 탐색하고, 모든 후보를 정확성 및 성능 목표에 대해 평가한다. 작동하는 구현만 보존된다.

진정으로 자체 개선이 되는 이유는 검증 데이터 자체가 개선되기 때문이다. 그 데이터가 에이전트 군집에 다시 피드백되어 무엇이 효과적인지 이해를 정교화하고 피드백 루프를 지속적으로 닫는다. 이러한 엄격함이 없으면 겉보기에 그럴듯한 AI 생성 코드가 더 빠르게 배포될 수 있지만, 눈에 보이지 않는 기술 부채가 누적되어 구축된 시스템에 대한 신뢰를 약화시킨다.

NVIDIA에서 VibeTensor와 Agentic Variation Operators와 같은 프로젝트에 참여했으며, 에이전트가 대규모 시스템 소프트웨어를 생성하고 GPU 최적화를 자율적으로 탐색했다. 이러한 프로젝트를 통해 AI 에이전트가 이미 해결할 수 있는 엔지니어링 문제 유형은 무엇이며, 많은 개발자가 여전히 인간 전문가가 필요하다고 생각하는 이유는 무엇인가요?

VibeTensor는 내가 ‘프랑켄슈타인 효과’라고 부르는 현상을 보여주었다. AI는 모든 수준에서 올바른 작업을 수행했지만, 그 조각들을 시스템으로 결합했을 때 인간 전문가가 만들 수 있는 수준에 미치지 못했다.

Agentic Variation Operators 작업은 반대였다. AI가 좁은 범위의 문제에서 인간 전문가를 능가할 수 있음을 보여주었다. 커널 생성이 좋은 예인데, 문제 자체가 좁고 측정 가능하며 단일 목표를 가진다.

‘프랑켄슈타인 효과’는 바로 INT21이 해결하고자 하는 문제다. 우리 Inference Engine Factory의 엔지니어링 샘플은 SGLang 및 vLLM과 같은 고성능 오픈소스 추론 엔진을 능가한다. 이는 문제를 올바르게 구조화했기 때문이다. 우리는 에이전트에게 명확한 제약, 측정 가능한 목표, 그리고 긴밀한 피드백 루프를 제공한다. 인간 전문가도 여전히 필수적이지만, 최적화 작업을 수행하기보다 방향을 제시하고 결과를 해석한다. AI는 인간 전문가의 영향을 가속화하고 체계적으로 실행함으로써 그 효과를 증폭한다.

INT21은 단일 에이전트가 점점 큰 컨텍스트 윈도우를 갖는 대신 다수의 특화된 에이전트를 사용한다. 왜 다중 에이전트 오케스트레이션이 복잡한 엔지니어링 문제에 더 확장 가능하다고 보며, 에이전트들은 어떻게 작업을 분담하고, 발견을 공유하며, 서로 중복되거나 충돌하지 않도록 하는가?

더 큰 컨텍스트 윈도우는 한 번에 더 많은 정보를 보유할 수 있게 하지만, 모든 것이 서로 얽힌 다차원 문제를 해결하는 데는 도움이 되지 않는다. 우리는 클라우드 네이티브 플랫폼을 사용해 특화된 에이전트들을 실행하고, 모두가 동일한 측정 가능한 목표를 향해 작업한다. 에이전트들은 병렬로 탐색하고 지속적으로 더 강력한 솔루션으로 수렴한다.

이 접근 방식이 확장 가능한 이유는 여러 가지다. 첫째, 각 에이전트가 집중한다. 둘째, 단일 에이전트가 모든 것을 한 번에 고민하도록 요구하지 않으므로 프로세스가 더 효율적이다. 마지막으로, 이는 인프라 팀이 실제로 작업하는 방식과 유사하다. 각 팀이 자신의 도메인을 담당하고, 서로 영향을 주는 결정이 있을 때 동기화한다.

에이전트 군집이 커널, 추론 엔진, 컴파일러 및 AI 스택의 다른 레이어를 지속적으로 최적화할 수 있게 된다면, 인프라 엔지니어의 역할은 어떻게 변할까? 이러한 시스템이 전문 엔지니어 부족을 해소하는 것이 목표인가, 아니면 궁극적으로 인프라 개발의 상당 부분을 자동화하는 방향으로 나아갈 것이라고 보는가?

인프라 엔지니어의 업무는 완전히 변화할 것이다. 이제는 커널 코드와 메모리 튜닝을 직접 수행하지 않는다. 대신 목표를 설정하고, 설계 공간을 정의하며, 제약을 설정하고, 결과를 해석한다.

시간이 지나면서 시스템을 운영·개선하는 데 필요한 인프라 엔지니어 수는 감소한다. 그러나 남는 전략적 업무는 오히려 더 가치 있게 된다. 실질적으로 조직은 오늘날보다 훨씬 적은 수의 전문 엔지니어로 복잡한 AI 인프라를 운영할 수 있게 된다. 이는 생산 AI 시스템을 구축하려는 모든 기업에 중요한 의미를 가진다.

귀하의 장기 비전은 자체 개선 에이전트 군집이 AI 인프라의 모든 레이어에서 작동하는 것이다. 이 비전이 실현된다면 그 스택은 어떻게 보일 것이며, 모델, 워크로드, 하드웨어가 변할 때 AI 인프라가 스스로 재작성·최적화되는 시점에 도달할 수 있을까?

현재 AI 스택의 각 레이어는 독립적으로 최적화된다. 저수준 커널부터 기본 프레임워크, 인터페이스까지 모두가 서로 조율되지 않는다. 따라서 한 레이어를 최적화하면 하위 레이어에서 의도치 않게 문제가 발생할 수 있다.

INT21의 비전은 에이전트 군집이 모든 레이어를 자율적으로 조율해 지속적으로 조정·적응한다는 것이다. 새로운 모델이 등장하면 전체 스택이 이를 위해 재최적화되어 인프라가 실행 중인 모델에 뒤처지지 않게 된다.

이는 인간 엔지니어가 충분히 빠르게 움직일 수 없었기 때문에 실현되지 못했다. 그러나 에이전트 군집이 지속적으로 최적화함에 따라 자체 개선 인프라가 별개의 컴퓨팅 카테고리로 떠오르고 있다. 모델과 하드웨어가 변화하는 속도만큼 인프라가 적응할 수 있다면 그 인프라가 승리한다. 그 외 모든 것은 위험 요소가 된다.

훌륭한 인터뷰에 감사드립니다. 더 알고 싶으신 독자분들은 INT21을 방문하시기 바랍니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.