인터뷰
스노클 AI의 Алекс 래트너(Alex Ratner) CEO & 공동 창립자 – 인터뷰 시리즈

알렉스 래트너는 스탠퍼드 AI 연구소에서 탄생한 스노클 AI의 CEO이자 공동 창립자입니다.
스노클 AI 는 수동 AI 개발 프로세스를 프로그래매틱 솔루션으로 변환하여 AI 개발을 빠르고 실제로 만듭니다.스노클 AI를 사용하면 기업이 고유한 워크로드에 대한 AI를 개발할 수 있으며, 자체 데이터와 지식을 사용하여 10~100배 빠르게 개발할 수 있습니다.
컴퓨터 과학에 처음 관심을 가지게 된 계기는 무엇인가요?
컴퓨터 과학에는 두 가지 흥미로운 측면이 있습니다. 하나는 빠르게 배우고 건설할 수 있으며, 즉각적인 피드백을 받을 수 있기 때문에 선생님이 기다릴 필요가 없습니다. 두 번째는 허가 없이 많은 것을 건설할 수 있습니다!
저는 이러한 이유로 어렸을 때 프로그래밍에 관심을 가지게 되었습니다. 또한 정밀성을 yêu cầu하는 것을 좋아했습니다. 복잡한 프로세스와 루틴을 추상화하고 모듈화하여 인코딩하는 과정을 즐겼습니다.
나중에 성인으로서, 저는 스탠퍼드에서 전문적으로 컴퓨터 과학을 공부하기 위해 돌아왔습니다. 그곳에서 저는 특허 문서의 기본 분석을 위해 스크립트를 작성하는 일을 맡았습니다. 인간이 발명한 모든 지식은 쉽게 접근할 수 있지만, 복잡한 기술 문서와 다중 모드 데이터를 분석하기가 매우 어려웠기 때문에 접근성이 떨어졌습니다.
이것이 저를 다시 컴퓨터 과학의 세계로 끌어들이게 된 계기였습니다. 특히 자연어 처리(NLP) 분야에 관심을 가지게 되었습니다.
스탠퍼드에서 스노클 오픈소스 프로젝트를 시작하고 리드한 경험에 대해 이야기해 주시겠습니까?
당시 우리는 산업계의 많은 사람들과 마찬가지로 새로운 알고리즘 개발에 집중했습니다. 그러나 우리는 항상 실제 문제에 기반한 접근 방식을 취하려고 노력했습니다. 주로 스탠퍼드의 의사와 과학자들과 함께 일했습니다. 그러나 새로운 모델이나 알고리즘을 제시할 때마다, 반응은 “그것은 좋지만, 레이블이 붙은 훈련 데이터가 필요합니다. 그런데 우리는 레이블을 붙일 시간이 없습니다!”라는 것이었습니다.
레이블링과 훈련 데이터의 큐레이션 과정이 큰 문제라는 것을 깨달았습니다. 그래서 우리는 모든 에너지를 이 문제에 집중하기로 결정했습니다. 이것이 스노클 프로젝트와 “데이터 중심 AI”라는 개념이 시작된 것입니다.
스노클의 데이터 중심 AI 접근 방식은 무엇이며, 모델 중심 AI 개발과 어떻게 다른가요?
데이터 중심 AI는 더 좋은 데이터를 구축하여 더 좋은 모델을 구축하는 것을 의미합니다.
이것은 모델 중심 AI와는 대조적이지만, 함께 작동합니다. 모델 중심 AI에서 데이터 과학자 또는 연구자들은 데이터가 정적이라고 가정하고 모델 아키텍처와 매개변수를 조정하여 더好的 결과를 얻으려고 노력합니다.
연구자들은 여전히 모델 중심 AI에서 훌륭한 작업을 하지만, 오프-the-쉘프 모델과 자동 ML 기술이 इतन나 개선되어서 모델 선택이 생산 시간에 Commoditize되었습니다. 이 경우, 모델을 개선하는 가장好的 방법은 더 많은 데이터를 제공하는 것입니다.
데이터 중심 AI 접근 방식의 핵심 원리는 무엇인가요?
데이터 중심 AI의 핵심 원리는 간단합니다: 더好的 데이터는 더好的 모델을 구축합니다.
우리의 학술 연구에서, 우리는 이것을 “데이터 프로그래밍”이라고 불렀습니다. 아이디어는 충분히 강력한 모델에 입력과 출력의 예를 많이 제공하면, 모델은 이러한 패턴을 복제하는 법을 배울 수 있습니다.
그러나 이것은 예상보다 더 큰 도전을 제기합니다. 대부분의 데이터에는 레이블이 없거나, 적어도 유용한 레이블이 없습니다. 데이터를 수동으로 레이블링하는 것은 단조롭고, 시간이 많이 걸리며, 인간의 노력이 필요합니다.
레이블이 붙은 데이터 세트를 가지고 있는 것도 품질을 보장하지는 않습니다. 인간의 오류는 모든 곳에서 발생할 수 있습니다. 모델의 성능을 저하시키는 잘못된 레이블링된 레코드가 있습니다. 매개변수 조정을 통해 이러한 현실을 숨길 수 없습니다. 연구자들은 오픈 소스 데이터 세트에서 잘못 레이블링된 레코드를 발견했습니다.
데이터 중심 AI가 프로그래매틱이라는 것은 무엇을 의미하나요?
데이터를 수동으로 레이블링하는 것은 심각한 도전을 제기합니다. 이것은 많은 인간의 시간을 필요로 하며, 때때로 이러한 시간은 비용이 많이 듭니다. 의료 문서의 경우, 의사만이 레이블링할 수 있습니다.
수동 레이블링은 또한 일회용 프로젝트가 될 수 있습니다. 레이블러는 데이터를 레이블링하지만, 비즈니스의 필요가 변경되면, 레이블러는 다시 시작해야 합니다.
프로그래매틱한 데이터 중심 AI 접근 방식은 이러한 문제를 최소화합니다. 스노클 AI의 프로그래매틱 레이블링 시스템은 다양한 신호를 통합하여 확률적 레이블을 개발합니다. 주로 주제 전문가와 데이터 과학자가 협력하여 레이블링 함수를 구축합니다. 이러한 함수는 전문 지식을 규칙으로 인코딩하여 많은 데이터 포인트에 영향을 미칩니다.
이 프레임워크는 유연합니다. 비즈니스의 필요가 변경되면, 사용자는 레이블링 함수를 추가, 제거, 조정하여 새로운 레이블을 적용할 수 있습니다.
이 데이터 중심 접근 방식은 레이블이 없는 데이터를 빠르게 확장하는 것을 어떻게 가능하게 하나요?
프로그래매틱한 데이터 중심 AI 접근 방식은 레이블이 없는 데이터를 빠르게 확장하는 것을 가능하게 합니다. 주제 전문가와 데이터 과학자가 협력하여 레이블링 함수를 정의하고, 모델을 훈련하고, 레이블링 함수의 영향을 분석하여 모델의 성능을 개선할 수 있습니다.
이러한 사이클은 모델의 성능을 개선하여 프로젝트의 목표를 달성할 수 있습니다. 이것은 수동 레이블링에 필요한 몇 개월의 시간을 몇 시간으로 줄일 수 있습니다. 스노클 연구 프로젝트에서, 두 명의 연구자는 단 하루에 20,000개의 문서를 레이블링했습니다. 이것은 수동 레이블러가 10주 이상 걸릴 수 있는 작업입니다.
스노클은 스노클 플로우, 스노클 젠글로우, 스노클 파운드리와 같은 여러 AI 솔루션을 제공합니다. 이러한 솔루션의 차이점은 무엇인가요?
스노클 AI는 사용자에게 레이블링 함수를 생성하여 수동으로 레이블링하는 것보다 몇 분 안에 수백만 개의 데이터 포인트를 레이블링할 수 있습니다.
스노클 AI는 기업이 자체 데이터를 생산 준비된 모델로 변환하여 가치를 추출하기 시작하는 데 필요한 시간을 압축합니다. 스노클 AI는 기업이 인간 중심 접근 방식을 확장하여 인간의 판단과 전문 지식을 효율적으로 통합할 수 있습니다.
스노클 AI는 투명하고 설명 가능한 AI를 제공하여 기업이 편견을 관리하고 책임 있는 결과를 도출할 수 있습니다.
스노클 AI는 포춘 500 기업이 다음을 수행할 수 있게 합니다:
- 모델을 훈련하거나 RAG를 향상시키기 위한 고품질 레이블이 된 데이터를 개발합니다.
- LLM을 미세 조정합니다.
- 작고 저렴한 운영 비용의 전문 모델로 LLM을 증류합니다.
- 사전 훈련을 통해 도메인 및 작업별 LLM을 구축합니다.
당신이 쓴 논문 중에서 가장 중요한 논문은 무엇이라고 생각하나요?
중요한 논문 중 하나는 “데이터 프로그래밍”에 관한 것입니다.
스노클의 미래에 대한 비전은 무엇인가요?
저는 스노클이 모든 큰 기업이 AI에 대해 진지한 관심을 가진 신뢰할 수 있는 파트너가 될 것으로 생각합니다.
스노클 플로는 대기업의 데이터 과학 팀에서 유비쿼터스 도구가 될 것입니다. 그들은 스노클을 사용하여 자체 대규모 언어 모델을 미세 조정하거나, 이미지 분류 모델을 구축하거나, 단순한 로지스틱 회귀 모델을 구축할 수 있습니다.
어떤 종류의 모델이든, 비즈니스에는 모델을 훈련하기 위해 고품질의 레이블이 된 데이터가 필요합니다.
이 인터뷰에 감사드립니다. 더 많은 정보를 원하는 독자는 스노클 AI를 방문하십시오.












