인터뷰

마르로스 C. 마차도, 앨버타 대학교 부교수, Amii 펠로, CIFAR AI 의장 – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

마르로스 C. 마차도는 앨버타 머신 인텔리전스 연구소(Amii)의 펠로우이며, 앨버타 대학교의 부교수이자 Amii 펠로우로, 캐나다 CIFAR AI 의장도 맡고 있다. 마르로스의 연구는 주로 강화 학습의 문제에 초점을 맞추고 있다. 그는 브라질의 UFMG에서 학사와 석사 학위를, 앨버타 대학교에서 박사 학위를 받았다. 여기서 그는 옵션을 통한 시간적으로 확장된 탐索의 아이디어를 대중화했다.

그는 2021년부터 2023년까지 DeepMind의 연구원이었으며, 2019년부터 2021년까지 Google (GOOGL ) Brain에서 연구원으로 일했다. 이 기간 동안 그는 강화 학습, 특히 Loon의 성층권 풍선 제어에 대한 깊은 강화 학습의 적용과 관련된 주요 기여를 했다. 마르로스의 연구는 Nature, JMLR, JAIR, NeurIPS, ICML, ICLR, AAAI를 포함한 AI 분야의 주요 конферен스와 저널에 발표되었다. 그의 연구는 또한 BBC, 블룸버그 TV, The Verge, Wired와 같은 대중 미디어에서 소개되었다.

우리는 2023년 에드먼턴에서 열린 Amii(Alberta Machine Intelligence Institute)가 주최하는 AI에 관한 연례 Upper Bound 컨퍼런스에서 인터뷰를 진행했다.

강화 학습에 초점을 두고 있는 것이 주된 관심사입니다. 이 유형의 기계 학습이 당신을 끄는 것은 무엇입니까?

강화 학습이 좋다고 생각하는 것은 이 개념입니다. 이것은 매우 자연스러운 학습 방식입니다. 즉, 상호작용을 통해 학습합니다. 이것은 인간이 학습하는 방식과 같습니다. 나는 기계 학습을 인간화시키고 싶지 않지만, 이것은 직관적인 방식입니다. 당신은 시도를 해보고, 어떤 것들은 좋게 느껴지고, 어떤 것들은 나쁘게 느껴지며, 당신은 더 나은 것을 하는 방법을 배우게 됩니다. 강화 학습에 대해 매료되는 한 가지 事實은 에이전트가 실제로 세계와 상호작용한다는 것입니다. 에이전트는 가설을 세우고, 그 가설을 테스트할 수 있습니다.

이것이 중요한 이유는 새로운 행동의 발견을 가능하게 하기 때문입니다. 예를 들어, 가장 유명한 예는 AlphaGo입니다. 문서에서 말하는 37번 이동은 창의力的이라고 합니다. 이것은 이전에 본 적이 없는 것입니다. 모두를 놀라게 했습니다. 이것은 세계와 상호작용함으로써 이러한 것들을 발견할 수 있습니다. 강화 학습은 이러한 유형의 행동을 발견하는 데 유일하게 적합합니다. 왜냐하면 당신은 상호작용하기 때문입니다. 어느 정도면 반대 사실적인 것들, 즉 “내가那样했다면 어떻게 되었을까?”와 같은 것은 일반적으로 기계 학습 연구에서 매우 어려운 문제입니다. 그러나 강화 학습에서는 할 수 있습니다. “내가那样했다면 어떻게 되었을까?” 다음에 다시 경험할 때 시도해 볼 수 있습니다. 이것이 내가ชอบ하는 강화 학습의 상호작용적인 측면입니다.

물론 나는 위선적이지 않습니다. 나는 많은 멋진 응용 프로그램이 그것과 함께 왔기 때문에 그것이 khá thú vị하다고 생각합니다. 예를 들어, 수십 년 전, thậm chí 강화 학습의 초기 성공적인 예를谈하면, 모두 그것을 매우 매력적으로 만들었습니다.

당신이 가장 좋아하는 역사적인 응용 프로그램은 무엇입니까?

나는 두 가지非常 유명한 예가 있습니다. 하나는 스탠퍼드에서 강화 학습으로 비행한 헬리콥터이고, 다른 하나는 TD-Gammon입니다. 이것은 1990년대에 세계 챔피언이 된 백검棋 선수입니다. 나는 박사 과정 중에 IBM에서 제럴드 테사우로와 함께 인턴으로 일했습니다. 제럴드 테사우로는 TD-Gammon 프로젝트를 주도했습니다. 그래서 이것은非常 cool했습니다. 재미있는 것은 내가 강화 학습을 시작했을 때, 나는 완전히 어떤 분야인지 모르는 상태에서 시작했습니다. 내가 대학원에 지원할 때, 나는 많은 교수님의 웹사이트를 방문했습니다. 나는 기계 학습을 하고 싶었기 때문에, 나는 모든 사람의 연구 설명을 읽었습니다. 나는 “오, 이것은 interessant합니다”라고 생각했습니다. 돌아보면, 나는 강화 학습 분야의 유명한 교수님들을 모두 선택했습니다. 그러나 나는 그들이 유명해서가 아니라, 그들의 연구 설명이 매력적이었기 때문입니다. 나는 “오, 이 웹사이트는 정말 좋습니다. 나는 이 사람과 그 사람, 그리고 그 여자와 함께 일하고 싶습니다”라고 생각했습니다. 그래서 어느 정도면, 나는 그들을 자연스럽게 찾았습니다.

당신은 그들을 자연스럽게 찾았습니다.

정확히 그렇습니다. 돌아보면, 나는 “오, 이 사람들이 바로 내가 오래 전에 함께 일하기 위해 지원했던 사람들입니다”라고 생각했습니다. 아니면 “이 사람들이 바로 내가 실제로 무엇을 하고 있는지 모르는 상태에서 읽었던 논문입니다”라고 생각했습니다. 나는 강화 학습에 대해 일관되게 돌아왔습니다.

Google Brain에서 당신은 성층권 풍선의 자율 항법에 대해 연구했습니다. 어려운 지역에 인터넷 접근을 제공하기 위한 좋은 사용 사례였습니다.

그것은 전문가가 아닙니다. 이것은 알파벳의 자회사인 Loon이 작업한 것입니다. 우리는 많은 사람들에게 인터넷을 제공하는 방식을 통해 가는 것입니다. 즉, 안테나를 건설하거나, 예를 들어 에드먼턴에 안테나를 설치하면, 이는 5~6킬로미터 반경의 지역에 인터넷을 제공할 수 있습니다. 뉴욕의 중심부에 안테나를 설치하면, 수백만 명에게 인터넷을 제공할 수 있습니다. 그러나 아마존 우림의 부족에게 인터넷을 제공하려고 한다면, 안테나를 설치하는 경제적 비용이非常 높습니다. 풍선의 아이디어는 “안테나를 매우 높게 지을 수 있다면 어떻게 될까요?”입니다. 물론 우리는 그런 안테나를 지을 수 없습니다. 그러나 우리는 풍선을 사용할 수 있습니다. 풍선을 사용하면 10배 더 큰 반경의 지역에 인터넷을 제공할 수 있습니다. 중간에 풍선을 설치하면, 여러 부족에게 인터넷을 제공할 수 있습니다.

인터넷 접근을 어려운 지역에 제공하는 것이 동기였습니다. 나는 Loon의 모토가 “다음 10억 명에게 인터넷을 제공하는 것이 아니라, 마지막 10억 명에게 인터넷을 제공하는 것”이었다고 기억합니다. 이것은 매우 야심적인 목표였습니다.

당신이 해결하려고 했던 항법 문제는 무엇입니까?

이 풍선은 추진되지 않습니다. 핫 에어 밸런을 조종하는 방식과 같습니다. 즉, 위로 또는 아래로 가거나 특정 방향으로 불어가는 바람을 찾은 다음, 그 바람을 타고갑니다. 그리고 나서 “나는 더 이상 거기에 가지 않으려고 합니다”라고 생각할 때, 위로 또는 아래로 가서 다른 바람을 찾습니다. 이것이 풍선이 하는 것입니다. 이것은 핫 에어 밸런이 아닙니다. 이것은 성층권에서 비행하는 고정 볼륨의 풍선입니다.

풍선은 위로 가거나, 아래로 가거나, 그대로 있거나, 바람을 찾아서 원하는 곳으로 갈 수 있습니다. 이것은 항법의 도전입니다. 실제로 많은 도전이 있습니다. 첫 번째는 형식화입니다. 당신은 지역에 있기를 원하지만, 풍선은 太陽能으로 구동되므로, 전력을 유지해야 합니다. 이것은 다중 목표 최적화 문제입니다. 당신은 지역에 있기를 원하지만, 또한 전력 효율을 높이기 위해 노력해야 합니다. 이것이 첫 번째 것입니다.

이것이 문제입니다. 그러나 세부 사항을 살펴보면, 당신은 바람이 어떻게 될지 모릅니다. 당신은 현재 바람을 알지만, 500미터 위의 바람을 모릅니다. 우리는 이것을 부분 관찰 가능성이라고 합니다. 당신은 데이터가 없습니다. 예보가 있지만, 예보는 종종 90도 잘못될 수 있습니다. 이것은 매우 어려운 문제입니다. 높은 차원 문제입니다. 우리는 수백 개의 다른 바람 層을谈하고 있고, 풍속, 풍향, 모델링 방식, 불확실성에 대한 확신 등을 고려해야 합니다.

이 문제는 매우 어렵습니다. 우리는 이 문제를 어떻게 설명할 수 있을까요? 이것은 우리가 이해하기 어렵습니다. 이것은 화면에 나타나는 것이 아닙니다. 이것은 수백 개의 차원과 바람입니다. 언제 마지막으로 그 바람을 측정했는지 기억할 수 없습니다. 당신은 모든 것을 고려해야 합니다. 이것은 매우 어렵습니다.

기계 학습이 연구하는 것은 단순히 바람 패턴과 온도입니까?

풍선의 동작을 시뮬레이션하기 위해 우리는 기계 학습 시스템을 사용했습니다. 그러나 이것은 강화 학습이 아닙니다. 우리는 다양한 고도에 대한 역사적인 데이터를 가지고 있습니다. 그래서 우리는 그 위에 기계 학습 모델을 구축했습니다. 내가 “우리”라고 말할 때, 나는 내가 그 일부가 아니었다는 것을 의미합니다. 이것은 Loon이 Google Brain이 참여하기 전에 이미 한 것입니다. 그들은 바람 모델을 가지고 있었고, 이는 단순히 다른 고도뿐만 아니라, 어떻게 다른 고도 사이를 보간할 수 있는지에 대한 것이었습니다.

당신은 “2년 전, 바람은 이렇게 보였지만, 10미터 위에서는 어떻게 보였을까?”라고 생각할 수 있습니다. 그래서 그들은 가우시안 프로세스를 모델 위에 올려놓았습니다. 그들은 이 모델링이 얼마나 좋은지에 대한 논문을 썼습니다. 우리는 강화 학습 관점에서 시작했습니다. 우리는 풍선의 동작을 시뮬레이션할 수 있는 매우 좋은 시뮬레이터를 가지고 있었고, 우리는 또한 바람 시뮬레이터를 가지고 있었습니다. 그래서 우리는 과거로 돌아가서 “2010년에 내가 있었다면”이라고 말했습니다. 우리는 전 세계의 바람 데이터를 가지고 있지만, 매우粗糙합니다. 그러나 우리는 이 기계 학습 모델, 가우시안 프로세스를 겹쳐서 실제 바람 측정을 얻을 수 있습니다. 그리고 우리는 노이즈를 추가할 수 있습니다.

결국, 우리는 풍선의 동작과 바람을 가지고 있었고, 우리는 과거로 돌아가서 풍선이 배울 수 있도록 했습니다. 우리는 목표 지역에 머무르며, 전력 효율을 높이기 위한 보상을 설계했습니다. 우리는 풍선이 이 세계와 상호작용할 수 있도록 했습니다. 그러나 우리는 풍선이 세계와 상호작용할 수 있는 이유는 바람과 기상 조건을 모델링할 수 없기 때문입니다. 그러나 우리는 과거로 돌아가서 풍선을 배울 수 있었습니다.

디지털 트윈을 사용하여 과거로 돌아가는 것과 같습니다.

정확히 그렇습니다. 우리는 풍선이 배울 수 있도록 설계했습니다. 풍선은 위로 가거나, 아래로 가거나, 그대로 있거나, 바람을 찾아서 원하는 곳으로 갈 수 있습니다. 이것이 문제입니다. 그러나 이것은 시뮬레이션입니다. 그래서 우리는 풍선이 배울 수 있도록 했습니다. 풍선은 목표 지역에 머무르며, 전력 효율을 높이기 위해 노력했습니다.

강화 학습을 실제 세계에 배치하는 것과 게임 환경에서 배치하는 것의 도전은 무엇입니까?

나는 몇 가지 도전이 있다고 생각합니다. 나는 이것이 게임과 실제 세계에 관한 것이 아니라, 근본적인 연구와 응용 연구에 관한 것이라고 생각합니다. 당신은 게임에서 응용 연구를 할 수 있습니다. 예를 들어, 다음 모델을 배치하여 수백만 명에게 배포할 수 있습니다. 그러나 나는 주요 도전은 엔지니어링이라고 생각합니다. 당신이 게임에서 연구를 할 때, 당신은 더 잘 정의된 제약 조건을 캡처합니다. 그래서 당신은 연구를 할 수 있고, 학습을 검증할 수 있습니다. 그러나 실제 세계는 더 많은 도전을 가져옵니다.

실제 세계는 엔지니어링 스택을 가져옵니다. 이것은 연구자로서의 작업과 다릅니다. 당신은 더 많은 이해관계자와 상호작용해야 합니다. 나는 이것이 주요 도전이라고 생각합니다. 다른 하나는 사이클입니다. 실험의 사이클은 매우 길습니다. 게임에서 당신은 einfach하게 플레이할 수 있습니다. 최악의 경우, 일주일 후에 결과를 얻을 수 있습니다. 그러나 실제 풍선을 성층권에서 비행해야 한다면, 우리는 이것을 검증하기 위해 한 달 이상을 기다려야 합니다.

게임과 달리, 같은 게임의 수백만 번의 반복이同時에 실행되지 않습니다.

예. 우리는 시뮬레이션을 사용하여 훈련할 수 있었습니다. 그러나 실제 세계에서는 다릅니다.

당신이 현재 연구하는 연구는 무엇입니까?

현재 나는 앨버타 대학교에 있습니다. 나는 여기서 많은 학생들과 연구 그룹을 가지고 있습니다. 내 연구는 더욱 다양합니다. 한 가지 내가 특히 흥미로운 것은 지속적인 학습의 개념입니다. 대부분의 경우, 우리는 기계 학습에 대해 이야기할 때, 우리는 어떤 계산을 하거나 시뮬레이션을 사용하거나 데이터를 처리합니다. 그리고 우리는 기계 학습 모델을 학습하고, 모델을 배포하고, 잘 작동하기를 바랍니다. 그러나 때때로 이것은 충분하지 않습니다. 실제 세계의 문제는 너무 복잡하여 모델이 모든 것을 캡처할 수 없을 때가 있습니다. 그래서 우리는 적응해야 합니다.

나는 현재 앨버타 대학교에서 물 처리 공장과 관련된 프로젝트에 참여하고 있습니다. 기본적으로 우리는 강화 학습 알고리즘을 개발하여 인간의 의사결정 과정에서 지원하거나 자율적으로 물 처리를 할 수 있도록 합니다. 우리는 데이터를 가지고 있고, 물의 질이 몇 시간 내에 변경될 수 있습니다. 그래서 우리는 매일 모델을 학습하고, 몇 시간 내에 배포해야 합니다. 그러나 모델은 더 이상 유효하지 않습니다. 데이터는 정체되지 않습니다. 예를 들어, 산불이 발생하거나, 눈이 녹기 시작할 수 있습니다. 그래서 우리는 모든 것을 모델링해야 합니다. 그러나 우리는那样하지 않습니다. 우리는 적응합니다. 우리는 계속해서 배우고, 새로운 것을 배우려고 합니다.

나는 많은 출판물이 실제 세계의 문제를 해결하는 데 지속적인 학습이 필요하다고 생각합니다. 강화 학습은 이러한 문제를 해결하는 데 특히 적합합니다. 우리는 계속해서 배우고, 새로운 것을 배우려고 합니다. 그러나 우리의 현재 기계는那样하지 않습니다. 많은 giải決方案이 있습니다. 그러나 우리는仍然에 대해 많은 연구 질문이 있습니다.

지속적인 학습을 사용하는 미래의 응용 프로그램 중에 당신이 가장 흥미로운 것은 무엇입니까?

이것은 10억 달러의 질문입니다. 나는 연구자로서, 나는 올바른 질문을 묻는 것을 좋아합니다. 강화 학습에서 우리는 종종 문제에 의해 주도됩니다. 예를 들어, “오, 우리는 5개의 풍선을 성층권에 가지고 있습니다. 이제 우리는 어떻게 하면 이것을 해결할 수 있을까요?”라고 생각합니다. 그리고 우리는 과학적인 발전을 이루어냅니다. 현재 나는 물 처리 공장과 관련된 프로젝트에 참여하고 있습니다. 이것은非常히 흥미로운 것입니다. 이것은 실제 세계의 문제입니다. 물의 질은 매우 자주 변경됩니다. 우리는 지속적인 학습이 필요합니다.

이것은巨大的 사회적 영향을 미칠 수 있습니다. 물 처리는非常히 중요합니다. 때때로 이것은 생명과 죽음의 문제입니다. 나는 이것이非常히 흥미로운 연구 문제라고 생각합니다. 우리는 시뮬레이터가 없으며, 데이터를 얻는 방법이 없습니다. 우리는 온라인에서 배우고, 지속적으로 배우려고 합니다. 이것은非常히 도전적인 문제입니다.

또 다른 하나는 건물의 냉각입니다. 우리는 날씨, 기후 변화, 우리가 영향을 미칠 수 있는 것들에 대해 생각합니다. 우리는 건물의 냉각을 결정하는 방법에 대해 생각합니다. 이 건물은 오늘날 수백 명의 사람들이 있습니다. 이것은 지난 주와 다릅니다. 우리는 동일한 정책을 사용할 수 있을까요? 우리는 온도 조절기를 가지고 있지만, 우리는 더 똑똑하게 할 수 있습니다. 때때로 많은 사람들이 한 방에 있습니다. 건물의 냉각, 데이터 센터의 냉각과 같은 제어 시스템은非常히 높은 차원입니다. 우리는 현재의 접근 방식보다 더 잘할 수 있습니다.

이것은非常히 흥미로운 응용 프로그램입니다. 이것은非常히 어려운 문제입니다. 그러나 나는 강화 학습이 이러한 문제를 해결하는 데 especialmente 적합하다고 생각합니다. 우리는 계속해서 배우고, 새로운 것을 배우려고 합니다. 우리는非常히 흥미로운 연구 질문이 있습니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.