インタビュー
マルロス・C・マシャド、アルバータ大学の准教授、アミーフェロー、CIFAR AIチェア – インタビューシリーズ

マルロス・C・マシャドは、アルバータマシンインテリジェンス研究所(Amii)のフェローであり、アルバータ大学の准教授であり、アミーフェローでもあり、またカナダのCIFAR AIチェアも務めています。マルロスの研究は、主に強化学習の問題に焦点を当てています。彼はブラジルのUFMGで学士号と修士号を取得し、アルバータ大学で博士号を取得しました。そこで、彼はオプションを通じた時間的拡張探索のアイデアを普及させました。
彼は2021年から2023年までDeepMindで、2019年から2021年までGoogle Brainで研究者として働きました。その間、彼は強化学習、特にLoonの成層圏バルーンの制御への深い強化学習の応用に重大な貢献をしました。マルロスの研究は、Nature、JMLR、JAIR、NeurIPS、ICML、ICLR、AAAIなどのAI分野の主要な会議とジャーナルに発表されています。彼の研究は、BBC、Bloomberg TV、The Verge、Wiredなどの一般メディアでも紹介されています。
私たちは、アルバータ州エドモントンで開催されるAmii(アルバータマシンインテリジェンス研究所)が主催する2023年のUpper Bound AIカンファレンスでインタビューをしました。
あなたの主な焦点は強化学習にありますが、このタイプの機械学習に何が引き付けるのか?
強化学習が好きなのは、この概念が非常に自然な方法で学習することです。私の意見では、学習は相互作用によって行われるということです。人間が学習する方法と似ていると思います。私はAIを擬人化したくないですが、試行錯誤しながら学習するというのは、直感的な方法です。強化学習に魅了されるのは、エージェントが世界と相互作用することで、新しい行動を発見できることです。
例えば、AlphaGoの有名な37手は、創造性があると言われています。以前には見られなかったもので、みんなを驚かせました。強化学習は、世界と相互作用することで、このような行動を発見できるという点で、独自の位置にあると思います。
私が働いたプロジェクトの1つは、成層圏で可視性のあるバルーンを飛行させることでした。そこでも同様のことが見られました。みんなを感動させた、そして私たちが想像できなかった、しかし素晴らしい行動が現れました。強化学習は、世界と相互作用することで、このような行動を発見できるという点で、独自の位置にあると思います。
もちろん、私は二重性を避けます。強化学習のクールな応用は、私にとって非常に魅力的でした。例えば、数十年前に強化学習の初期の成功例は、非常に魅力的でした。
あなたの好きな歴史的な応用は何ですか?
2つの非常に有名なものがあります。1つはスタンフォードで強化学習を使って飛行したヘリコプターです。もう1つは、TD-Gammonというバックギャモンプレーヤーで、世界チャンピオンになりました。これは90年代のことで、私の博士課程のときでした。私はIBMでジェラルド・テサロと一緒にインターンしました。ジェラルド・テサロはTD-Gammonプロジェクトを率いていました。面白いのは、私が強化学習を始めたとき、私はまだこの分野に完全に気付いていなかったということです。私は大学院に申し込むために、教授のウェブサイトをたくさん見て回りました。私は「これは面白い」と思ったので、強化学習の有名な教授たちと一緒に働くことを選びました。
あなたは有機的に見つけたのですか?
はい。私は強化学習の分野の有名な教授たちと一緒に働くことを選びました。私は当時、強化学習の分野に気付いていなかったので、単に彼らの研究の説明が魅力的だったので、選んだのです。
Google (GOOGL ) Brainでのあなたの仕事は、成層圏バルーンの自律航行に焦点を当てていました。なぜこれは、インターネットアクセスを提供するために難しい場所に適したユースケースだったのか?
これは、Alphabetの子会社であるLoonが取り組んでいたプロジェクトでした。世界中の人々にインターネットを提供する方法について考える際に、通常はアンテナを建てます。アンテナは、たとえばエドモントンの場合、5〜6キロメートルの半径でインターネットを提供できます。しかし、アマゾン雨林の部族にインターネットを提供する場合、経済的なコストは非常に高くなるでしょう。アンテナを建てることは、人口密度の低い地域では経済的に実行可能ではありません。
Loonのバルーンのアイデアは、20キロメートルの高さにアンテナを建てるのではなく、バルーンを使用して、より広い地域をカバーすることができるというものでした。バルーンは、10倍以上の半径でインターネットを提供できます。バルーンを森やジャングルの中央に置くことで、複数の部族にインターネットを提供できます。
Loonのモットーは、次の10億人ではなく、最後の10億人にインターネットを提供することでした。これは非常に野心的でした。
あなたが解決しようとしていたナビゲーションの問題は何でしたか?
これらのバルーンは推進されません。ホットバルーンと同様に、上昇または下降して風向きを変えることでナビゲートします。バルーンは成層圏で飛行し、上昇、下降、またはそのまま留まることができます。風によって移動し、目的の場所に到達するために風向きを変える必要があります。
課題は多数あります。まず、目標地域に留まる必要がありますが、同時に太陽電池で動作するバルーンの電力を効率的に使用する必要があります。多目的最適化問題です。バルーンは、風の向きや速度、風の信頼性などの情報を使用して、ナビゲートする必要があります。
風の情報は限られており、予測は90度違うことがあります。風の情報を取得するのは非常に難しい問題です。バルーンは、風の情報を使用してナビゲートする必要がありますが、風の情報は不完全です。
機械学習は何を学習していますか? 単に風のパターンと温度ですか?
風のモデルは、機械学習システムでしたが、強化学習ではありませんでした。歴史的な風のデータを使用して、風のモデルを構築しました。風のモデルは、さまざまな高度の風の情報を組み込んでいました。ガウシアンモデルを使用して、風の情報を補間しました。
強化学習アルゴリズムは、シミュレーターを使用してバルーンの動きを学習しました。シミュレーターは、風のモデルと組み合わせて、バルーンのナビゲーションを学習しました。バルーンは、風の情報を使用して、上昇、下降、またはそのまま留まることを学習しました。
デジタルツインを過去に作成するようなものです。
はい。シミュレーターを使用して、過去の風の情報を学習しました。バルーンのナビゲーションを学習するために、過去の風の情報を使用しました。
強化学習をゲーム設定ではなく実世界で展開する際の課題は何ですか?
強化学習を実世界で展開する際の課題は、エンジニアリング、安全性、適用性などの問題です。ゲームでは、安全性は問題ではありませんが、実世界では、安全性は非常に重要な問題です。
強化学習アルゴリズムは、ゲームでは簡単にテストできますが、実世界では、テストは非常に難しいです。実世界では、安全性と適用性を考慮する必要があります。
現在あなたが取り組んでいる研究は何ですか?
現在、私はアルバータ大学で研究グループを率いています。私の研究は、継続学習に焦点を当てています。継続学習は、機械学習モデルの学習を継続的に行うことで、環境の変化に適応することができます。
水処理プラントのプロジェクトでは、継続学習を使用して、水の質の変化に適応することができます。水処理プラントでは、水の質は時間の経過とともに変化し、機械学習モデルの再学習が必要です。
継続学習を使用する将来の応用例については、どれが最も興味がありますか?
継続学習を使用する将来の応用例については、建物の冷房システムの最適化が最も興味があります。建物の冷房システムでは、温度、湿度、風向きなどの多数の変数を考慮する必要があります。継続学習を使用して、建物の冷房システムを最適化することができます。
また、データセンターの冷房システムの最適化も興味があります。データセンターでは、冷房システムの最適化が非常に重要です。継続学習を使用して、データセンターの冷房システムを最適化することができます。
これらの場所では、電力消費の最大75%が実際にはエアコンのユニットであるため、これは非常に重要です。
はい。建物の冷房システムの最適化は、エネルギー消費の削減に大きな影響を与えることができます。継続学習を使用して、建物の冷房システムを最適化することができます。
感謝の気持ちを表します。読者がさらに情報を知りたい場合は、以下のリソースを訪問してください:












