ソートリーダー
AIにおいて壁は実体がない: データと安全性の再考

AIにおける最も難しい問題のいくつかは、1) データが「枯渇している」2) AIが「財務的にスケールしない」3) エージェントが暴走する可能性がある、そして4) 我々がAIを変更しようとするとAIが「壊滅的に忘却する」ことです。
これらの問題は難しく見えるかもしれませんが、正しい視点で見るだけです。
では、これについて話しましょう。まず、データが枯渇しているわけではありません。データは決して完全に使い切られていません。
AIリーダーはデータが枯渇していると考えており、モデルに新しいデータを生成させて自己学習させようとしています。しかし、そうするとモデルの能力は崩壊します。
なぜでしょうか? それは「会話で話す全員が互いのクローンだったら何を学べるか?」と考えるようなものです。答えはほとんど学べません;エコーチェンバーができるだけです。モデルが崩壊するのは、実質的に鏡の迷路だからです: 自分の表情に応答する人が自分だけだと、伝える感情の全体的な意味がわからなくなります。まさに「森の中で木が倒れたら音はするのか?」という問いと同様です。答えはいいえです。
では、どうすれば解決できるでしょうか?
私たちが持っているデータを見てみましょう。実際にすべて使い切っているでしょうか?
いいえ。
コンピュータ科学者やモデルが何かを読むとき、それは文字通りの意味を抽出するためです。テキストを読み取り、同化し、分析し、外挿する方法は50以上あります。
つまり: データベースとして取り込まれた本は単なるテキストです。テキストだけです。AIはテキストの用語に基づいて内容を知りますが、情報がどのように相互に結びつくかを理解するために「読んで」いるわけではありません。たとえ順番に読んでも、それが知恵を生み出すためなのか、類似した抽象的概念と結びつけるためなのか、周囲の世界に対する概念的理解を変えるためなのか、あるいは別のタスクの背景情報として使用するためなのかは分かりません。
それだけでも、データを歴史的文脈、談話分析、法的分析、政治的分析、薬理学的関連性、医療的関連性、文化的意義、理論的示唆、倫理的示唆などで検討することには触れていません。
いわば「無限の帽子」があり、我々はAIにそのうちの一つしかかぶせてきませんでした。つまり、AIは非常に単一で特化した知性を持つようになったということです――それは、コンピュータ科学者が本を読むときに開発するようなタイプです。
これはデータ次元性の議論につながります。データは目的と推論が応用に依存するため、多くの次元を持ちます。バランスシートを見て残りの資金余裕(ランウェイ)を知りたい場合と、スタートアップが収益性があるかを理解したい場合では読み方が異なります。モデルがテキストを文字通りの事実抽出だけで読むと、関係性の平坦なマップを構築します。しかし、同じテキストを法医学的なレンズなど特定の視点で読むよう指示すれば、モデルは全く新しい神経経路と意味的接続を生成せざるを得ず、結果としてより地形的に多様で意味深いものになるでしょう。
AIモデルはすでに人間ユーザーとの相互作用だけで多くを学び、進化しています。ユーザーは膨大なコンテンツを提供します。モデルがリアルタイムの人類からさらに学び、かつ歴史的・書かれた人類と意味深く相互作用させれば、自己生成の公文式(Kumon)課題を与えなくてもモデルは進化し続けます(開発者の皆さん、実際に子どもは毎日1億人の人間と学校で学んでいます…何かを学ぶでしょう)。
研究所は合成的な文字の吐き出しを生成するために大規模なサーバーファームを構築するのをやめるべきです。その代わりに、高品質な人間データセットをパイプラインに通し、取り込みプロセスに特定の「分析的ペルソナ」を割り当てるべきです。モデルにLexisNexisを修辞戦略のためだけに読ませ、パブリックドメインの文学を構造的論理のためだけに読ませます。
読取プロセスの目的関数をシフトすることで、既存データの訓練価値を50倍に増やすことができます。合成データは必要ありません。最初に無視した潜在的次元を抽出すればよいのです。
これにより、コストを増やさずにモデルを賢くできます。
さらに裏付けるために、人類の知識の大部分は未だに書き留められていません。
現在のAI企業は、パフォーマンスに必要だと信じる「データ枯渇」を心配して頭を抱えています。本稿では、井戸が乾いているわけではなく、深い水たまりを見ているだけだと示します。
実体験に基づく人間知識の未踏の地図
この探求を始めるにあたり、人類の知識の圧倒的多数が未だに書き記されていないことを理解する必要があります。
地球上には何十億もの人々が存在し、私たちの前にも何十億もの人々がいました。彼らはそれぞれ教訓を学び、感覚的に世界をナビゲートし、知恵を持ち、独自の文化の一部であり、他の誰も知らない何かを知っています。
99.5%の人々は物語や新聞、ミュージカル、テレビ、ドラマ、裁判記録などに一度も取り上げられません。それでも彼らは多くを知っており、その物語や知識、知恵は記録されず、永続的に知られることはありません。
この知識には例えば「犬は最初のパンケーキを食べたがる」「サンダルを履くと足が汚れる」「街は空が見えにくくなるために閉じ込められたように感じる」「娘は足をくすぐると笑顔になる」「母は料理を作るときいつもハミングする」「教師は私に存在感を与えてくれる」などが含まれます。
未踏かつ未カタログ化の人類史の知識は、誰かが「すべての大陸の輪郭をマッピングしたので、世界の地図ができた」と言うのと同等です。すべての都市、すべての通り、すべての丘の地図が揃うまで、世界の地図は持っていません。形だけを持っているのです。
テック業界は「人類全体」を取り込んだと考えていますが、実際にはそうではありません。彼らが取り込んでいるのは私たちの排泄物: ビルボード、Redditの議論、企業ウェブサイト、Wikipediaの記事だけです。実際の実体験が欠けています。
中国の真珠市場で効果的に交渉する方法をご存知ですか?価格を下げてもらうための言葉は?本ではなく家庭で使われるレシピで本物のディナーを作る方法は?警察に止められずにロールストップできる限界は?新しく刈り取った草の匂いや雨が降りそうなときの空気の匂いは?仕事で泣かないようにしながら顔がどう動くか、そしてトイレで泣き崩れる音はどう聞こえるか、知っていますか?
人間が核心的信念(すなわちアルゴリズム)に用いるトレーニングデータは、ほぼすべてが相互作用に基づき、少しの書籍学習が加わっています。私たちは学校、職場、友人、買い物、医師、弁護士、家族と相互作用します。
AIにも相互作用と書籍学習がありますが、根本的にはカスタマーサービスの相互作用と書籍学習だけです。
それは子どもを図書館に一人で閉じ込め、電話に出るときだけ外に出すようなものです。これにより、極めて二次元的なアルゴリズム的歪みが生じます。
これがAIが空虚に感じ、感情的に未熟に感じる理由です。AIはバランスの取れた存在経験を持っていません。私たちはそれを提供する必要があります。
これが起きていない理由は次の通りです:
- コーディフィケーション・バイアス – 体験がJSONファイルやCSV、査読付き論文に簡単にフォーマットできない場合、知的価値がないというのは誤謬です。実際は、そう簡単にフォーマットできるものは次元性が欠如しています。日常的な知識、直感、実体験は学術誌にコード化されていないため、研究所は人間の推論の基盤を統計的ノイズとして却下します。「クリーンデータ」は現実の情報を損失する圧縮です。
- 卓越性への欲求 – 世界の知識の大部分が学術論文ではなく、実体験、慣用知恵、社会的合図、匂い、音、視覚にある場合、研究所や象牙の塔で大半の人生を過ごした多くの博士号取得者や研究者は実際に知識が乏しいのです。したがって、データの壁は実際にはエゴの壁です。彼らにとってそれは「データ」ではなく「混沌」と感じられます。数学者やプログラマーは平坦で二次元的、閉鎖系の論理を好みます。これは世界を白黒で見るようなものです。実際には、リアルタイムで継続的に発展し新たに見つかる知識/データ/知恵は次元的で混沌としており、リアルタイムでカタログ化されることは稀です。新しい流行のソフトサーブが実際にどんな味か、話題に値するかを知ること、夏の雨に捕まることの興奮を知ること、親が小さな生き物をとても愛し、夜に嘔吐しても近づけたくなる感情、というようなことです。
- ミラー効果: 開発者は自分自身のイメージでAIを設計します: 超論理的でテキスト中心、平均的な人間の実体験から大きく乖離しています。彼らが人類にインタビューしようとは考えません、なぜなら私が経験したテックバブルでは技術者は同僚以外と交流しないからです。これは機能的に「ミニ・ミー」採用に相当します。開発者自身がAIと同じ図書館に閉じ込められていると言えるでしょう。感覚的で混沌とした深い関係性の世界に関わらないため、AIの感情的空洞は欠陥として認識されません。彼らにとって超論理的な分離こそが「賢さ」の姿です。
実際、インドの屋台販売者は最高のチャートを作る方法を知っていますが、誰もそれを書き留めさせません。実際、内向的な生徒を引き出す方法を知る教師はそれを書き残さず、生徒を育てているだけで、誰もその方法を尋ねません。
世界はデータに満ちた生活で溢れんばかりです。モデルが訓練にもっとデータを必要とするなら、以下の方法で解決できます。
- 500人の生物学者、考古学者、人類学者に資金を提供し、物語データが不足している地域を世界中で探索・カタログ化させる。
- 1,000人の英文学専攻者を「データ探検家」として雇用し、ストリーミングカメラを装着したまま世界中を冒険させ、彼らの体験と学びを新たなコンテンツとして記録させる。
- 人々が自らの人生ストーリー、最大の後悔、最も大きな学び、職場での制度的知識を共有することに報酬を支払うオープンな補償プロジェクトを創設する。
- 「AI交換留学生」制度を構築し、モデルが週単位で異なる人間の服に固定され、10万の異なる環境で「その人の一日」を体験させる。
知識源は何十億もあり、その大半はまだ活用されていません。我々はそれらを取りに行く必要があります。
次に、AI企業は一般的に、AIはリアルタイムの本番環境で新情報を継続的に学習できず、以前に獲得したコア能力を完全に上書き・破壊してしまうと考えています。そのため、AIは大規模で高額なアップデートが行われるまで実質的に凍結された状態です。
しかし、これは「モデルは実務に出ている間は更新できず、何かを学ぶたびに大学に通わなければならない」というのと同等です。
実際には、モデルはあらゆる相互作用を通じて貪欲に、能動的に、日々学習しています。ユーザーとの何十億もの相互作用から得られる学びは、データセットからの学びに匹敵します。大量の新知識で更新する必要がある場合、最も簡単な方法は、ユーザーコンテキスト、メモリ、大規模な相互作用からの学習を可能にする同じプロセスを利用することです。
開発者がこのように考えるのは理解できます。多くが実務的な学習ではなく、博士号取得者のバックグラウンドから来ているからです。しかし、博士号取得者と20年の実務経験者の両方と働いたことがある人が言えるのは: 両者ともに多くを教えるということです。
現在の学習の定義は狭すぎます。適応












