ソートリーダー
農業のデータ問題はAIの問題であり、作物が何をできるか

農業技術セクターでは、数年ごとに新しい銀の弾丸が現れます。2013年には、物語は農業管理におけるビッグデータの重要性でした。モンスァントのClimate Corporationの11億ドルでの買収は、予測農業の新しい時代の始まりを告げるはずでした。数年後には、AIを搭載した温室が、第二の緑の革命をもたらすはずでした。次に、ロボットによる収穫、次に生成AIアグロノミスト、そして現在は、世界中の農家のために自律的に決定を下すことができるAIが現れました。
このパターンは、誰でも見ることができます。各波のハイプは、前のものを基にしていますが、AgTechベンチャー投資はまだ期待外れです。変革的な結果はまだ見えません。なぜでしょうか。エンジニアが才能がないわけではなく、基礎となるAI科学が欠陥があるわけではありません。問題は、農業AIシステムが依存しているデータに深く根ざしています。
農業AIが失敗する3つの理由
農業は、想像できる中で最もAIの開発に不向きな環境の1つです。課題は、些細なエンジニアリングの問題ではありません。構造的なものです。ここでは、通常のAIプレイブックに抵抗するドメインの理由を説明します。
生物の速度で動くフィードバックループ、ソフトウェアの速度で動くものではない。
現代のAIシステムは、迅速なイテレーションを中心に設計されています。ソフトウェアモデルは数時間で再トレーニングできますが、薬剤の臨床試験には数年かかります。農業は、後者の方に近いです。ノーマン・ボルラウグの1970年代のノーベル賞受賞した革新は、作物の繁殖サイクルを1年に2回に圧縮することについてでした。今日の最も先進的な種子会社は、年間3サイクルを管理しています。まだAIの基準では、非常に遅いです。土壌の真実が収穫とともに到着する場合、モデル改善のタイムラインは数年、数時間ではなく、スプリントにわたって伸びます。
農業の複雑さは、AIの通常の仮定を破壊する
とてもシンプルな質問を聞いてみましょう。 — このフィールドにどれくらいの窒素が必要か? — 変数はすぐに増えます: 土壌組成、前の作物の輪作、病原体の歴史、微気象、家畜の歴史(数十年前まで)、水保持、耕作慣行など、数十の他の相互作用要因。 AIの推論の限界に関する研究は、高次元環境ではモデル精度が崩壊することを示しています。農業は、高次元ではありません。人間がモデル化しようとしたものの中で、最も高次元のドメインの1つです。
毎回、農場は独自のエッジケースである
現実の農業には、球形の牛はありません。毎回、独自の技術アクセス、労働哲学、資本制約、リスク許容度の組み合わせがあります。中西部の大規模な作物農場でトレーニングされたモデルは、太平洋北西部の小規模な多様な農場に適用されると、壮絶に失敗します。何もクリーンに一般化できません。毎回のエッジケースを構築することは、さらに次元性を効果的に増やします。
より多くのデータは答えではない — より良いデータが答えである
シリコンバレーの直感は、ほとんどの難しい問題に対して、より多くのコンピューティングとより多くのデータを投げ込むことです。農業では、その直感は、農場が1日あたり約50万のデータポイントを生成するという、驚くべき数字を生み出しています。衛星は地球上の毎回のフィールドを画像化します。センサーは温度、湿度、土壌水分を詳細に記録します。
しかし、農業AIコミュニティは、広く、データの質の欠如を認めています。問題は、ボリュームではありません。関連性です。センサーからのすべてのデータ、衛星画像、土壌試験の報告書 — すべてが作物の周囲で何が起こっているかを捉えています。どれも、作物の中で何が起こっているかを捉えていません。
フォーミュラ1レースエンジニアが、GPSトラッキングデータのみを使用してラップタイムを最適化しようとしているというアナロジーを考えてみましょう。速度、位置、軌跡は何かわかりますが、エンジンテレメトリ、タイヤ温度センサー、燃料流量データがなければ、モデルは常に原因について推測することになります。農業の外部データは、まったく同じです。環境の条件については何かわかりますが、作物がそれらの条件に実際にどう反応しているかはわかりません。
これは、農業で最も目立つAIの失敗のいくつかを説明しています。 Gro Intelligenceは、世界最大の農業気候データリポジトリを構築するために1億2000万ドル以上を調達しましたが、最終的に閉鎖しました。外部データをより正確に収集するだけでは、根本的な問題 — 我々が間違ったものを測定しているという問題 — を解決しません。
実際に作物に耳を傾けるということ
新しいバイオテクノロジーにより、初めて、作物の中から直接データを取得することが可能になりました。基本的な考え方は、作物を、ストレス、感染、またはリソースのニーズを、推測を必要とせずに、測定可能な出力で伝えるようにエンジニアリングすることです。
今年の初めに、このアプローチは、実際に歴史的な結果をもたらしました — 菌病の感染を実時間で検出できる、遺伝子組み換えされた蛍光シグナルを持つ大豆植物が作られました。 大豆の菌病の感染を、作物に目に見える症状が現れる前に検出しました。農業の歴史10,000年間で、農家はその段階で病気を検出できませんでした。作物自身の免疫反応がシグナルを引き起こしました。作物自身がデータを提供しました。
これは、実際の農業の成果にとって重要です。病気の早期発見により、早期の介入が可能になり、損失と化学物質の投入が減ります。しかし、これは農業AIにとっても重要です。なぜなら、これは基本的に新しいクラスのデータを表しているからです。
代わりに、外部の条件から作物の生物学を推測しようとするのではなく、AIシステムは、作物の生理学の直接測定に基づいてトレーニングできます。次元性の問題は、劇的に縮小します。フィードバックループは緊密になります。エッジケースの問題は消えませんが、作物自身が発する信号で作業している場合、環境の周囲のプロキシ変数ではなく、扱いやすくなります。
新しい農業AIの新しい時代のための新しいデータパラダイム
自律車の開発との比較は、示唆的です。Waymoのような企業は、既存のパブリックロードデータのみに基づいてモデルをトレーニングすることで成功しなかったからです。彼らは、独自のセンサーアレイを構築し、モデルが学習する必要があるものを正確に捉えた、膨大で、高品質の、第一パーティーのデータセットを生成しました。データ戦略は、モデルアーキテクチャと同等で重要でした。
農業AIも、同様の考え方の転換が必要です。前進する道は、既存の農業データセットに適用されるより優れたモデルではありません。そうしたデータセットは、作物の環境のみを観察し、作物自体は観察しないという事実によって、根本的に制限されています。前進する道は、新しいカテゴリのデータを生成し、そこから学ぶように設計されたAIシステムを構築することです。
そのようなデータ — 作物からの連続した、季節を通した生物学的テレメトリ — はまだ、大規模に存在しません。しかし、それを生成する技術は、現実になりつつあります。当そのデータが到着すると、作物自体が何を必要としているかを、ほぼリアルタイムで理解することで、農家が複雑な決定を下すのを助けることができる、AIモデルの種類が可能になります。外部変数のノイズな海を無理矢理通過するのではなく、作物が実際に何を必要としているかを理解することで、農家を助けることができます。
農業におけるデータ品質のギャップは、数年前から議論されてきました。何が変わったかというと、現在、信頼できる答えができたということです。それは、作物自体から始まります。
次の緑の革命への実際の道
持続可能な方法で80億人を養う — 2050年までにさらに20億人を予測 — 気候変動、入力コスト、水不足を管理することは、この世紀の最も重要な課題の1つです。農業AIは、その課題のすべての部分で役立ちます。ただし、作物を育てようとしているものが実際に何をしているかを反映したデータに基づいて構築されている場合にのみです。
10年以上にわたって、業界は、外部データを蓄積し、より多くのコンピューティングを投入することで、その問題を解決しようとしてきました。そうしたアプローチは、漸進的な勝利をもたらしましたが、セクターが必要としているブレークスルーを達成しません。それは、根本的なデータ問題が解決されていないためです。
次の緑の革命は、もう一つの約束されたモデルアーキテクチャや、衛星画像パイプラインが優れているもう一つの資金提供されたスタートアップによって生み出されるものではありません。それは、AIシステムが最終的に作物が何を言おうとしているかを聞くことができるようになったときに始まります。













