思想领袖
农业数据问题是一个人工智能问题——以及植物可以做什么

每隔几年,农业技术领域就会出现一个新的银弹。2013年,叙事是大数据转变农场管理——孟山都公司以11亿美元收购Climate Corporation,应该标志着预测农业的新时代。几年后,人工智能绿色大厦将实现第二次绿色革命。然后,机器人采收、生成人工智能农学家和代理人工智能将在全球各地代表农民自主做出决定的承诺接踵而至。
这种模式应该很熟悉:每一波炒作都建立在前一波的基础上,但农业技术投资的回报一直令人失望,变革性的结果仍然难以实现。为什么?并不是因为工程师们缺乏才华,也不是因为人工智能科学有缺陷。问题的根源在于农业人工智能系统所依赖的数据本身。
直到我们从根本上重新思考我们收集和使用的数据,农业人工智能革命将仍然是一个承诺,而不是现实。
农业人工智能失败的三个原因
农业是人工智能开发中最不友好的环境之一。挑战不是微不足道的工程问题——它们是结构性的。以下是使这个领域对人工智能如此抵抗的原因:
以生物速度而非软件速度运行的反馈循环
现代人工智能系统的设计是围绕快速迭代的。软件模型可以在几小时内重新训练;药物试验需要几年。农业更接近后者。诺曼·博尔劳格在20世纪70年代的诺贝尔奖获奖创新部分是关于压缩作物育种周期,从一年一次到一年两次。如今最先进的种子公司每年管理三个育种周期;即使按照人工智能标准,这仍然非常缓慢。当你的真实数据与收获一起到来时,模型改进的时间线跨越了几年,而不是短暂的冲刺。
农业复杂性打破了人工智能的常规假设
问一个看似简单的问题——这个田地应该接受多少氮?——变量迅速增加:土壤成分、以前的作物轮作、病原体历史、微气候、几十年前的牲畜历史、水分保持、耕作实践和几十个其他相互作用的因素。关于人工智能推理局限性的研究表明,在高维环境中,模型的准确性会崩溃。农业不仅是高维的;它是人类尝试建模的最高维度领域之一。
每个农场都是一个边缘案例
在真正的农业中,没有“球形牛”这种东西。每个农场都有其自己的技术访问、劳动理念、资本约束和风险承受能力的组合。一个在中西部大型作物农场训练的模型将会在应用于太平洋西北部的小型多元化农场时惨败。没有什么可以很好地推广,并且当你使用环境中的代理变量而不是植物本身发出的信号时,构建每个边缘案例的维度变得不可行。
更多数据不是答案——更好的数据是
硅谷对大多数棘手问题的直觉是向它们投入更多的计算和数据。在农业领域,这种直觉产生了一些惊人的数字:平均每个农场现在每天产生大约500,000个数据点。卫星成像地球上的每个田地。传感器以细节记录温度、湿度和土壤湿度。
然而,农业人工智能社区普遍承认存在数据质量缺口。问题不在于数量。它是相关性。所有这些传感器数据、所有这些卫星图像、所有这些土壤检测报告——它们都捕捉到了发生在植物周围的事情。没有一个捕捉到了发生在植物内部的事情。
考虑一下一个一级方程式赛车工程师试图使用仅GPS跟踪数据来优化圈速的类比。速度、位置和轨迹给你一些东西可以用,但没有发动机遥测、轮胎温度传感器和燃料流动数据,你的模型总是会对因果关系进行猜测。外部农业数据与此相同。它告诉你环境中存在什么条件,但它不能告诉你作物实际上如何对这些条件做出反应。
这解释了一些农业人工智能最明显的失败。Gro Intelligence筹集了超过1.2亿美元,建立了世界上最大的农业气候数据存储库,最终却关闭了。更多的外部数据,无论收集得多么精确,都无法解决根本问题:我们正在测量错误的东西。
真正倾听植物的意义
新的生物技术使得从我们种植的作物内部获取数据成为可能。核心思想是工程作物以可测量的输出信号其内部生物状态——通过可测量的输出信号传达压力、感染或资源需求,而不是需要从外部代理推断出来。
今年早些时候,这些方法之一产生了真正具有历史意义的结果——一种具有工程化的荧光信号的大豆植物在真实时间内显示出真菌感染,在植物上出现任何可见症状之前。农业史上,农民从未能够在如此早期发现疾病。植物自身的免疫反应触发了信号。植物本身提供了数据。
这对于实际的农业成果至关重要。疾病的早期检测使得早期干预成为可能,减少了损失和化学投入。但对于农业人工智能来说,它同样重要,因为它代表了一种全新的数据类别。
与其尝试从外部条件推断植物生物学——这是一项本质上嘈杂、高维且容易受到混杂因素影响的任务——人工智能系统现在可以使用植物本身发出的信号进行训练。维度问题大大减少。反馈循环变紧凑。边缘案例问题并没有消失,但当你使用植物本身发出的信号而不是环境中的代理变量时,它变得更容易处理。
新时代农业人工智能的新数据范式
与自动驾驶汽车开发的比较很有启发性。像Waymo这样的公司并不是通过仅使用现有的公共道路数据来训练他们的模型。他们建立了专有的传感器阵列,并生成了大量、高质量、第一方数据集,这些数据集捕捉到了他们的模型需要学习的内容。数据策略与模型架构一样重要。
农业人工智能需要类似的重新思考。前进的道路不是将更好的模型应用于现有的农业数据集。这些数据集从根本上受到限制,因为它们只观察到作物的环境,而不是作物本身。前进的道路是生成一种新的数据类别,以实际的植物生物学为基础,并建立设计用于从中学习的人工智能系统。
这样的数据——来自整个农业中心地带的作物的连续、全季节的生物遥测数据——目前尚不存在。但是,生成它的技术正在变得现实。这种数据一旦到来,就将使真正能够帮助农民应对复杂决策的人工智能模型成为可能:不再是通过外部变量的嘈杂海洋进行蛮力破解,而是通过了解作物本身的需求,接近实时地做出反应。
农业领域的数据质量差距已经被讨论了多年。变化的是,我们现在对此有了可信的答案,它始于植物本身。
下一次绿色革命的真正道路
可持续地养活80亿人——到2050年将增加20亿人——同时管理气候破坏、投入成本和水资源短缺,是本世纪最大的挑战之一。农业人工智能有助于解决这一挑战的每个方面。但只有当它建立在真正反映我们种植的作物内部发生的情况的数据之上时,才会如此。
十多年来,该行业一直试图通过积累更多的外部数据和向其投入更多的计算能力来解决这个问题。这种方法产生了一些渐进的胜利,但它并没有带来该行业所需的突破。它不会——因为根本的数据问题仍然未得到解决。
下一次绿色革命不会由另一个有前途的模型架构或另一个拥有更好的卫星成像管道的资金充足的初创公司引发。它将在人工智能系统终于能够听到作物试图说的话时开始。













