第三章:农业人工智能的证据框架
本章要旨:从来源丰富到值得信赖的知识
一部学术著作的力量,不在于脚注中堆积了多少参考文献,而在于它能否判定每一条参考文献究竟能证明什么、其认识论权威止于何处。一份来源的价值,不来自它的存在本身,而来自它与被援引来支撑的那项主张之间的适配程度。 在农业人工智能这样快速演进的领域,这一问题变得更为复杂:写作者面前可能同时摆着一篇经同行评议的科学论文、一份官方报告、一个产品页面、一个代码仓库、一次计算机模拟、一则新闻报道,以及一份描述田间经验的证词。这些来源中的每一种都可能包含准确的信息,但它们并不具备同等程度的可靠性,也不承担相同的推论功能。 一篇科学论文可能在特定数据与实验条件下测量了某个模型的表现,但这并不自动证明它在每一种作物或每一个地区都能成功。监管机构是登记某种农药、判定其使用是否获得许可的主管部门,但它不是测量算法准确率的机构。产品页面记录的是供应商在某一日期对其系统所作的声明,但它不能替代对其有效性的独立评估。至于代码仓库,它可以证明在检视之时代码中存在某个组件,却无法证明该组件运行于实际服务之中,也无法证明它在田间产生了切实的农业影响。 本章的任务由这一区分而来:说明本书如何从来源的多样性走向有纪律、可追溯、可复核的判断。它并不提供一份抽象的研究方法目录,而是揭示所使用的实践框架,用以区分有据可查的事实、受语境限定的结果、归属于其来源的描述、尚未充分核实的数据,以及并不自称为实验发现的编辑性建议。 其目的不是通过堆砌限定条件来削弱论证,也不是给知识围上一道永久的怀疑栅栏,而是要建立一种以清晰理解其依据与限度为基础的信任。科学上的确定性不是由断然的语气造就的,而是由一条读者可以追随的路径造就的:这条信息从何而来?它属于哪一类来源?这一来源实际能证明什么?我们又无权从中推出什么?
1. 证据基础的架构:本书的知识地基是如何建立的?
所谓“多语种来源语料库”,本书指的是在准备阶段所收集与整理的全部材料,本书各章与各项分析即建立其上。该语料库并不局限于单一类型的文献;它包括原始研究、科学综述、官方报告、工作论文、机构文件、产品说明、技术材料与实施指南,以及用于发现人名、主题和开启探究线索的辅助材料。 这些材料以多种语言呈现,因为农业创新并非全部以英文发表,也因为某些应用、政策与本地术语只有在其自身的语言和语境中才能完整显现其含义。然而语言的多样性并不意味着把译文与原文计为两份独立来源,也不意味着一份文献仅因存在多个版本就获得更高的学术位阶。为此,译文被与其原文相互关联,重复版本或衍生版本得到识别,每份文献在论证构建中都被赋予了确切的位置与功能。 工作始于对来源材料的清点与整理,但并未止步于收集文件。它进而建立了针对来源、主张、数据与案例研究的各自独立的编辑登记册。这两个阶段的区别至关重要:收集一份文献只意味着有材料可供检视,而接受由其推导出的某项主张,则需要另一层次的核验。此时的问题变为:这份来源是否适合用来证实这项具体主张?该数据能否追溯到其原始出处?在把结果搬入本书时,该研究的条件与限度是否依然清晰可见? 同时还为与案例研究 Aladdin Agri AI 相关的证据建立了独立的登记册,以防止内部实施证据与向读者提供的一般科学参考资料相互混杂。代码、界面或集成路径的存在,可以证明某一已知版本中的特定实施状态,但它并不因此成为一项独立的有效性研究,也不构成田间农业影响的证据。 这种分离保护了两类证据各自的价值:技术证据不被迫承载超出其证明能力的内容,而读者仍能准确看到它确实能够确立什么。 在重新整理文件及其路径时,参考文献并未被束缚于失效的位置或可变的名称上;相反,文件路径与数字指纹的基线记录得到了重建。其目的不纯粹是技术性的,同时也是编辑性与认识论性的:确保每一项重要主张都始终与其所依据的材料相关联,并确保移动文件或更改文件名不会中断核验链条。 为什么把这项工作称为一部循证式的结构化叙述性综述? 本书采取的是循证式结构化叙述性综述的形式:它收集异质材料,加以分类、比较,并据此构建对该领域的连贯诠释,同时清晰呈现每一项证据的类型,以及它所允许推出的结论的限度。 之所以选择这一方法,是因为它契合本书提出的宏观问题:人工智能如何从实验室与产品走向农业决策、经济、劳动、治理与田间? 严格科学意义上的系统综述服务于不同的目的,并依托一套更为具体的方法论框架。它通常始于一个更狭窄的问题、一份预先设定的检索方案、明确的数据库、可复用的检索式、清晰的纳入与排除标准,以及关于检索结果、去重与筛选各阶段的完整记录。这些要素使另一位研究者能够重复该过程,并把所得结果与综述作者的结果加以比较。 分类上的差异并不意味着一种类型严谨而另一种不够严谨;它意味着二者具有不同的认识论功能。系统综述适合在可重复的方案内回答某个具体问题,而结构化叙述性综述则能够连接那些并不由单一实验设计所统合的领域:算法、农业、经济、食品安全、劳动、数据权利、制度结构与区域差异。 本书的力量在于使这些连接保持严谨,同时不抹去各类证据之间的差异,也不把它们呈现为在性质与证明力上彼此对等。 沿袭自早期稿本的数字:当精确比数字的吸引力更重要 本书早先版本的某些稿本曾表示,已在多个数据库与来源中检视了超过 150 份文献。然而本版并未仅因该数字出现在早先版本中就予以保留:它并未附有足以复现检索式、日期、结果、筛选、排除与去重的完整记录,因而不能被当作一项最终的方法学计数。 更轻松的选择本可以是把这一计数带入新版;它是一个数值大、表述清晰而又颇具吸引力的数字。但学术上的选择,是把可以核实的有用知识,与其文献路径仍不完整的数字性主张区分开来。因此,这一历史数字未被用作综述全面性的证据,各项材料与主张则依照本版的记录与已声明的限度重新作了评估。 这并不意味着经由早期稿本积累的知识被浪费或被作废。凡是可以追溯的人名、观点与研究线索都得以保留,各项主张在被采纳之前都经过了重新审查。至于任何无法追溯到适当来源的数字或结果,则未作为已完全确立的事实呈现给读者。 于是,编辑性复核成为提炼知识的工具,而非抹除知识的工具;成为提升本书可靠性的手段,而非削弱它的手段。 像 [SRC004] 这样一篇已发表的系统综述,可能有助于勾勒该领域的部分图景,也可能就其自身的具体问题提供一个有文献记录的检索方案范例。然而其系统性属于其作者所完成的工作,并不因本书引用了它就自动转移给本书。 同样,一批范围广泛的文献并不会仅凭文件数量之多或章节编排之整齐就成为一部系统综述。精确始于按其实际完成的工作为该项工作命名,然后严格地依照这一名称的要求对它加以问责。 从这个意义上说,方法并不是本书的辩解,而是对其力量的陈述:本书选择构建一个宽广且可追溯的论证,清晰声明其性质,并给予每一份来源应有的位置,而不把它抬升到超出其实际证明力的高度。 方法学结论: 信任并非源自文献数量之多,而是源自那条把每项主张与其来源相连的路径足够清晰,并确切指明该来源能证明什么、又有什么超出了它的限度。
2. 核验的单位是主张,而非段落
页面上的一个段落看起来像是一个连贯的整体,但其中可能包含若干在性质上、以及在证实各自所需证据类型上都截然不同的主张。确立某个系统存在的句子,与描述其某项属性的句子并不处于同一层次,而二者都不足以证明它的准确性或它对农民生活的影响。 我们来看一个关于某款数字农业产品的段落的简化示例。该段落可能包含四个不同层次的主张:
- 身份或存在性主张: “存在一个叫这个名字的平台或工具。”
- 属性主张: “其提供方表示,它使用计算机视觉来检测病害症状。”
- 性能主张: “它在某项特定任务上达到了 95% 的准确率。”
- 影响主张: “在实际运行条件下,它减少了农民的损失或提高了他们的收入。”
供应商页面可以证明该产品以此名称提供,且该公司称其使用计算机视觉。但在这种情况下,它所记录的只是供应商在某一日期对其产品的说法。仅凭该页面,无法独立核实该功能是否如其描述那样运作,或该系统是否达到了某一准确率水平,或其使用是否事实上带来了损失的减少。 至于性能数值,它需要一份来源来说明该模型在何种数据上进行了测试、数据如何划分、所用指标的定义、结果所对照的基准,以及将其推广到研究场景之外的限度。即便可以确证该模型在某一特定测试中达到了 95% 的准确率,该结果也不会自动证明其经济或农业上的影响。 证明损失减少,需要一种能够测量田间实际发生了什么的设计,把结果与在没有该系统的情况下会发生的情况相比较,并把成本、风险以及其他可能解释这一改善的因素考虑在内。 三个问题支配着对每一项主张的审查 因此,本书的方法把可核验的主张作为审查的基本单位。这意味着把复合陈述拆解为清晰的单元,然后对每个单元提出三个问题:
- 它属于哪一类主张?
- 证实它的适当来源是什么?
- 该来源所允许的表述限度何在?
是身份主张、属性主张、性能主张,还是影响主张?
它需要一份官方文件、一项性能研究、一次田间评估,还是技术材料?
哪些可以有把握地陈述,哪些则属于超出证据的推广?
审查之后,各项主张并不被一并归入同一类别,而是按清晰的等级加以分类:
- 已核验: 有适当材料支撑,且其证明链条可以追溯。
- 在限定范围内已核验: 在特定研究或语境中得以确立,不得作超出该范围的推广。
- 归属性描述: 表达的是某一实体或公司对其产品的说法,而非对它的独立评估。
- 待核验: 存在初步迹象或参考线索,但证明链条尚不完整。
- 不可使用: 未能识别出相匹配的来源,或经查该来源并不支持归于它的那项主张。
因此,如果产品名称及其应用领域已得到确立,而其性能水平尚未确立,该产品无需被从该领域的图景中移除;但与此同时,那一数值也不得作为完整事实予以公布。名称与任务描述在可被文献记录的限度内予以保留,而性能数值则暂时从正文中隔离,直至出现适当的来源。 科学隔离:在证据完备之前保护结论 这就是本书所说的科学隔离。它并非判定该观点为假,也不是对来源或产品的指控,而是一项编辑决定,用以防止一项不完整的主张在文本中以事实的身份发挥作用。 若出现相匹配的一手来源或充分的独立核验,某项主张可以被重新开启;而若确立它的条件不能满足,它也可以始终留在结论之外。如此,科学隔离便成为保护知识免于草率的机制,而不是排斥观点的工具。 在此基础上,对证据的严格把控并不会使内容变得贫瘠,正如呈现一部题材广泛的著作的意愿,也不能成为混淆确定性等级的理由。本书可以保留一幅内容丰富的应用、产品与研究图景,同时在以下几者之间划出清晰的界线:
- 我们基于适当证据所知道的;
- 我们在特定条件与语境下所知道的;
- 当事方对自身的说法;
- 以及仍有待充分证实的内容。
科学上的严谨并不会让知识变得不那么广阔;相反,它让知识的边界更加清晰。当读者知道某一陈述从何而来、有什么支撑它、其适用范围止于何处时,审慎便不再显得是软弱的标志,而成为赋予信心以意义的根基。
3. 从模型准确率到农业决策的质量
一个人工智能模型可能在测试中取得很高的结果,尤其是当它在干净、完整且与其训练数据相似的数据上接受评估时。然而,仅有这种技术上的成功并不能保证它会在实践中改变某项农业决策。该模型可能无法在田间可用的手机或设备上运行,可能需要持续联网,可能在挽救作物的时机已过之后才发出警报,也可能在图像不清晰或数据不完整的情况下仍给出一条自信的建议。在这些情形下,那个数值结果依旧引人注目,但其实际价值有限。 反过来,另一个模型在测试中的表现或许略低,却更轻便易于运行,更能在田间条件下工作,并对自身知识的限度更为坦诚。如果数据不足,它不会给出断然的建议,而是要求补充一张图像或一次测量,或把该案例转介给农业专家。如果它察觉到风险,就发出早期预警,使农民在干预窗口关闭之前有足够时间进行巡查与行动;所谓干预窗口,即处置或预防仍然可行且有效的时段。因此,这个模型可能更有用,即便它在测试结果中并非得分最高。 来看一个实际例子:某个诊断植物病害的模型也许能以很高的准确率识别出感染,却只有在症状明显、病害已在大范围内扩散之后才检测到它。在实践中,它可能不及一个准确率略低、却能捕捉早期迹象、说明自身置信水平、并把可以观察监测的情形与需要人工紧急查验的情形区分开来的模型。前者在问题发生很久之后把它描述得很好;后者则在决策仍能影响结果之时帮助人们作出决定。 这并不意味着贬低准确率的重要性,或以易于运行为借口接受一个薄弱的模型。技术性能仍是必要条件,在可能影响作物、动物或人员安全的决策中尤其如此。但农业价值不是由单一数值产生的;它产生于一个综合系统,该系统兼具可接受且有实证支撑的准确率、契合语境的数据、可靠的运行、及时的预警、可理解且可执行的建议,以及在证据不足时负责任的弃答。因此,最好的模型并不总是在实验室里知道得更多的那个,而是能在决策仍可改变结果的地点与时刻,帮助人们作出更稳妥决定的那个。 为此,应区分五个层次的成功:
| 评估层次 | 农民的直接问题 | 这种成功在实践中是什么样子? | 仅凭这种成功不能证明什么? |
|---|---|---|---|
| 1. 模型在测试中的准确率 | 在用于测试的数据中,该模型能否正确识别病害、预测产量或估算灌溉需求? | 例如,它能以很少的错误区分健康植株与受感染植株,或其产量预测在测试中接近实际值。 | 它不能证明在另一个农场、另一个品种,或另一个季节、天气与光照条件下使用时,仍能取得同样的表现。 |
| 2. 它对农场条件的适应性 | 该模型是否在与我农场条件相似的新数据上试用过,而不只是在它学习所用的数据上? | 它在未纳入训练的农场、地区或季节上接受测试,或在目标作物与环境中经过本地试验,并保持可接受的性能水平。 | 它不能证明应用程序、设备或传感器会每天稳定运行,或能在网络信号弱、停电与数据匮乏的条件下运行。 |
| 3. 系统在运行中的表现 | 数据、警报与建议是否完整、并在我需要的时刻送达? | 传感器与应用程序稳定运行,病害或灌溉警报在干预时机过去之前送达,并在连接或服务失效时具备安全回退。 | 它不能证明农民理解了该警报、信任了它,或能以现有的时间、资源与设备执行该建议。 |
| 4. 农业决策的改善 | 该建议是否帮助农民采取了比惯常做法更好的行动? | 警报促使农民提前巡查可疑区域,或调整灌溉的时机与水量,或避免一次不必要的处置,或把敏感案例转介给专业人员。 | 它本身不能证明作物、利润或资源消耗有所改善;决策可能是正确的,但其效果可能受天气、投入品短缺或执行延迟等其他因素的阻碍。 |
| 5. 对农场的实际影响 | 使用该系统之后,农民真正在意的那项结果是否改善了? | 与一条清晰的基线相比,损失或总生产成本下降,或作物品质与产量稳定性提高,或水与能源消耗减少,或安全风险降低。 | 它不能证明这一效果会在每个农场、每个季节自动复现;结果可能因作物、气候、经营规模、价格与使用方式而不同。 |
这些层次不是同一种成功的不同叫法,而是同一条链条上的环节。一个模型可能是准确的,却不适应当地环境;它可能适应该环境,服务却可能失效;服务可能运转,建议却可能来得太晚或依旧含糊;而农民可能作出了更好的决策,其效益却在一个异常的季节里显现不出来。因此,对技术的任何判断,都必须沿着整条路径走完才算完整:从预测的正确性,到它对该农场的适应性,再到它的及时送达,接着到它所改变的决策,最后到它在田间与在农民账目中所产生的效果。 证据链条可以表示如下: 有效的数据 ↓ 适当的模型 ↓ 独立核验 ↓ 可靠的运行 ↓ 可理解的建议 ↓ 可行且及时的行动 ↓ 农业结果 ↓ 经济、环境与社会影响 任何主张都无权跳过缺失的一环。如果可得证据涉及的是模型性能,结论就要在这一限度内表述。如果证据是一次短期田间试验,就不能把它呈现为跨季节的稳定运行。而如果产量发生了变化,在考虑天气、面积、投入品与基线之前,不得把这一变化归因于该系统。
4. 不同任务对应不同指标:所报告的数字意味着什么?
研究与产品页面中充斥着“高准确率”“先进性能”“优于以往模型的结果”等表述。然而一个数字,无论看上去多么耀眼,都不会自我解释。在我们追问准确率有多高?之前,应当先问一个更靠前的问题:所测量的是什么任务,其中可能出现何种错误? 人工智能可能被用来回答完全不同的问题:
- 该植株是受感染的还是健康的?
- 果实或昆虫位于图像中的什么位置?
- 叶片受害部分的面积是多少?
- 季末的预期产量是多少?
- 机器人能否在不损伤果实的情况下将其采摘下来?
- 灌溉系统是否确实减少了用水量?
这些任务不能用同一把尺子来衡量。也不允许把它们的数字放进同一张表格,按从高到低对各项应用排序,仿佛它们是在同一场测试中竞争。每项指标只照亮性能的一个方面,而让其他方面留在阴影之中。 读者不必记住这些指标背后的数学公式。重要的是理解三件事:该指标回答的是什么问题,它可能掩盖何种错误,以及它与农业决策之间有何关联。 其一:当任务是对某种状态进行分类时——植株是患病的还是健康的? 假设某个应用程序接收一张植物叶片的图像,并把它归入两种状态之一:“患病”或“健康”。这看似简单,但该模型可能产生四种不同的结果:
| 实际状态 | 模型的判断 | 该结果对农民意味着什么? |
|---|---|---|
| 植株患病 | 判为患病 | 一次正确的检出,可能促成巡查或早期干预 |
| 植株患病 | 判为健康 | 一次被模型漏检的感染,病害可能继续扩散 |
| 植株健康 | 判为健康 | 一次正确的排除,可能使农民免去一次不必要的巡查或处置 |
| 植株健康 | 判为患病 | 一次误报,可能耗费时间或导致不必要的巡查或处置 |
这四种结果是推导大多数分类指标的基础。各项指标之间的差别并非统计学上的奢侈品;它们各自审视的是错误的不同侧面。 总体准确率:模型答对了多少? 总体准确率是全部预测中正确预测所占的比例,无论是被正确检出的患病病例,还是被正确排除的健康病例。 如果模型检视一百张图像并答对其中九十张,其总体准确率为 90%。这个数字看似清楚,但当某一类别的数量远多于另一类别时,它可能变得具有误导性。 例如,假设我们有一百张图像:九十五张显示健康植株,仅五张显示患病植株。如果一个薄弱的模型宣称所有图像都是健康的,它将在九十五个案例中判断正确,从而得到 95% 的总体准确率。然而它连五例感染中的一例都没有检出。 因此总体准确率回答的是这样的问题: 模型总体上答对的频率有多高? 但它本身并不能回答本例中更重要的问题: 模型能够检出多少真实的感染? 召回率/灵敏度,即检出患病病例的能力 召回率,又称灵敏度,衡量的是在所有真正患病的病例中,模型成功检出的比例。用农民的话来说,问题是: 如果病害确实存在,系统检出它、而不是让它在无警报的情况下蒙混过关的可能性有多大?当漏掉一例患病病例极为危险时——例如面对一种迅速扩散的病害、畜群健康失调的早期征兆,或一种若及时发现即可控制的有害生物——召回率尤为重要。高召回率意味着模型漏掉的患病病例更少。但这并不必然意味着它发出的每一条警报都是正确的;系统可能通过发出大量警报来提高召回率,其中有真有假。 特异度,即排除健康病例的能力 特异度衡量的是模型正确判定为健康的健康病例所占的比例。这里的问题是: 如果植株是健康的,系统不把它误判为患病的概率有多大? 当误报代价高昂时,特异度就很重要,例如派出团队巡查、打断生产作业、采集实验室样品,或考虑采取一次不必要的处置。 但仅有高特异度并不能保证模型能检出患病病例。它可能在发出警报上极为保守,从而减少了误报的数量,代价却是漏掉真实的感染。 精确率:多少条阳性警报是正确的? 在阿拉伯语中,这一指标有时被译作 iḥkām(“精审”),但该术语对读者未必清楚。它的实际含义比这个名称所暗示的更为简单: 在系统判定为患病的全部病例中,有多少是确实患病的? 如果系统发出十条警报,而巡查显示其中只有六条是正确的,那么它的精确率并不完美:有四条警报是误报。当跟进一条警报代价高昂、或可能导致一次敏感干预时,这一指标就很重要。如果每条警报都要求进行实验室分析、专业人员到访,或停下部分生产线,那么仅仅捕捉到大多数患病病例还不够;系统还必须避免让使用者淹没在误报之中。至此,精确率与召回率之间的区别便清楚了:
- 召回率追问的是: 在实际患病的病例中,模型检出了多少?
- 精确率追问的是: 在模型判定为患病的病例中,有多少条警报是正确的?
一个模型可能在一侧表现强劲而在另一侧表现薄弱;因此,指标的选择必须与农业语境中错误所带来的现实后果相挂钩。 F1 分数:模型能否在检出感染与警报正确性之间取得平衡? F1 分数把召回率与精确率合并为一个数值。当模型同时做到以下两点时,它就会上升:
- 检出相当比例的患病病例。
- 避免发出大量误报。可以把它看作衡量“不漏掉感染”与“不夸大预警”之间平衡的简明分数。如果模型检出了每一例感染,却发出许多误报,其 F1 分数就不会达到应有的高度。反之,如果它为数不多的警报都是正确的,却漏掉了许多感染,情况也是一样。然而把两个维度合并进一个数字是有代价的:它可能掩盖这样一个事实,即某一类错误比另一类更危险。在一种迅速扩散的流行性病害中,漏掉一例感染可能比把若干健康病例送去巡查危害更大。但在一项成本高昂或风险很高的干预中,误报本身可能就成为严重问题。因此,F1 分数并不表明该模型自动就是“安全的”或“适用的”;它只表明该模型在两种性能之间达到了某种数学上的平衡。农业中所要求的平衡,取决于错误的后果与决策的性质。
混淆矩阵:一张显示模型何处正确、何处错误的表格 尽管名称令人困惑,混淆矩阵并不是一道数学谜题,也不是像总体准确率那样的单一指标。它只是一张汇总上述四种结果的表格:
- 被正确检出的患病案例。
- 被模型漏掉的患病案例。
- 被正确排除的健康案例。
- 被错误判定为患病的健康案例。混淆矩阵的价值在于,它不会把错误隐藏在一个汇总数字背后。两个模型可能取得相同的总体准确率,但其中一个漏掉了危险的病害,另一个则发出大量虚假警报。汇总数字可能让它们看起来相似,而错误表格却揭示出对农民而言至关重要的差异。因此,可以与该术语并用的更简单名称是:
混淆矩阵:一张显示正确答案与错误答案类型的表格。 在诊断中我们如何选择合适的指标? 并不存在一个在所有情形下都最优的指标。选择取决于农业问题本身,以及每一类错误所带来的后果。
- 如果漏检病害可能导致大范围扩散或难以逆转的损失,召回率(Recall) 就成为高优先级指标。
- 如果对每一次警报作出响应代价高昂,或可能导致不必要的干预,精确率(Precision) 与特异度(Specificity) 就更为重要。
- 如果类别不均衡,仅凭总体准确率并不足够。
- 如果我们想要一个概括“检出案例”与“警报正确性”之间平衡的比较性数字,可以使用 F1,同时回溯查看错误的细节。
- 如果我们想确切知道模型在何处出错,就要借助混淆矩阵。
应用不得仅凭这一评估,就从初步识别跨越到敏感的处置建议。模型在区分可疑图像上的成功,本身并不能确立因果诊断的正确性,也不能确立所提出干预措施的适宜性。仍可能需要田间查看、实验室分析、专家复核,以及参照官方标签与当地法规。 第二:当任务是确定某一对象的位置或勾画其边界时 分类通常回答这样的问题:“图像中是否有昆虫?”但有些应用需要更精确的信息:
- 昆虫确切位于何处?
- 图像中出现了多少果实?
- 杂草在作物行间的位置是什么?
- 叶片受影响的面积有多大?
- 健康部分在哪里结束、受损组织从哪里开始?这里我们就从分类转向两项更精细的视觉任务:
- 检测(Detection): 系统在一个框或大致区域内标出对象的位置,例如为每个果实画出一个框。
- 分割(Segmentation): 系统勾画出对象或区域的精确边界,例如更细致地标出叶片上病斑的面积。由于问题不再仅仅是“对象是否存在?”,我们就需要一些指标,用来将对象的位置与边界同参考图像中由专家确定的正确位置进行比较。
交并比(IoU):预测区域与正确区域的吻合程度如何? 假设一位专家在叶片上勾画出病斑的正确边界,随后模型画出它预测代表同一病斑的区域。交并比这一指标对两块面积进行比较:
- 专家所标识的区域与模型所标识的区域之间的共有部分。
- 两个区域合在一起所覆盖的总面积。真实重叠越大、多出或缺失的部分越小,该指标的取值就越高。它可以从视觉上这样理解:
- 两个区域完全重叠,意味着在确定边界方面表现理想。
- 部分重叠,意味着模型一部分判断正确、另一部分判断错误。
- 没有重叠,意味着模型标出了一个完全不同的位置。但该指标取值高,并不能回答这样一个问题:所标出的区域是否精确到足以完成某项特定的农业任务。它也许适合用于估计受影响区域的范围,却不足以引导一只需要更高空间精度的机械臂。
Dice 系数:两块面积之间的相似程度如何? Dice 系数同样衡量模型所标出的区域与专家所标出的参考区域之间的相似程度。它在概念上与交并比相近,即便计算方法有所不同。读者不必记住这两个指标之间的数学差异。重要的是,两者都试图回答这样一个问题: 模型在多大程度上勾画出了正确的区域,既没有遗漏重要部分,也没有添加本不属于该区域的部分?Dice 系数在图像分割任务中频繁出现,包括对组织、叶片、果实或受影响区域的识别。但它仍然只是一个视觉相似度指标,并不是将建立在该分割之上的农业决策取得成功的完整证据。 平均精度均值(mAP):系统在寻找对象并确定其位置方面表现如何? 在评估图像中的目标检测系统时,常使用 mAP,例如检测果实、昆虫、杂草或动物。它是一个综合指标,概括了在多个类别或多种评估条件下的检测质量。与其深入其计算公式,不如这样理解它的作用: 系统是否找到了所需的对象,是否避免了检出并不存在的对象,是否以与正确位置可接受的重叠程度确定了它们的位置?mAP 的取值不应被读作直接的“农业成功率”。如果一个模型在一组图像中检测果实时取得了很高的数值,这并不意味着机器人会成功采摘同样比例的果实。视觉系统可能把果实看得很清楚,随后机械臂却可能够不到它,或抓握过紧,或耗费不经济的时间,或无法在田间的光照、扬尘与枝条晃动条件下工作。在机器人系统中,视觉只是第一个环节,其后还有其他环节:看到目标 ← 确定其位置 ← 规划动作 ← 到达目标 ← 执行动作 ← 避免损伤 ← 在可接受的时间与成本内完成任务。因此,必须把视觉精度与完整农业作业的成功区分开来。 第三:当任务是预测一个数值——产量、价格或需求时 在某些应用中,模型并不把植株分类为“受感染”或“健康”,也不在图像中寻找果实;它预测的是一个数值,例如:
- 预期的产量。
- 作物的需水量。
- 某一时期的预期价格。
- 某种产品的需求量。
- 剩余的贮藏寿命。
- 所需的饲料量或能量。在这些情形中,我们需要知道模型预测的数值与实际发生的数值之间差异有多大。计算这一差异有若干方法,因为每种方法揭示的侧面各不相同。
平均绝对误差(MAE):模型平均误差多大,以农民能理解的单位表示? 如果模型预测产量为每公顷 5.5 吨,而实际产量为 6 吨,那么这一情形下的误差就是每公顷半吨。平均绝对误差把所有情形中这些误差的绝对大小相加,不考虑模型是高估还是低估,然后计算其平均值。它的主要优点在于以变量本身的单位表示:
- 预测产量时为吨/公顷。
- 预测价格时为里拉/公斤。
- 预测耗水量时为立方米。
- 预测贮藏寿命时为天。正因如此,它是最易于转化为一个实际问题的指标之一:
如果我依赖这个模型,它的预测平均会与现实相差多远?但平均值可能掩盖少数模型误差极大的情形;这正是需要另一个指标的地方,一个赋予那些误差更大权重的指标。 均方根误差(RMSE):是否存在不应被平均值掩盖的大误差? RMSE 同样衡量预测误差,但它对大误差的惩罚重于小误差。如果模型的大多数预测都接近现实,却在某些季节或地区严重失准,那么这些失准的影响会在该指标中更明显地显现出来。它的实用思路是: 我们不想只知道平均误差,我们还希望大误差不要像普通情形那样被轻易放过。当误差的大幅跳变会影响决策时,这一点就更为重要。产量预测中有限的误差也许尚可应对,但较大的偏差可能导致签订不合适的销售合同、贮藏能力不足,或对运输与融资作出错误估计。与 MAE 一样,RMSE 以变量本身的单位表示,但其数值在更大程度上受到大误差情形的影响。 平均绝对百分比误差(MAPE):相对于实际值的百分比误差是多少? MAPE 把误差换算成百分比,这使它颇具吸引力,也便于呈现。“平均误差达到百分之多少”这样的表述,似乎比一个在不同作物与地区间可能各异的单位数字更容易理解。但当实际值非常小或接近零时,该指标可能变得具有误导性。一个简单的数值误差,在除以一个很小的数值后,可能变成一个巨大的百分比,而这一百分比并不反映该情形的实际意义。因此,在依赖它之前,我们应当追问:
- 实际值是否可能接近零?
- 百分比真的是理解这一误差最合适的方式吗?
- 是否同时报告了以原始单位表示的误差大小?
- 该百分比是否掩盖了作物、地区或季节之间的重要差异?百分比易于阅读,并不意味着它总是合适。
决定系数(R²):模型能够解释结果中多大比例的变异? 决定系数衡量的是:在所使用的数据与评估方法范围内,模型能够在多大程度上解释观测值中的变异。假设产量因多种因素而在不同地块与季节间存在差异。模型试图依据输入其中的数据——如天气、土壤、品种与农事操作——来解释这一变异的一部分。决定系数显示的是,在该测试框架内,模型相较于一个统计基准能够表示多少方差。但这一指标常被误读。如果一项研究报告称,在其所使用的评估设定中 R² 达到 0.92 [SRC006],那么把它转述为下面这句话是不成立的: “该系统的准确率为 92%。”这两句话的含义并不相同。R² 的取值并不直接告诉我们:
- 模型误差是多少吨或多少公斤。
- 这些误差在经济上是否可以接受。
- 它在干旱季节或热浪中是否成功。
- 它在另一个地区是否能保持其性能。
- 预测是否及时送达,从而使决策仍有更改的余地。
- 它是否优于历史平均值,或优于一条更简单、成本更低的规则。因此,最好把决定系数与一个以可理解单位显示误差大小的指标(如 MAE 或 RMSE)一并阅读,同时结合对数据、地点、季节与测试方法的清晰说明。
指标的实用小结
| 任务类型 | 指标 | 它回答的简单问题 | 需要注意什么 |
|---|---|---|---|
| 对植物或动物进行分类 | 总体准确率 | 模型总体上正确分类了多少案例? | 当健康案例远多于患病案例时,它可能显得很高 |
| 病害检测 | 灵敏度 | 在实际患病的案例中,它检出了多少? | 它的提高可能以更多误报为代价 |
| 识别健康案例 | 特异度 | 在健康案例中,它正确识别了多少? | 单独来看,它并不能证明模型检出病害的能力 |
| 评估警报的正确性 | 精确率 | 在所有病害警报中,有多少是正确的? | 它可能很高,却漏掉了若干感染案例 |
| 平衡检出与警报精确性 | F1 | 模型是否在检出病害与减少误报之间保持了平衡? | 它掩盖了两类错误在代价上的差异 |
| 分析分类错误 | 混淆矩阵 | 模型在哪里判断正确、在哪里漏掉病害、在哪里发出误报? | 它并不是对农业实用性的最终判断 |
| 定位图像中的对象 | mAP | 系统是否在各项测试中找到目标并以可接受的方式定位它们? | 它并不能证明机器人或整体农业作业的成功 |
| 比较图像中的两个区域 | IoU | 模型标出的区域与正确区域重叠了多少? | 单凭它无法判定精度是否足以满足预期用途 |
| 勾画受影响区域的边界 | Dice | 预测区域与参考区域的相似程度如何? | 它衡量的是视觉相似度,而非基于它所作决策的下游后果 |
| 预测产量或价格 | MAE | 以可理解的单位衡量,预测误差平均有多大? | 它可能掩盖某些大误差 |
| 揭示大误差 | RMSE | 是否存在应被赋予更大权重的大幅偏差? | 它可能受少数极端情形的严重影响 |
| 以百分比表示误差 | MAPE | 误差平均占实际值的多大比例? | 在接近零时它变得不稳定或具有误导性 |
| 解释数值中的变异 | R² | 在本次评估中,模型能够解释多少变异? | 它不是准确率百分比,也不显示以农业单位计的误差大小 |
若数字不适配决策,再正确也不够 在理解指标之后,更重要的问题依然存在:该评估衡量的是不是农民真正需要的那项属性? 产量预测可能接近现实,却在购买投入品或安排贮藏与营销合同的时机已过之后才送达。视觉模型可能高效地检出某种害虫,却无法区分只需监测的情形与需要紧急干预的情形。自动化系统可能准确确定果实的位置,其机械臂却可能无法在不损伤枝条的情况下够到它。灌溉系统可能减少每公斤产量的用水量,却并未减少从水源地的总取水量。因此,在阅读任何技术指标之后,都应当提出以下问题:
- 这个数字究竟衡量了什么任务?
- 测试是在什么数据、什么环境下进行的?
- 这个汇总数字掩盖了哪些类型的错误?
- 输出是否在干预窗口关闭之前送达?
- 系统的表现是否优于一个更简单的替代方案?
- 农民是否能够理解该建议并付诸实施?
- 在计入成本与风险之后,收益是否依然存在?
它衡量的是图像分类、目标定位、数量预测,还是一项完整农业作业的成功?
这些数据与环境是否代表该系统将被使用的作物、地区、季节与设备?
更严重的问题是漏掉案例、发出误报,还是建议延迟?
在灌溉、防治或收获的时机已过之后才出现的正确预测,是迟到的知识,而不是有用的决策。
例如例行巡查、一条清晰的农艺规则、一个历史平均值,或一项成本更低的咨询服务。
如果建议含糊不清、需要无法获得的资源,或忽视了当地的限制条件,技术上的准确性并不会转化为收益。
包括设备、网络连接、维护、订阅、数据录入、培训以及潜在错误的代价。
总之,指标不是要求读者背诵的晦涩公式,也不是赋予技术自动合法性的奖章。它们是回答特定问题的工具。一个有辨别力的读者,不会在弄清衡量了什么、遗漏了什么、谁承担错误的代价,以及那样的性能能否跨越测试屏幕与田间有用决策之间的距离之前,就被一个高数值所眩惑。
5. 成熟度阶梯:从一项被声称的功能到已被证明的农业影响
技术写作有时会把一款产品的状态简化为两个词:“具备”或“不具备”。但在构想与农业影响之间存在许多层级,每一层级都有与之相称的证据。 本书提出一个用于理解成熟度的编辑性阶梯。它并不是一项正式的监管标准,而是帮助读者防止从“功能存在”跃升为“影响主张”的工具。
| 层级 | 证据证明了什么? | 它尚未证明什么? |
|---|---|---|
| 1. 声明的用途 | 该机构声称系统是为某项特定任务设计的 | 该功能已被实现或能够运行 |
| 2. 已实现的组件 | 存在能完成部分任务的代码、界面或原型 | 它能在技术演示或实验室之外运行 |
| 3. 内部性能 | 模型在开发者或该研究的数据上完成了评估 | 其性能能够迁移到独立数据上 |
| 4. 外部验证 | 在模型构建过程之外的数据上或由外部方进行了测试 | 它能在日常农业运行中持续有效 |
| 5. 田间试验 | 在真实农场或真实价值链中,在已知时长与已声明条件下使用过 | 它能跨季节、跨地点、跨用户持续表现良好 |
| 6. 常态化运行 | 在具备监测、支持、恢复与明确责任的服务中运行 | 它实现了净经济收益或净环境收益 |
| 7. 已测量的影响 | 相对于合适的基线,某项农业、经济或安全结果发生了改变 | 该影响会在每一种情境中重现 |
要求一个研究模型提供它并未主张的商业运行证据,这并不公平;同样,商业产品把原型模型的结果当作田间影响的证明,也是不可接受的。 一个系统可能在某一层级上先进,而在另一层级上滞后。它的软件架构可能已经成熟,而农业证据仍处于初步阶段。田间试验可能取得成功,而数据权利或维护计划仍不成熟。因此,当各维度状况不同时,成熟度就不能被压缩为单一分数。 三个问题可以揭示不正当的跃升 在阅读任何应用说明时,请追问:
- 证据实际确立的最高层级是什么?
- 营销表述跃升到了哪一层级?
- 两者之间缺失的环节是什么?
如果资料来源确立的是某一组件的存在,而表述谈的却是减少损失,那么所需要的不是改进措辞,而是能够跨越那段尚未确立的距离的证据。
6. 区域可迁移性的限度:在不同农业环境之间移植模型
把一个农业人工智能模型的结果限定在其产生时的测试条件之内,看似过于谨慎,但当人们提出这个实际问题时,这种谨慎的重要性便显现出来:当算法离开训练与测试环境,被用于一块在气候、土壤、作物与农事操作上都不同的田地时,它还能保持其性能吗? 模型学到的不是抽象意义上的“农业”;它学到的是来自特定土壤、气候、品种、设备与测量方法的数据之内的统计关系。当其中某一要素发生变化时,模型未必失效,但其此前的性能就失去了作为直接承诺的效力,退回为一个需要重新核验的假设。
| 差异维度 | 发生了什么变化? | 潜在影响 | 依赖之前需要做什么 |
|---|---|---|---|
| 土壤与气候 | 湿润温带土壤 ← 干旱或盐渍土壤 | 光谱反射率与响应曲线发生变化 | 本地取样、校准与地面核验 |
| 经营规模 | 大型同质农场 ← 小型混合经营 | 同质性假设被削弱 | 重新训练或收窄使用范围 |
| 网络连接质量 | 稳定网络 ← 间歇性连接 | 云端推理失败,数据变得陈旧 | 安全的本地模式与最近一次同步的记录 |
| 品种与遗传类型 | 少数商业品种 ← 本地或传家品种 | 症状或外观落在训练类别之外 | 设置“未知”类别与升级转介路径 |
| 相机与传感器 | 符合指定标准的设备 ← 更便宜或更老旧的设备 | 光照、分辨率与校准发生偏移 | 在实际使用的设备上测试 |
| 法规与登记 | 一个司法辖区 ← 另一个司法辖区 | 某项建议未获登记或在当地被禁止 | 查阅标签并咨询主管部门 |
| 语言与术语 | 标准化术语 ← 作物与有害生物的本地名称 | 在推理之前就误解了问题 | 用使用者的语言进行理解度测试 |
| 季节与周期 | 一到两个季节 ← 多年际变异 | 在异常年份的性能未经测试 | 跨季节核验与漂移监测 |
| 工作方式 | 受过培训的专业人员 ← 经验不同或时间受限的使用者 | 输入质量与响应方式发生变化 | 可用性测试与适当培训 |
| 市场与机构结构 | 干预手段可得、融资渠道健全 ← 替代选择有限 | 一条正确却无法实施的建议 | 分析实施能力与成本 |
这张表不应被读作一份禁令清单,而应被读作一份测试计划。训练环境与使用环境之间的差距越大,在广泛采用之前进行有限本地试验的必要性就越强。 采用前的本地核验计划 该计划可包括:
- 选取能够代表目标地块、品种与条件的样本。
- 在人们实际使用的设备与网络上进行测试。
- 把系统与当前做法或一条合适的简单规则进行比较。
- 检验其在稀有类别与陌生情形中的表现。
- 提供“未知”类别或一种拒答机制。
- 界定哪些情形需要专业人员复核。
- 在整个生长季过程中监测性能变化。
- 记录停机、损坏的读数与人工干预。
- 测量农业结果,而不仅仅是技术指标。
- 当品种、设备、数据来源或监管环境发生变化时重新评估。
要求进行本地核验,并不意味着该技术在其开发地之外没有价值;而是意味着,它的价值必须在人和土地将承担决策后果的地方得到证明。
7. 错误不是一个数字:谁为错误的决策买单?
人工智能的错误在含义与后果上并不等同。两个系统的出错率可能相同,但其中一个只造成有限且可以补救的不便,另一个却可能带来作物损失、资源浪费,或对食品、动物或工人造成风险。因此,仅仅追问:模型出错了多少次? 是不够的。我们还应追问:它朝哪个方向出错、在什么时候出错、随后作出了什么决策、谁承担了代价? 在实验室里,一次错误不过是表格中的一个案例。在农场上,它可能变成用错了地方的水、一次未被发现的病害、一片无谓喷药的作物、一批延误冷却的货物,或一位在干预窗口关闭之后才收到警报的工人。因此,风险不能仅以错误的数量来衡量,还要看其后果的分量。两个模型在总体准确率上可能相近,而在实用价值上却截然不同。前者可能发出过多警报,却极少漏掉危险案例;后者可能不那么扰人,却有时在沉默代价高昂的时刻保持沉默。哪一个更好?汇总数字本身无法回答;答案取决于任务的性质、查验的成本、延误的危险、决策的可逆程度,以及人工介入的能力。 错误可能产生于模型,也可能由周边系统造成 把全部错误归咎于“算法”很容易,但数字化农业系统是一条相互衔接的链条: 传感器或图像 ← 传输的数据 ← 模型对其进行分析 ← 警报或建议 ← 使用者对其进行解读 ← 动作被执行 ← 结果在田间显现。算法可能是正确的,而传感器读数却陈旧或有缺陷。分析可能是正确的,而应用却以错误的计量单位将其显示出来。合适的建议可能在干预窗口关闭之后才抵达农民的手机。使用者可能把警报理解为一道确定的指令,而它其实只是一个需要查验的初步信号。事实上,错误甚至可能发生在模型已完全退出场景之后。系统可能向灌溉设备发送了正确的指令,但连接故障导致该指令被重复执行。数量可能以升/公顷记录,而另一个程序却按不同单位解读它。系统可能依赖一个已有一段时间未经校准的传感器所给出的湿度读数,从而在错误的信息之上构建出一条合乎逻辑的推断。因此,应当区分三个层次:
- 模型错误: 它在分类、估计或预测上出了错。
- 决策错误: 信息不充分,或对信息的解读不适合该情形。
- 系统错误: 数据、软件、硬件、模块或执行路径出现故障,把一个正确或可接受的结果变成了错误的动作。这种区分是必要的,因为每个层次都需要不同的补救措施。改进模型并不能修复有故障的传感器,增加数据并不能弥补含混的界面,提高准确率也无法阻止一条指令因软件故障而被执行两次。
假阳性:在问题并不存在时发出存在问题的警报 当系统宣称存在某种病害、有害生物、故障或风险,而该情况实际上并不存在时,就出现了假阳性。更通俗地说:系统发出了警报,但随后的查验并未发现这样的问题。 这类错误的后果可能有限。例如,如果应用建议农民前往田间附近某处查验一个可疑斑点,而查验快速、安全、成本低廉,那么其损害也许不过是一些时间与精力。在这种情况下,若有助于避免漏掉严重案例,某种程度的过度警报或许是可以接受的。但虚假警报并不总是如此简单。它越是接近自动执行,或响应它的代价越高,其后果就越严重。例子包括:
- 视觉模型把营养缺乏的症状解读为真菌病害,促使使用者考虑一种并不针对真正病因的处置方案。
- 灌溉系统把一个不准确的读数解读为水分胁迫,并建议对仍含有充足水分的土壤进行灌溉。
- 动物监测系统就一种并不存在的健康状况反复发出警报,消耗工人或兽医的时间,并导致对某头动物的不必要隔离。
- 冷链系统把有缺陷传感器给出的异常读数解读为真实的温度上升,从而引发一次查验、停机或代价高昂的运行干预。
- 视觉系统在阴影中或植株残体间检出一株杂草,随后把其位置发送给除草机械或点喷单元。因此,同一条警报的后果会随其后发生的事情而变化。如果它只导致一次人工查验,或许尚可容忍。但如果它直接启动了水泵、改变了温室内的气候、施用了化学品,或把一批货物排除在外,那么虚假警报就成为经济、环境或安全方面潜在损害的来源。其危害也不局限于每一起单独事件。反复出现的虚假警报会造成所谓的警报疲劳:使用者习惯了听到警报,随后开始推迟处理或干脆忽视它。到那时,系统可能在其警报正确且重要的时刻到来之前,就已经失去了可信度。
假阴性:系统未能发现的真实问题 假阴性是指问题确实存在,但系统未能检测到,或将该情形判定为正常。直白地说:本有一个值得关注的问题,系统却保持沉默。 这类错误可能比误报更危险,尤其是在损失会随时间累积的情况下。例子包括:
- 应用程序未能检测到的植株早期感染,任其持续发展,从少数几株蔓延到更大范围。
- 在图像中显示不清、或未被纳入模型训练数据的害虫,于是系统将其判定为正常状况。
- 系统未能察觉水分胁迫的发生,致使植株越过了本可以以有限代价加以纠正的阶段。
- 监测系统未能捕捉到动物行为的异常变化,从而延误了兽医检查。
- 由于传感器故障或数据传输中断,系统未记录到某批货物温度的真实上升,于是该批货物未经复核便进入了链条的下一环节。
- 预测性维护系统未能检测到水泵或制冷机组内部正在形成的故障,于是设备继续运行,直至发生更严重的停机。这类错误的危险在于:使用者可能根本不知道系统出了错。误报会引起人们的注意,而模型漏掉的情形却可能一直隐蔽,直到其后果显现。因此,错误的可检测性是风险评估的一部分,而不仅仅是其发生概率。在漏检后果极其危险的应用中,可以把系统设定得更敏感,即更倾向于把可疑情形转交检查,即使这会导致误报增加。但这一选择并非自动正确;必须核实人工检查能力能够消化这些警报的数量,否则提高敏感度就会变成拥堵,反而使系统失去其用处。
时机错误:正确的答案,却在决策窗口关闭之后才到来 模型对问题的类型和规模判断可能是正确的,但其建议到达时,行动已不再可能或不再值得。这就是时机错误:问题不仅在于信息是否正确,还在于它落在农事时间表的哪个位置上。农业决策运行在一个干预窗口之内:即行动能够改变结果的有限时段。窗口关闭之后,再好的建议也可能只是对已发生之事的描述,而不再是改变它的手段。例子包括:
- 在灌溉完成之后才预报降雨,此时该预报已无法节水或节能。
- 在感染越过可通过本地检查或有限干预加以遏制的阶段之后才检测到它。
- 在气温已进入临界区间之后才发出霜冻警报,而防护措施本需要时间来准备和启动。
- 在安排劳动力、包装或运输的机会已经错过之后,才预测果实成熟度。
- 在货物已驶离本可修复故障或改变路线的那一节点之后,才检测到制冷故障。
- 在销售合同已经签订、或储存与营销的可选方案已经关闭之后,才提供价格预测。因此,评估研究仅仅追问“预测是否正确?”是不够的。它还应当追问:“它提前事件多久到来?这一提前量是否足以完成相应行动?”一个准确度略低、却能提供可据以行动的早期预警的模型,可能比一个更准确、却在行动机会已过之后才给出结果的模型更有价值。
量级错误:行动方向正确,但用量不当 在某些情况下,系统识别出了正确的需求,却在响应的量级上出错。它可能识别出作物需要灌溉,却把用水量估计得过多或过少。它可能判定需要通风或降温,却建议了不符合实际条件的幅度或时长。这就是量级错误:决策的方向正确,而其数量、强度或持续时间不正确。这类错误的严重性体现在许多应用之中:
- 灌溉: 过多可能浪费水和能源,并加剧淋溶或根系窒息;过少则可能在已实施灌溉的情况下仍未解除胁迫。
- 施肥: 建议的养分可能是合适的,但施用的数量或时机可能并不适合土壤或作物所处的生育阶段。
- 温室: 降温需求可能确实存在,但骤然或过久的变化可能造成另一种形式的胁迫,或增加能耗。
- 动物饲喂: 调整日粮可能是有理由的,但调整的幅度不应脱离生产状态、健康状况以及日粮的完整配比来考虑。
- 储存与干燥: 降低水分或温度可能是必要的,但运行时间过长或过短都可能影响品质与成本。当决策涉及化学品、兽药或休药期时,风险更高。在这些领域中,绝不可仅凭模型的估计就将其转化为一个剂量或一道执行指令。必须参照官方标签、本地登记信息、主管部门的说明以及有资质的专业人员意见,并遵守剂量、采收前间隔期、再进入间隔期及其他具有约束力的安全要求。
情境错误:在一地正确、在另一地错误的信息 并非所有错误都源于模型薄弱。有时信息在其产生的环境中是正确的,但被传递给了条件不同的使用者,而这些差异使其不再适用。决策可能因以下方面的差异而改变:
- 品种、品系或生育阶段。
- 土壤类型、盐分及其持水能力。
- 当地气候、辐射强度、湿度与风况。
- 病虫害压力及其在该地区的传播情况。
- 灌溉系统、可用设备以及传感器的精度。
- 经营的形式与规模,以及劳动力和专业技术的可获得性。
- 投入品与能源的价格,以及替代方案的成本。
- 依法登记的产品、安全间隔期与监管限制。
- 使用者理解警报所用的语言,以及使用者据此行动的能力。一项学术研究可能描述的是特定试验条件下作物的反应,而该结果随后在某个应用程序中被转化为面向所有地区的一般性建议。一个智能助手可能引用了来自外国资料的某种物质或做法的名称,而其在使用者所在国家的登记情况或使用条件却有所不同。一个病害模型可能在光照良好、针对某一特定杂交种拍摄的图像上表现良好,而在面对另一品种、不同型号的手机相机,或与养分缺乏症状相重叠的症状时便告减弱。此处所说的科学有效性,并不意味着拒绝在不同环境之间转移知识,而是意味着声明可转移性的限度并加以检验。问题不只是“信息是否正确?”,还包括“对谁正确、在哪里正确、在哪个季节、在什么条件下正确?”。
数据与集成错误:算法无辜,而决策错误 在数字农业系统中,模型本身可能是可靠的,但送达它的数据、或其结果的传达方式,却可能存在缺陷。这是一个重要的类别,因为它出现在农业、软件与硬件的交界之处。例子包括:
- 传感器读数未更新,而应用程序却将其显示为实时数据。
- 未经校准的水分传感器持续发送一致、却并不正确的读数。
- 数据从一个系统迁移到另一个系统时,面积、体积或质量单位发生混淆。
- 使用了错误的时间或时区,致使警报被关联到不合适的时刻或日期。
- 通信中断期间记录丢失,随后在不完整的数据上进行计算,却未向使用者发出提示。
- 因软件重试机制而重复下达运行指令,尽管设备已执行过第一条指令。
- 某一地块或作物记录被关联到了另一条名称相近的记录上。
- 在品种、季节或生产计划已经变更之后,系统仍继续使用旧的模型或建议。
- 用户界面中显示出很高的置信度分数,给人以确定无疑的印象,尽管该模型从未在此环境中经过检验。这些错误无法仅靠重新训练模型来解决。它们要求进行单位核验、设置清晰的时间戳、校准传感器、检测数据缺失、防止指令重复、保留审计日志,并开展软硬件之间的集成测试。
个别错误与大规模错误 错误的后果不仅取决于其类型,还取决于其扩散的规模。一条被农业工程师看到并随即否决的错误建议,与同一条指令被自动化系统在数百个阀门或数千公顷土地上执行,是截然不同的。自动化赋予错误两种相互矛盾的力量:
- 它能够快速、一致、大规模地执行正确的决策。
- 它同样能够快速、一致、并以同样的规模重复同一个错误。执行范围越广、人工介入越少,就越需要设定运行限值、事先测试、逐步部署、保留手动停机的可能、留存显示事件经过的日志,以及在数据或通信丢失时使系统回到安全状态的机制。问题不在于机器可能出错一次,而在于一个软件错误可能在任何人察觉之前,就变成一种被反复执行的做法。
阈值是一项专业决策,而不仅仅是一个统计数字 模型并不总是自行给出“已感染”或“健康”的结论。其中许多会产生一个表达信号强度或模型置信度的分数,随后由系统设计者设定一个阈值,使输出从静默监测转为发出警报。如果降低阈值,系统就更容易起疑:
- 它通常能检出更多真实病例。
- 但它也可能发出更多的误报。如果提高阈值,它就变得更为保守:
- 误报数量减少。
- 但它可能漏掉那些信号未超过更高阈值的真实病例。不存在适用于所有应用的理想阈值。选择取决于警报之后会发生什么。如果该应用是对图像排序,以确定哪些值得由农业工程师优先查看,而这种查看又快速、廉价且安全,那么降低阈值、转交更多可疑情形也许是可以接受的。但如果越过阈值会直接导致启动某台机器、改变温室环境、剔除某批货物,或考虑采取化学处理,那么额外的错误就可能带来不容忽视的代价。也不应把“模型置信度分数”理解为确定性。如果系统显示出很高的分数,这并不必然意味着该决策在现实中正确的概率就等于这一分数——除非模型经过了适当的校准,并且其含义已在目标环境中得到检验。因此,界面应当说明该分数的限度,而不是用一个数字为建议增色,暗示一种它并不具备的确定程度。
阈值如何随决策而变化?
| 使用类型 | 警报之后会发生什么? | 合理的权衡 | 必要的防护措施 |
|---|---|---|---|
| 图像初筛工具 | 图像被转交人工复核 | 可以接受额外的警报,以减少漏检的严重病例 | 明确声明该结果只是初步怀疑,而非最终诊断 |
| 灌溉监测 | 使用者复核读数、天气与土壤状况 | 在漏判胁迫与过量灌溉的成本之间取得平衡 | 显示数据来源及其时效性,并允许人工核验或覆盖 |
| 病虫害警报 | 专业人员到场查看,或索取额外图像或样品 | 在快速蔓延的情形中提高敏感度,同时控制警报数量 | 提供清晰的人工或实验室确认路径 |
| 温室控制 | 通风、降温或加热的运行可能随之改变 | 更为严格,因为该决策直接影响环境、生产与能源 | 设定安全运行限值、渐进式变化,并保留手动停机或覆盖的可能 |
| 机器人或田间机械 | 检测结果转化为移动或物理动作 | 仅有视觉精度还不够;必须对安全性和端到端的完整动作进行测试 | 安全停机、障碍物检测,以及对速度、力度与作业区域的限制 |
| 敏感的化学或兽医决策 | 可能引出一项处置、剂量或休药期 | 模型警报不得成为一道独立的执行指令 | 专业人员复核,并参照登记信息、官方标签与法律要求 |
风险并非仅以错误概率来衡量 一个错误可能罕见却是灾难性的,也可能频繁却影响有限。因此,风险评估要求同时审视多个维度:
- 发生概率: 预计这类错误会以怎样的频率发生?
- 后果严重程度: 它造成的是有限的不便、经济损失、环境危害,还是安全隐患?
- 暴露规模: 它影响的是一株植物、整块田地、一个畜群,还是一条供应链?
- 危害发展速度: 是否还有数小时或数天可供干预,还是这一错误会迅速变得无法挽回?
- 错误的可检测性: 使用者会立即发现它,还是它会一直隐蔽到损失显现?
- 可逆性: 该决策能否轻易撤销,还是其影响在执行后便无法逆转?
- 自动化程度: 系统只是提出建议、把决策留给人,还是直接执行行动?
- 受影响方: 谁获得收益?如果系统出错,又由谁承担损害?正因如此,屏幕上的一条错误警报,可能不如一条看似正确、却以错误计量单位被自动执行的指令危险。而灌溉估算中一个反复出现的小错误,在整个季节里造成的后果,可能比一个只发生一次并被迅速发现的大错误更为严重。
在采用阈值或允许执行之前 程序员不应独自选定阈值;他们了解模型的行为,却可能并不了解该农业决策的全部后果。农业专业人员也不应在缺乏错误类型数据、以及系统表达不确定性能力的相关信息的情况下独自确定它。这是农业知识、软件工程、经济学、安全与监管的交汇之处。因此,应当清晰回答以下问题:
- 系统试图检测或预测的是什么状况?
- 它依赖哪些数据,我们又如何知道这些数据是最新且正确的?
- 在此项用途中,哪一种危害更大:误报,还是漏检?
- 谁接收这条警报,他们是否理解其含义与限度?
- 警报之后预期要采取什么行动?
- 该行动仅仅是一次检查,还是一项物理、化学或财务上的干预?
- 如果警报是错的,执行该行动的代价是多少?
- 如果问题确实存在而系统未发出警报,危害是什么?
- 警报是否在可供干预的时间耗尽之前送达?
- 该行动在执行之后能否撤销?
- 人工团队在不致疲劳的情况下能复核多少案例?
- 当数据不完整或相互矛盾时,系统会怎么做?
- 它能否不给出建议,并声明自己没有足够的信息?
- 当网络连接、传感器或服务失效时,是否存在安全的人工替代方案?
- 系统是否保留了一份记录,显示数据、建议、行动以及是谁批准的?
- 该决策是否需要专业人员、或法律或专业主管机构的审查?
- 接受测试的是从数据采集到行动执行的完整系统,还是仅仅测试了模型?
负责任的设计并不承诺消除错误;它防止错误转化为危害 没有不出错的模型,正如没有不出错的人类决策。现实的目标不是宣称消除了不确定性,而是设计一个系统:它知道自己可能在哪里出错、能及早发现错误、能限制其影响扩散,并给人类操作者留出明确的介入机会。这要根据风险水平,通过下列手段来实现:
- 以清晰的语言显示置信程度及其限度。
- 在数据不足时索取额外的图像或读数。
- 在不熟悉的情形中不给出确定性的建议。
- 将初步警报与诊断或最终决策分开。
- 将敏感情形转交专业人员。
- 使用一个以上的数据来源,而不是依赖单一传感器。
- 为可自动执行的指令设定安全限值。
- 在高影响决策之前要求人工批准。
- 提供手动停机装置,以及失效时的安全运行模式。
- 记录数据、建议与指令,以便进行调查与复核。
- 监测性能在不同季节、地点与品种之间的变化。
- 测试中断、陈旧数据、单位冲突与重复指令,而不是只在理想条件下测试模型。哪些错误可以容忍,并不由模型自行决定;这是一项农业、经济、伦理与安全方面的权衡,人类经验与技术知识都在其中发挥作用。衡量一个系统是否成熟的真正标准,不仅在于它很少出错,还在于它懂得在存疑时如何行事、在数据不足时如何停下,以及如何防止一个有限的错误演变为无法挽回的大范围危害。
8. 我们如何比较两个应用,而非两个数字?
仅仅比较数字的高低是不够的,因为不同应用可能在任务、数据、情境、成熟度和运行方式上各不相同。严谨的比较始于先把问题统一起来,然后再比较答案。 一份农业应用评估表
| 维度 | 需要回答的问题 |
|---|---|
| 身份与时间 | 该系统的名称、版本及其检验日期是什么? |
| 任务 | 它试图改进哪一项农业决策? |
| 使用者 | 谁在使用它,具备怎样的技能与权限? |
| 成熟度 | 处于构想、原型、验证、田间试验、运行,还是已测得影响的阶段? |
| 数据 | 数据来自何处,是否代表目标作物、地点与使用者? |
| 比较 | 它是与什么基线或替代方案进行比较的? |
| 指标 | 它是如何定义的,单位是什么,又有哪些是它没有测量的? |
| 验证 | 是内部的、外部的、本地的,还是基于田间的? |
| 错误 | 存在哪些类型的错误,其后果由谁承担? |
| 运行 | 在中断、数据损坏或条件变化的情况下会发生什么? |
| 时机 | 建议是否在干预窗口关闭之前送达? |
| 影响 | 是否有农业、经济或安全方面的结果发生了改变? |
| 成本 | 拥有、运行与培训的总成本是多少? |
| 权利 | 数据归谁所有,如何导出或删除? |
| 责任 | 谁批准该决策,谁中止它,谁来补救损害? |
| 利益冲突 | 谁资助、描述并评估了该系统? |
对于无法获得信息的栏目,不得用猜测、也不得用取自另一产品的平均值来填写;应清晰写明:“未知”。信息缺失是评估结果的一部分,而不是需要掩饰的形式缺陷。 一个示例:97% 还是 89%? 假设有两款用于植物病害图像分类的应用:
- 第一款应用在一个取自单一来源的图像数据库中宣称达到 97% 的准确率。
- 第二款应用在一项涵盖不同农场与不同设备的测试中宣称达到 89%,它提供“未知”类别,在图像质量不佳时予以弃答,并将敏感情形转交专业人员。
不能仅仅因为第二款应用的表述看起来更负责任就宣布它更优越,正如不能因为第一款的数字更高就选择它。比较需要了解任务、数据分布、错误类型、基线、成本以及运行条件。 但这个例子揭示了一条基本规则:更高的数字无法弥补在可转移性、安全性与运行方面缺乏证据的缺陷。一款总体指标较低的应用,如果其错误模式是已知的、限度是已声明的、升级转交路径在运行上是可行的,那么它对某项特定任务可能更为适用。 恰当的比较不会去问两个数字中哪一个更大。它要问的是:在此情境下,哪个系统以最适宜的证据支撑了最有用、风险最小的决策。
9. 演示与产品页面上不会出现什么?
演示是重要的,它表明系统能够在某些条件下完成一项任务。但演示通常不会挑选季节中最糟糕的一天、最差的网络连接、最模糊的图像,或经验最少的使用者。 演示或摘要中可能缺失一些关键信息,包括:
- 在测试前被排除在外的案例。
- 质量不佳的图像或罕见的类别。
- 网络连接中断的次数。
- 数据清洗与准备所需的时间。
- 在产生该结果的过程中人工介入的程度。
- 误报的数量。
- 使用者未采纳建议的情形。
- 校准与维护的成本。
- 试验结束之后才出现的故障。
- 最佳站点与所有站点平均水平之间的差距。
- 季节、设备或数据来源变化所带来的影响。
- 停止使用该系统的用户数量。
- 把系统从原型推进到稳定服务所需的成本。
有人可能会说该系统“降低了用水量”,却不说明:
- 与哪种做法相比?
- 下降的是每公顷用水量,还是每吨产品用水量?
- 从水源地的总取水量是否下降了?
- 生产率与品质是否得以保持?
- 那一季的雨水是否更多?
- 种植面积是否扩大了?
- 能耗发生了什么变化?
- 系统成本与所节省的价值相比如何?
还有人可能会说某个应用是“人工智能驱动的”,而实际上算法只是整个服务中很小的一部分,其成败取决于测量质量、网络连接、支持、维护以及使用者的响应。 值得警惕的迹象 当出现以下一种或多种情形时,判断应当更为审慎:
- 一个没有分母、也没有定义的百分比。
- 没有描述测试集的准确率。
- 与一个薄弱系统、或与完全不进行干预的情形作比较。
- 只展示成功的图像,而不呈现错误。
- 把一次短期试验说得像是持续运行。
- 把模型结果说得像是经济影响。
- 把供应商的描述当作独立评估来呈现。
- 使用“节省”一词,却不报告总消耗量。
- 使用“即时”一词,却没有实测的响应时间。
- 标榜“多语言”,却未测试使用者的理解程度。
- 标榜“可解释”,却不说明解释的是什么、面向的是谁。
- 标榜“安全”,却不界定安全状态或失效应对预案。
演示所证明的是:系统曾在选定条件下成功运行过一次。而农业服务所要证明的,则是它能够在自己无法选择条件的情况下依然运行。
10. 所需证据应与决策的风险相称
并非每项数字功能都需要同等程度的证明。提醒使用者某个作物巡查日期,其后果不同于一项化学品建议或一项信贷决策。但应用程序成本低廉,并不会降低决策敏感时错误所带来的后果。
| 风险程度 | 示例 | 最低要求 |
|---|---|---|
| 低 | 为检查而对图像排序、提醒巡田、整理记录 | 功能核验、易于更正,并明确提示该输出仅为辅助 |
| 中 | 产量预测、初步灌溉排程、作物分级、维护警报 | 本地核验、基线、运行期监测、人工替代方案 |
| 高 | 导致敏感干预的诊断、自动控制、影响食品安全的决策 | 专业人员核验、人工批准、决策日志、明确的限值、弃答机制与安全模式 |
| 受监管或后果重大 | 剂量、农药、PHI、REI、法定登记、兽医决策、信贷或保险 | 有效且最新的官方来源、专业人员审查、提出异议的权利、明确的责任,以及防止未经授权的执行 |
注: 此处所说的基线,是指用于比较人工智能系统性能、以判断其是否带来了真实收益的参照物。仅说系统“表现良好”是不够的,除非我们知道:与什么相比表现良好? 基线可以是以下一项或多项:
- 使用该系统之前的现行做法: 例如农民估计灌溉时机或进行作物分级的惯常方法。
- 上一季或上一时期的结果: 例如往季田间平均产量,同时考虑条件的差异。
- 一种不依赖人工智能的简单方法: 例如固定的灌溉排程、一条明确的农艺规则,或一个历史平均值。
- 人类专家的估计: 例如农业工程师的产量预测,或人工分级的结果。
- 一个既有的传统模型: 如果该项目所替代的是一个已在使用的系统或模型。
示例:产量预测 如果一个人工智能模型预测作物产量,仅说其预测接近实际结果是不够的。应当把它与往年该田块的平均产量,或与农业工程师目前所用的估算方法进行比较。如果该模型并不优于这一简单基线,或者未能在更合适的时间给出预测,那么它的用处也许不足以抵偿数据采集与系统运行的成本。 示例:灌溉排程 如果系统给出灌溉的时机与水量建议,其基线就是惯常的灌溉排程、或农民依据巡查与经验作出的判断、或一条经认可的指导规则。随后比较结果:系统是否降低了水和能源的总消耗量?是否保持了产量与品质?是否减少了水分胁迫?在计入传感器、网络连接与维护的成本之后,收益是否依然存在? 示例:作物分级 基线可以是当前的人工分级流程。比较不仅限于系统的速度,还包括被错误分类的产品比例、品质的一致性、损伤程度、运行成本,以及工人复核模糊情形的能力。 示例:维护 如果系统对水泵或制冷机组的故障发出早期警报,基线可以是例行维护排程,或系统安装之前的故障与停机次数。目的在于判断这些警报是否真正减少了停机时间与损失,而不仅仅是知道该应用发出了多少条警报。 因此,基线既不是一个可接受的最低门槛,也不是一个编程起点;它是对系统投入使用之前情况的一份有文档记录的写照,或是对一个更简单替代方案所能达到的水平的写照。没有它,我们就可能把由天气、价格变动、工人经验或季节差异所带来的改善,归功于人工智能。 如果在表格中保留这一技术术语,最清晰的措辞是: 本地核验、与一条清晰基线(即与现行做法或某一简单替代方案)的比较、运行期间的持续监测,以及提供一套安全的人工回退方案。 低风险功能 如果错误易于发现和撤销,且该工具不会执行有害动作,则可以接受更大程度的灵活性。但即便在此处,平台也不应隐瞒自身的限度,或收集它并不需要的数据。 中风险功能 这类功能要求与一条现实的基线作比较、在本地数据和本地条件下进行测试,并且要弄清楚:如果系统失效或网络连接中断会发生什么。其建议本身也许并不危险,但一旦在大范围内使用,代价可能变得高昂。 高风险功能 这类功能不应从模型预测直接跨到执行。它们要求:
- 确定有权批准的人员。
- 展示来源与限制。
- 在数据不足时阻止给出答案。
- 记录建议内容与人工干预情况。
- 提供升级上报的途径。
- 测试安全模式。
- 将一般信息与专业或法律判断区分开来。
受法律监管的功能 算法不得取代官方标签、主管部门、兽医或持证工程师。它可以帮助收集信息、检索文件、标记不一致之处,但不能赋予其本身并不具备的法律登记资格或专业权威。 其中的支配性规则是:随着错误后果的严重程度及其难以逆转的程度上升,核验与监督的力度也应随之加强。
11. 解读证据的三个案例研究
以下案例属于分析性教学示例,并非新实验的结果。其目的在于说明如何运用本章的方法。 案例一:一款用于分类植物病害的手机应用 该应用显示一张叶片照片,并返回一个可能的病害名称和置信度分数。 快速的解读会说:这款应用诊断了病害。 而一种严谨的解读则会把这一主张拆解开来:
- 该模型是在指定类别范围内识别一种视觉模式,还是提供了完整的因果诊断?
- 图像数据集是否代表了目标品种与环境?
- 它是否在田间用手机拍摄的图像上进行过测试?
- 它能否识别出该病例落在训练类别之外?
- 它是否询问植株的生育期、位置以及症状的扩展情况?
- 置信度低时它会怎么做?
- 它是否展示官方来源?
- 它是否提出处置方案,又由谁来批准?
- 它是否区分病害名称、严重程度与扩散阶段?
- 用户能否更正结果并提交复核?
这款应用在图像分诊、识别值得实地查看的病例方面可能非常有用,但并不能替代专业诊断。准确描述其功能并不会削弱其价值;恰恰相反,这能防止它被用在并非为之设计的场景中。 案例二:一个宣称节省 30% 灌溉用水的系统 为便于分析,我们假设某平台宣称灌溉用水减少了 30%。 在接受这一说法之前,我们必须追问:
- 这一百分比是按公顷计、按吨计,还是就整个农场而言?
- 基线是什么:固定的灌溉计划、农民自身的做法,还是另一套系统?
- 种植面积是否保持不变?
- 该季在降雨和气温方面是否具有可比性?
- 生产率与品质是否保持不变?
- 用水量是否被转移到了另一个环节?
- 抽水能耗又发生了什么变化?
- 结果是否包含了停机天数?
- 传感器、网络连接与维护的成本是多少?
- 这一节水效果是否持续了不止一季?
如果单位吨产品的用水量下降,而种植面积扩大,总取水量仍可能上升。如果用水量下降是因为该季雨水更多,那么全部结果就不能归因于该系统。而如果节水是以品质大幅下降为代价实现的,那么该结果在经济上可能是不可接受的。 不应因此否定这一百分比,但若缺少其分母、基线以及伴随而来的各项结果,它就是不完整的。 案例三:一个生成式农业咨询助手 该助手用自然语言回答与病害、灌溉或施肥有关的问题。 它的成功不能仅凭句子是否优美来衡量。应当考察以下各项:
- 它是否理解作物、区域与生育阶段?
- 它是否从可信来源检索到近期的参考资料?
- 它是否准确传达了该来源所附的条件?
- 它是否混淆了两个国家或两种法律登记?
- 它是否区分了概率与诊断?
- 它是否避免了编造剂量或采前间隔期?
- 它是否询问了缺失的信息?
- 必要时它是否将案例上报给专业人员?
- 农场的数据是否始终受到保护?
- 用户能否查看来源、对答案提出异议并加以更正?
该助手在解释概率、汇集问题与整理证据方面可能表现出色,但当它以无法自证其理的自信给出一个敏感数值时,就会变得危险。这里的成熟并不意味着回答一切;而是懂得何时给出答案是有用的,何时转介才是负责任的答案。
12. 读者在信任一项数字农业主张之前的操作规程
在阅读一项研究、一场产品展示或本书的某一章时,可以使用以下问题:
- 具体的农业任务是什么?
- 这属于哪一类主张?
- 主张由谁提出,又由谁评估?
- 数据的来源是什么?
- 基线是什么?
- 采用了什么指标?
- 是否进行过独立验证或本地验证?
- 哪一类错误最危险?
- 结果是否及时送达?
- 发生失效时会怎样?
- 最终结果是否改善了?
- 在依赖它之前,哪些内容需要本地验证?
是检测、分类、预测、建议、控制,还是执行?
它涉及产品的存在、某项功能、技术性能,还是农业与经济影响?
陈述者是开发方、独立机构、研究人员,还是使用者?
作物、区域、季节、设备与样本单元又分别是什么?
该系统是与当前做法、专家、一条简单规则,还是与不采取任何干预进行比较?
它测量了什么、没有测量什么,是否与错误后果的严重程度相匹配?
还是说结果仍然局限于开发方的数据或原始研究之内?
其成本或危害又由谁承担?
使用者是否真的能据此采取行动?
如果网络中断、传感器故障,或出现未知情形,会发生什么?
在计入产量、品质、水、能源、劳动、成本与风险之后?
又必须声明哪些使用限制?
回答之后,可将该主张归入以下四种状态之一:
- 在已知情境中得到支持:适合在已声明的限制内使用。
- 有前景但需要本地验证:存在良好的证据,但尚未证明其可迁移性。
- 由其提供方描述:我们知道提供方声称了什么,但尚无足够的独立评估。
- 不足以支撑该决策:证据不完整、不适用,或与使用风险不相称。
第四种状态并不意味着该技术毫无价值;而是意味着潜力与有理由的依赖之间的差距尚未弥合。
本章小结
知识不会因为其来源冠有知名的名号而变得可信,应用也不会因为其模型取得高分而变得成熟。信任的建立,在于我们知道测量了什么、基于什么数据、与什么参照物比较、在什么条件下进行;然后追踪从模型性能到系统运行、从建议到行动、再从行动到其在田间、经济与人类福祉中所产生影响的整条路径。
一个数字可能在其研究范围内是正确的,一款产品可能确实存在于市场上,一种算法在设计上也可能是先进的,但这些都不足以证明某一具体农场上的决策已经变得更好。方法的作用正体现于此:不是要让技术的前景黯然失色,而是把它从一时的惊叹转化为可检验的知识,再把知识转化为经得起辩护的决策。 科学的严谨并不要求每一款应用从第一天起就证明一切。它要求应用声明自己实际上证明了什么,区分自己已经达到的水平与所期望达到的水平,并在错误后果上升时提高验证的力度。 当读者学会追问任务、指标、情境、错误、成熟度、可迁移性与影响时,读者就不再受制于最高的数字或最光鲜的展示。读者将能够区分:一个在测试中取得成功的模型、一个能够运行起来的系统、一款改变了决策的应用,以及一项已经证明自己配得上在农业中占有一席之地的技术。
证据说明
第一节与第二节说明了本书的构建方式以及其主张是如何受到约束的。[SRC004] 被用作已发表系统综述的一个示例,而不是要把它的方法学地位赋予本书。[SRC006] 被用来阐明决定系数仅限于该研究的设置条件,不得被转化为一个笼统的“准确率百分比”;[SRC012] 则被用作示例,说明有必要将计算结果限定在其所来自的实验范围内,不得将其转化为商业或田间层面的保证。有关风险、监督与运行周期的讨论以《人工智能风险管理框架》[SRC033] 为指导。成熟度阶梯、评估卡、风险等级与案例研究属于编辑性的教学综合,旨在帮助读者评估证据;它们既不是官方监管标准,也不是为本书开展的新实验的结果。