Üçüncü Bölüm: Tarımsal Yapay Zekâ İçin Kanıt Çerçevesi
Bölümün Mesajı: Kaynak Bolluğundan Güvenilir Bilgiye
Bilimsel bir kitabın gücü, dipnotlarında biriken atıfların sayısında değil; her atfın fiilen neyi kanıtlayabileceğini ve epistemik yetkisinin nerede bittiğini saptayabilme kabiliyetinde yatar. Bir kaynak değerini salt varlığından değil, kendisine dayanak yapıldığı iddiaya uygunluğundan alır. Bu mesele, tarımsal yapay zekâ gibi hızla gelişen bir alanda daha da karmaşıklaşır: Yazarın önünde hakem denetiminden geçmiş bilimsel bir makale, resmî bir rapor, bir ürün sayfası, bir kod deposu, bir bilgisayar benzetimi, bir haber ve bir saha deneyimini anlatan bir tanıklık bulunabilir. Bu kaynakların her biri doğru bilgi içerebilir; ancak hepsi aynı güvenilirlik derecesini taşımaz ve aynı çıkarım işlevini görmez. Bilimsel bir makale, bir modelin performansını belirli veriler ve deney koşulları altında ölçebilir; ama onun her üründe ya da her bölgede başarılı olduğunu kendiliğinden kanıtlamaz. Bir düzenleyici otorite, bir pestisiti tescil etmeye ya da kullanımının yetkilendirilip yetkilendirilmediğini belirlemeye yetkili mercidir; fakat bir algoritmanın doğruluğunu ölçen merci değildir. Bir ürün sayfası, tedarikçinin belirli bir tarihte kendi sistemi hakkında ileri sürdüğünü belgeler; ancak etkililiğinin bağımsız bir değerlendirmesinin yerini tutmaz. Kod deposuna gelince, inceleme anında kodda bir bileşenin varlığını ortaya koyabilir; ama o bileşenin canlı bir hizmette çalıştığını ya da sahada somut bir tarımsal etki ürettiğini ortaya koymaz. Bu bölümün görevi işte bu ayrımdan doğar: Kitabın kaynak çeşitliliğinden disiplinli, izlenebilir ve gözden geçirilebilir yargılara nasıl geçtiğini açıklamak. Burada soyut bir araştırma yöntemleri kataloğu sunulmuyor; aksine, belgelenmiş bir olguyu bağlama bağlı bir sonuçtan, kaynağına atfedilmiş bir tasvirden, henüz tam olarak doğrulanmamış bir sayıdan ya da deneysel bir bulgu olma iddiası taşımayan editoryal bir öneriden ayırmak için kullanılan pratik çerçeve açığa çıkarılıyor. Amaç, çekince yığarak savı zayıflatmak ya da bilgiyi kalıcı bir kuşku çitiyle çevirmek değil; dayanağı ve sınırları açıkça anlaşılan bir güven inşa etmektir. Bilimsel kesinlik, kesin bir üslupla değil; okurun izleyebileceği bir güzergâhla üretilir: Bilgi nereden geldi? Ne tür bir kaynaktır? Bu kaynak fiilen neyi kanıtlar? Ve ondan neyi çıkarsamaya hakkımız yoktur?
1. Kanıt Tabanının Mimarisi: Kitabın Bilgi Temeli Nasıl Kuruldu?
Kitap, "çok dilli kaynak külliyatı" derken, hazırlık aşamalarında toplanan ve düzenlenen, ardından bölümlerinin ve çözümlemelerinin üzerine kurulduğu malzemelerin bütününü kastetmektedir. Bu külliyat tek bir belge türüyle sınırlı kalmadı; birincil çalışmaları, bilimsel incelemeleri, resmî raporları, çalışma kâğıtlarını, kurumsal belgeleri, ürün tanımlarını, teknik malzemeleri ve uygulama kılavuzlarını; bunların yanı sıra isimleri ve konuları keşfetmek ve araştırma hatları açmak için kullanılan yardımcı malzemeleri de içerdi. Bu malzemeler birden çok dilde geldi; çünkü tarımsal yenilik bütünüyle İngilizce yayımlanmıyor ve bazı uygulamalar, politikalar ve yerel terimler tam anlamlarını ancak kendi dilleri ve bağlamları içinde açığa vuruyor. Ne var ki dilsel çokluk, bir çeviriyle özgün metnin iki bağımsız kaynak sayılacağı anlamına gelmez; bir belgenin birden fazla sürümde bulunması da ona daha yüksek bir bilimsel mertebe kazandırmaz. Bu nedenle çeviriler kendi asıllarıyla ilişkilendirildi, mükerrer ya da türev sürümler saptandı ve her belgeye savın kuruluşundaki kesin yeri ve işlevi verildi. Çalışma, kaynak malzemenin envanteri ve düzenlenmesiyle başladı; ama dosyaları toplamakla yetinmedi. Kaynaklar, iddialar, sayılar ve vaka incelemeleri için ayrı editoryal kayıtlar kurmaya geçti. İki aşama arasındaki fark temeldir: Bir belgeyi toplamak yalnızca malzemenin incelenebilir hâle geldiği anlamına gelir; oysa ondan türetilen bir iddianın kabul edilmesi başka bir doğrulama düzeyi gerektirir. Bu noktada sorular şunlardır: Bu kaynak, tam da bu iddiayı temellendirmeye uygun mudur? Sayı özgün konumuna kadar izlenebilir mi? Ve sonuç kitaba aktarılırken çalışmanın koşulları ile sınırları görünür kaldı mı? Ayrıca Aladdin Agri AI vaka incelemesiyle ilişkili kanıtlar için ayrı bir kayıt oluşturuldu; böylece iç uygulama kanıtlarının, okurun erişebileceği genel bilimsel kaynaklarla karışması önlendi. Bir kodun, bir arayüzün ya da bir entegrasyon yolunun varlığı, bilinen bir sürümde belirli bir uygulama durumunu ortaya koyabilir; ama bu, onu etkililiğe ilişkin bağımsız bir çalışmaya ya da sahadaki tarımsal etkinin kanıtına dönüştürmez. Bu ayrım, her iki kanıt türünün de değerini korur: Teknik kanıta, kanıtlayabileceğinden fazlası yüklenmez; okur ise onun tam olarak neyi ortaya koyduğunu görebilir. Dosyalar ve yolları yeniden düzenlendiğinde atıflar, kullanımdan kalkmış konumların ya da değişebilir adların esiri bırakılmadı; bunun yerine dosya yollarının ve dijital parmak izlerinin temel kaydı yeniden kuruldu. Amaç yalnızca teknik değil, aynı zamanda editoryal ve epistemikti: Önemli her iddianın dayandığı malzemeye bağlı kalmasını ve dosyaların taşınmasının ya da adlarının değişmesinin doğrulama zincirini koparmamasını sağlamak. Bu çalışma neden kanıtla beslenen yapılandırılmış anlatı incelemesi olarak nitelendiriliyor? Bu kitap bir kanıtla beslenen yapılandırılmış anlatı incelemesi biçimini alır: Türdeş olmayan malzemeleri toplar, sınıflandırır, karşılaştırır ve ardından bunlardan alana ilişkin tutarlı bir yorum kurar; bunu yaparken her kanıt parçasının türünü ve izin verdiği çıkarımın sınırlarını görünür kılar. Bu yöntem, kitabın ortaya koyduğu geniş soruya uygun düştüğü için seçildi: Yapay zekâ laboratuvardan ve üründen tarımsal karara, ekonomiye, işgücüne, yönetişime ve sahaya nasıl geçiyor? Sistematik bir inceleme, tam bilimsel anlamıyla, başka bir amaca hizmet eder ve daha özgül bir yöntemsel çerçeveye dayanır. Genellikle daha dar bir soruyla, önceden belirlenmiş bir arama protokolüyle, tanımlanmış veri tabanlarıyla, yeniden kullanılabilir arama dizeleriyle, açık dâhil etme ve dışlama ölçütleriyle ve arama sonuçlarının, mükerrer kayıt ayıklamasının ve eleme aşamalarının eksiksiz bir kaydıyla başlar. Bu ögeler, başka bir araştırmacının süreci yinelemesine ve bulguları incelemenin yazarlarınınkiyle karşılaştırmasına olanak tanır. Sınıflandırmadaki fark, bir türün titiz, diğerinin daha az titiz olduğu anlamına gelmez; her birinin farklı bir epistemik işlevi olduğu anlamına gelir. Sistematik inceleme, yinelenebilir bir protokol içinde belirli bir soruyu yanıtlamaya elverişlidir; yapılandırılmış anlatı incelemesi ise tek bir deneysel tasarımın birleştirmediği alanları birbirine bağlayabilir: Algoritmalar, tarım, ekonomi, gıda güvenliği, işgücü, veri hakları, kurumsal yapı ve bölgesel farklar. Bu kitabın gücü, söz konusu bağlantıları titiz biçimde kurarken kanıt türleri arasındaki farkları silmemekte ve onları nitelik ve kanıt gücü bakımından eşitmiş gibi sunmamakta yatar. Önceki taslaklardan devralınan sayımlar: Sayının cazibesinden çok kesinliğin önem taşıdığı yer Bu kitabın daha önceki bir baskısına ait bazı taslaklarda, birden çok veri tabanı ve kaynak üzerinden 150'den fazla belgenin incelendiği belirtiliyordu. Ne var ki bu baskı, sırf önceki sürümde yer aldığı için o sayıyı korumadı: Sayı, onu nihai bir yöntemsel sayım saymak için gereken arama dizelerini, tarihleri, sonuçları, elemeyi, dışlamaları ve mükerrer kayıt ayıklamasını yeniden üretmeye yetecek kadar eksiksiz bir kayıtla birlikte gelmiyordu. Daha kolay seçenek, bu sayımı yeni baskıya taşımak olurdu; büyük, açık ve çekici bir sayıdır. Ancak bilimsel seçenek, doğrulanabilen yararlı bilgiyi, belgesel güzergâhı eksik kalmış sayısal bir iddiadan ayırmaktı. Bu nedenle tarihsel sayı, incelemenin kapsayıcılığının kanıtı olarak kullanılmadı ve malzemeler ile iddialar, bu baskının kayıtlarına ve beyan edilmiş sınırlarına uygun biçimde yeniden değerlendirildi. Bu, önceki taslaklardan geçen bilginin heba olduğu ya da geçersiz kılındığı anlamına gelmez. İzlenebilen isimler, fikirler ve araştırma güzergâhları korundu; iddialar benimsenmeden önce yeniden incelendi. Uygun bir kaynağa kadar izlenemeyen herhangi bir sayı ya da sonuca gelince, bu okura tam olarak yerleşmiş bir olgu diye sunulmadı. Böylece editoryal inceleme, bilgiyi silmenin değil arıtmanın aracı oldu; kitabın güvenilirliğini azaltmanın değil yükseltmenin bir yolu hâline geldi. [SRC004] gibi yayımlanmış bir sistematik inceleme, alanın bir bölümünü haritalamaya katkı sunabilir ve kendi özgül sorusu içinde belgelenmiş bir arama protokolü örneği sağlayabilir. Ancak onun sistematik niteliği, yazarlarının yürüttüğü çalışmaya aittir ve salt bu kitap ona atıfta bulunduğu için kendiliğinden bu kitaba geçmez. Benzer biçimde, geniş bir belge derlemesi, dosyalarının sayısı ya da bölümlerinin düzenliliği sayesinde sistematik incelemeye dönüşmez. Kesinlik, çalışmayı fiilen başardığı şeyle adlandırmakla ve ardından onu bu adın gereklerine karşı titizlikle hesap verir kılmakla başlar. Bu anlamda yöntem, kitap adına bir özür değil, gücünün bir beyanıdır: Kitap, geniş ve izlenebilir bir sav kurmayı, niteliğini açıkça beyan etmeyi ve her kaynağa gerçek kanıt gücünün üstüne çıkarmaksızın hak ettiği yeri vermeyi seçti. Yöntemsel sonuç: Güven, belgelerin salt sayısından değil; her iddiayı kaynağına bağlayan ve o kaynağın neyi kanıtladığını, neyin sınırlarının ötesinde kaldığını tam olarak belirleyen yolun açıklığından kurulur.
2. Doğrulama Birimi Paragraf Değil, İddiadır
Sayfadaki bir paragraf tek ve tutarlı bir birim gibi görünebilir; oysa doğası ve her birinin temellendirilmesi için gereken kanıt türü bakımından kökten farklılaşan birkaç iddia barındırabilir. Bir sistemin varlığını ortaya koyan bir cümle, onun bir özelliğini betimleyen bir cümleyle aynı düzeyde değildir; ikisi de onun doğruluğunu ya da çiftçilerin yaşamındaki etkisini kanıtlamaya yetmez. Dijital bir tarım ürününü ele alan bir paragrafın basitleştirilmiş bir örneğini düşünelim. Paragraf dört farklı iddia düzeyi içerebilir:
- Kimlik ya da varlık iddiası: "Bu adı taşıyan bir platform ya da araç vardır."
- Özellik iddiası: "Sağlayıcısı, hastalık belirtilerini saptamak için bilgisayarlı görü kullandığını belirtiyor."
- Performans iddiası: "Belirli bir görevde %95 doğruluk elde etti."
- Etki iddiası: "Gerçek işletme koşulları altında çiftçilerin kayıplarını azalttı ya da gelirlerini iyileştirdi."
Bir tedarikçi sayfası, ürünün bu adla sunulduğunu ve şirketin onu bilgisayarlı görü kullanan bir ürün olarak tanımladığını belgeleyebilir. Ama o hâlde yalnızca tedarikçinin belirli bir tarihte kendi ürünü hakkında söylediğini belgelemiş olur. Sayfa tek başına, özelliğin betimlendiği gibi çalıştığına, sistemin belirli bir doğruluk düzeyine ulaştığına ya da kullanımının fiilen kayıpların azalmasına yol açtığına dair bağımsız bir doğrulama sunmaz. Performans sayısına gelince, bu; modelin hangi veriler üzerinde sınandığını, verilerin nasıl bölündüğünü, kullanılan ölçütün tanımını, sonucun karşılaştırıldığı başlangıç düzeyini ve çalışma ortamının ötesine genellemenin sınırlarını belirleyen bir kaynak gerektirir. Modelin belirli bir testte %95 doğruluk elde ettiği ortaya konsa bile, bu sonuç ekonomik ya da tarımsal etkiyi kendiliğinden kanıtlamaz. Kayıpların azaldığını kanıtlamak; sahada ne olduğunu ölçen, sonucu sistemin yokluğunda olacak olanla karşılaştıran ve iyileşmeyi açıklayabilecek maliyetleri, riskleri ve diğer etkenleri hesaba katan bir tasarım gerektirir. Her iddianın incelenmesini üç soru yönetir Bu bakımdan kitabın yöntemi, doğrulanabilir iddiayı incelemenin temel birimi sayar. Bu, bileşik ifadeyi açık birimlere ayırmak ve ardından her birime üç soru yöneltmek anlamına gelir:
- Bu ne tür bir iddiadır?
- Onu kanıtlamaya uygun kaynak nedir?
- Kaynağın izin verdiği ifade sınırları nelerdir?
Kimlik, özellik, performans ya da etki iddiası mıdır?
Resmî bir belge mi, bir performans çalışması mı, bir saha değerlendirmesi mi, yoksa teknik bir malzeme mi gerektirir?
Güvenle ne söylenebilir ve ne kanıtı aşan bir genelleme sayılır?
İnceleme sonrasında iddialar hep birlikte tek bir kategoriye toplanmaz; açık derecelere göre sınıflandırılır:
- Doğrulanmış: Uygun bir malzemeyle desteklenir ve kanıt zinciri izlenebilir.
- Sınırlar içinde doğrulanmış: Belirli bir çalışmada ya da bağlamda ortaya konmuştur; bunun ötesine genellenmez.
- Atfedilmiş tasvir: Bir kurumun ya da şirketin kendi ürünü hakkında söylediğini ifade eder; ona ilişkin bağımsız bir değerlendirme değildir.
- Doğrulanmayı bekleyen: İlk bir belirti ya da atıf vardır, ancak kanıt zinciri eksiktir.
- Kullanılamaz: Eşleşen bir kaynak saptanamamış ya da kaynağın, kendisine atfedilen iddiayı temellendirmediği görülmüştür.
Böylece ürünün adı ve kullanım alanı ortaya konmuşken performans düzeyi konmamışsa, ürünün alanın haritasından çıkarılması gerekmez; ama aynı zamanda sayı da eksiksiz bir olguymuş gibi yayımlanamaz. Ad ve görev tanımı, belgelenebilen sınırlar içinde korunur; performans sayısı ise ona uygun bir kaynak ortaya çıkana dek ana metinden geçici olarak yalıtılır. Bilimsel karantina: Kanıt tamamlanmadan önce sonucu korumak Bu kitapta bilimsel karantina ile kastedilen budur. Bu, fikrin yanlış olduğuna dair bir hüküm ya da kaynağa veya ürüne yönelik bir suçlama değil; eksik bir iddianın metin içinde bir olgu gibi iş görmesini önleyen editoryal bir karardır. Eşleşen bir birincil kaynak ya da yeterli bağımsız doğrulama ortaya çıkarsa bir iddia yeniden açılabilir; temellendirme koşulları karşılanmazsa sonucun dışında kalmayı sürdürebilir. Böylece bilimsel karantina, bilgiyi aceleden koruyan bir mekanizma hâline gelir; fikirleri dışlamanın bir aracı değil. Bu temelde, kanıtın titizlikle denetlenmesi içeriği yoksullaştırmaz; nitekim geniş kapsamlı bir kitap sunma arzusu da kesinlik derecelerini birbirine karıştırmanın gerekçesi olmaz. Kitap; uygulamaların, ürünlerin ve araştırmaların zengin bir haritasını korurken aynı anda şunlar arasına açık bir çizgi çekebilir:
- Uygun kanıta dayanarak bildiklerimiz;
- Belirli koşullar ve bağlamlar içinde bildiklerimiz;
- İlgili tarafın kendisi hakkında söyledikleri;
- Ve hâlâ yeterli temellendirmeyi bekleyenler.
Bilimsel titizlik bilgiyi daha az kapsamlı kılmaz; aksine sınırlarını daha belirgin hâle getirir. Okur bir ifadenin nereden geldiğini, onu neyin desteklediğini ve kapsamının nerede bittiğini bildiğinde, ihtiyat artık bir zayıflık işareti gibi görünmez; güvene anlamını veren temele dönüşür.
3. Model Doğruluğundan Tarımsal Karar Kalitesine
Bir yapay zekâ modeli, özellikle eğitildiği verilere benzeyen temiz ve eksiksiz veriler üzerinde değerlendirildiğinde testlerde yüksek sonuçlar elde edebilir. Ne var ki bu teknik başarı tek başına, onun uygulamada bir tarımsal kararı değiştireceğini güvence altına almaz. Model, sahada bulunan telefonda ya da cihazda çalıştırılamıyor olabilir; sürekli internet bağlantısı gerektirebilir; uyarısını ancak ürünü kurtarma fırsatı geçtikten sonra verebilir; ya da görüntü belirsiz veya veriler eksik olduğu hâlde kendinden emin bir öneri sunabilir. Böyle durumlarda sayısal sonuç etkileyici kalır, ama pratik değeri sınırlıdır. Buna karşılık bir başka model, testte biraz daha düşük performans kaydedebilir; ancak çalıştırılması daha hafif, saha koşullarında işlemeye daha elverişli ve bilgisinin sınırları konusunda daha açık sözlü olabilir. Veriler yetersizse kesin bir öneri vermekten kaçınır ve ek bir görüntü ya da ölçüm ister, veya vakayı bir ziraat mühendisine yönlendirir. Bir risk saptarsa, müdahale penceresi kapanmadan önce çiftçiye inceleme ve eylem için yeterli zaman tanıyan erken bir uyarı verir; yani tedavinin ya da korumanın hâlâ mümkün ve etkili olduğu dönem kapanmadan. Bu model dolayısıyla, test sonuçlarında en yüksek puana sahip olmasa bile daha yararlı olabilir. Pratik bir örneği düşünelim: Bir bitki hastalığını teşhis eden bir model, enfeksiyonu yüksek doğrulukla saptayabilir; ancak bunu ancak belirtiler belirginleştikten ve hastalık geniş bir alana yayıldıktan sonra yapabilir. Uygulamada, erken işaretleri yakalayan, güven düzeyini belirten ve izlenebilecek bir vakayı acil insan muayenesi gerektiren bir vakadan ayırt eden, biraz daha az doğru bir model onu geçebilir. Birincisi, sorunu gerçekleştikten çok sonra iyi betimler; ikincisi, karar hâlâ sonucu etkileyebilecekken insanların karar vermesine yardım eder. Bu, doğruluğun önemini küçümsemek ya da işletilmesi kolay olduğu bahanesiyle zayıf bir modeli kabul etmek anlamına gelmez. Teknik performans, özellikle ürünlerin, hayvanların ya da insanların güvenliğini etkileyebilecek kararlarda temel bir koşul olmayı sürdürür. Ama tarımsal değer tek bir sayıyla üretilmez; kabul edilebilir ve temellendirilmiş bir doğruluğu, bağlama uygun verileri, güvenilir işletimi, zamanında uyarıyı, anlaşılır ve uygulanabilir bir öneriyi ve kanıt yetersiz olduğunda sorumlu bir çekimserliği birleştiren bütünleşik bir sistemle üretilir. O hâlde en iyi model, her zaman laboratuvarın içinde daha çok bilen değil; kararın hâlâ sonucu değiştirebileceği yerde ve zamanda insanların daha sağlam bir karar vermesine yardım edendir. Bu çerçevede beş başarı düzeyi birbirinden ayrılmalıdır:
| Değerlendirme düzeyi | Çiftçinin doğrudan sorusu | Uygulamada başarı neye benzer? | Bu başarı tek başına neyi kanıtlamaz? |
|---|---|---|---|
| 1. Testteki model doğruluğu | Model, sınandığı verilerde hastalığı tanımlayabildi, verimi öngörebildi ya da sulama ihtiyacını doğru tahmin edebildi mi? | Örneğin sağlıklı bitkilerle enfekte olanları az hatayla ayırt etmesi ya da verim tahminlerinin testte gerçek değerlere yakın olması. | Başka bir çiftlikte, farklı bir çeşitte ya da başka bir mevsimde, havada ve aydınlatmada kullanıldığında aynı performansı elde edeceğini kanıtlamaz. |
| 2. Çiftlik koşullarına uygunluğu | Model yalnızca öğrendiği veriler üzerinde değil, çiftliğimin koşullarına benzeyen yeni veriler üzerinde de denendi mi? | Eğitime dâhil edilmemiş çiftliklerde, bölgelerde ya da mevsimlerde sınanması veya hedef ürün ve ortamda yerel bir denemeden geçip kabul edilebilir bir performans düzeyini koruması. | Uygulamanın, cihazın ya da sensörün her gün istikrarlı biçimde ya da zayıf internet, elektrik kesintileri ve veri kıtlığı altında çalışmayı sürdüreceğini kanıtlamaz. |
| 3. İşletimde sistem performansı | Veriler, uyarılar ve öneriler eksiksiz ve ihtiyaç duyduğum anda ulaşıyor mu? | Sensörlerin ve uygulamaların istikrarlı biçimde çalışması; bir hastalık ya da sulama uyarısının müdahale zamanı geçmeden ulaşması ve bağlantı veya hizmet arızalandığında güvenli bir yedek yolun bulunması. | Çiftçinin uyarıyı anladığını, ona güvendiğini ya da eldeki zaman, kaynak ve ekipmanla öneriyi yerine getirebildiğini kanıtlamaz. |
| 4. Tarımsal kararın iyileşmesi | Öneri, çiftçinin alışılmış olandan daha iyi bir eylemde bulunmasına yardım etti mi? | Uyarının şüpheli bir kesimin erken incelenmesini, sulamanın zamanının ve miktarının ayarlanmasını, gereksiz bir tedaviden kaçınılmasını ya da hassas bir vakanın bir uzmana yönlendirilmesini sağlaması. | Ürünün, kârın ya da kaynak tüketiminin iyileştiğini tek başına kanıtlamaz; karar sağlam olabilir, ama etkisi hava, girdi yokluğu ya da uygulamanın gecikmesi gibi başka etkenlerce engellenebilir. |
| 5. Çiftlikteki fiilî etki | Sistem kullanıldıktan sonra çiftçi için asıl önem taşıyan sonuç iyileşti mi? | Açık bir başlangıç düzeyiyle karşılaştırıldığında kayıpların ya da toplam üretim maliyetinin düşmesi, ürün kalitesinin veya verim istikrarının iyileşmesi, su ve enerji tüketiminin azalması ya da güvenlik risklerinin gerilemesi. | Etkinin her çiftlikte ya da her mevsimde kendiliğinden yineleneceğini kanıtlamaz; sonuç ürüne, iklime, işletme büyüklüğüne, fiyatlara ve kullanım biçimine göre değişebilir. |
Bu düzeyler, aynı başarının farklı adları değil; tek bir zincirin halkalarıdır. Bir model doğru olup yerel ortama uygun olmayabilir; o ortama uygun olup hizmet arızalanabilir; hizmet işleyip öneri çok geç ulaşabilir ya da muğlak kalabilir; çiftçi daha iyi bir karar verip istisnai bir mevsimde bunun faydası görünür olmayabilir. Bu nedenle, tüm yol izlenmedikçe teknolojiye ilişkin hiçbir yargı tamamlanmaz: Tahminin doğruluğundan çiftliğe uygunluğuna, oradan zamanında ulaşmasına, sonra değiştirdiği karara ve nihayet sahada ve çiftçinin hesaplarında yarattığı etkiye kadar. Kanıt zinciri şöyle gösterilebilir: Geçerli veri ↓ Uygun bir model ↓ Bağımsız doğrulama ↓ Güvenilir işletim ↓ Anlaşılır bir öneri ↓ Yapılabilir ve zamanında bir eylem ↓ Tarımsal bir sonuç ↓ Ekonomik, çevresel ve toplumsal etki Bir iddianın eksik bir halkayı atlamaya hakkı yoktur. Mevcut kanıt model performansına ilişkinse, sonuç o sınırlar içinde çerçevelenir. Kanıt kısa bir saha denemesiyse, mevsimler boyunca istikrarlı işletim diye sunulmaz. Ve verim değişirse, değişiklik hava durumu, alan, girdiler ve başlangıç düzeyi göz önüne alınmadan sisteme atfedilmez.
4. Farklı Görevler İçin Farklı Ölçütler: Bildirilen Sayı Ne Anlama Geliyor?
Çalışmalar ve ürün sayfaları "yüksek doğruluk", "gelişmiş performans" ve "önceki modelleri geçen sonuçlar" gibi ifadelerle dolu. Ne var ki bir sayı, ne denli göz kamaştırıcı görünürse görünsün, kendi kendini açıklamaz. Doğruluk ne kadar yüksekti? diye sormadan önce daha önceki bir soruyu sormalıyız: Hangi görev ölçülüyordu ve orada ne tür bir hata ortaya çıkabilir? Yapay zekâ, bütünüyle farklı soruları yanıtlamak için kullanılabilir:
- Bitki enfekte mi, sağlıklı mı?
- Meyve ya da böcek görüntünün neresinde?
- Yaprağın etkilenen kısmının alanı ne kadar?
- Sezon sonunda beklenen verim nedir?
- Robot meyveyi zarar vermeden toplayabilir mi?
- Sulama sistemi su tüketimini fiilen azalttı mı?
Bu görevlerin hepsi aynı ölçüyle ölçülemez. Sayılarını tek bir tabloya koyup uygulamaları, tek bir testte yarışıyorlarmış gibi en yüksekten en düşüğe sıralamak da caiz değildir. Her ölçüt performansın bir yönünü aydınlatırken diğer yönleri gölgede bırakır. Okurun, bu ölçütlerin ardındaki matematiksel denklemleri ezberlemesi gerekmez. Önemli olan üç şeyi anlamaktır: Ölçüt hangi soruyu yanıtlar, hangi hatayı gizleyebilir ve tarımsal kararla ilişkisi nedir? Birincisi: Görev bir durumu sınıflandırmak olduğunda — bitki hastalıklı mı, sağlıklı mı? Bir uygulamanın bir bitki yaprağının görüntüsünü aldığını ve onu iki durumdan birine sınıflandırdığını varsayalım: "hastalıklı" ya da "sağlıklı". Bu basit görünebilir; ancak model dört farklı sonuç üretebilir:
| Gerçek durum | Modelin söylediği | Sonuç çiftçi için ne anlama geliyor? |
|---|---|---|
| Bitki hastalıklı | Hastalıklı dedi | Denetime ya da erken müdahaleye yol açabilecek doğru bir saptama |
| Bitki hastalıklı | Sağlıklı dedi | Modelin kaçırdığı bir enfeksiyon; hastalık yayılmayı sürdürebilir |
| Bitki sağlıklı | Sağlıklı dedi | Çiftçiyi gereksiz bir denetimden ya da tedaviden kurtarabilecek doğru bir dışlama |
| Bitki sağlıklı | Hastalıklı dedi | Zaman tüketebilecek ya da gereksiz bir denetime veya tedaviye yol açabilecek yanlış bir alarm |
Bu dört sonuç, sınıflandırma ölçütlerinin çoğunun türetildiği temeldir. Ölçütler arasındaki farklar istatistiksel bir lüks değildir; her biri hatanın başka bir yönüne bakar. Genel doğruluk: model kaç yanıtı doğru bildi? Genel doğruluk, ister doğru saptanmış hastalıklı vakalar ister doğru dışlanmış sağlıklı vakalar olsun, tüm tahminler içinde doğru olanların oranıdır. Model yüz görüntüyü inceleyip bunların doksanını doğru bilirse genel doğruluğu %90'dır. Bu sayı açık görünür; ancak sınıflardan biri diğerinden çok daha kalabalık olduğunda yanıltıcı hâle gelebilir. Örneğin yüz görüntümüz olduğunu varsayalım: doksan beşi sağlıklı bitkileri, yalnızca beşi hastalıklı bitkileri gösteriyor olsun. Zayıf bir model tüm görüntülerin sağlıklı olduğunu beyan ederse doksan beş vakada doğru çıkar ve genel doğruluğu %95 olur. Oysa beş enfeksiyonun bir tanesini bile saptamamıştır. Yani genel doğruluk şu soruyu yanıtlar: Model genel olarak ne sıklıkla doğru bildi? Ne var ki bu örnekteki daha önemli soruyu tek başına yanıtlamaz: Model gerçek enfeksiyonların kaçını saptayabildi? Duyarlılık (Recall/Sensitivity) ya da hastalıklı vakaları saptama kabiliyeti Duyarlılık (recall), hassasiyet (sensitivity) olarak da bilinir ve gerçekten hastalıklı olan tüm vakalar içinde modelin başarıyla saptadığı vakaların oranını ölçer. Çiftçinin dilinde soru şudur: Hastalık fiilen mevcutsa, sistemin bunu bir uyarı vermeden geçirmek yerine saptama olasılığı nedir? Duyarlılık, özellikle hastalıklı bir vakayı kaçırmanın çok tehlikeli olduğu durumlarda önemlidir — örneğin hızla yayılan bir hastalıkta, bir sürüde sağlık bozukluğunun erken bir işaretinde ya da zamanında saptanırsa sınırlandırılabilecek bir zararlıda. Yüksek duyarlılık, modelin daha az hastalıklı vaka kaçırdığı anlamına gelir. Ama verdiği her uyarının doğru olduğu anlamına zorunlu olarak gelmez; sistem, bir kısmı doğru bir kısmı yanlış çok sayıda uyarı vererek duyarlılığı artırabilir. Seçicilik (Specificity) ya da sağlıklı vakaları dışlama kabiliyeti Seçicilik, modelin sağlıklı olarak doğru biçimde tanımladığı sağlıklı vakaların oranını ölçer. Buradaki soru şudur: Bitki sağlıklıysa, sistemin onu hastalıklı diye yanlış sınıflandırmama olasılığı nedir? Seçicilik, yanlış alarmların yüksek maliyet taşıdığı durumlarda önem kazanır: denetim için ekip göndermek, üretim işlemlerini aksatmak, laboratuvar numunesi almak ya da gereksiz bir tedaviyi gündeme getirmek gibi. Bununla birlikte tek başına yüksek seçicilik, modelin hastalıklı vakaları saptadığını güvence altına almaz. Model, uyarı vermekte çok ihtiyatlı olabilir ve böylece yanlış alarm sayısını azaltabilir; ancak bunun bedeli gerçek enfeksiyonları kaçırmak olur. Kesinlik (Precision): olumlu uyarıların kaçı doğruydu? Arapçada bu ölçüt bazen iḥkām ("kesinlik, sağlamlık") diye karşılanır; ancak bu terim okuyucular için açık olmayabilir. Pratik anlamı, adının düşündürdüğünden daha basittir: Sistemin hastalıklı olduğunu beyan ettiği tüm vakalar içinde gerçekten hastalıklı olanların sayısı nedir? Sistem on uyarı veriyor ve denetim bunlardan yalnızca altısının doğru olduğunu gösteriyorsa kesinliği kusursuz değildir: dört uyarı yanlıştır. Bu ölçüt, bir uyarının takibinin maliyetli olduğu ya da hassas bir müdahaleye yol açabileceği durumlarda önem taşır. Her uyarı bir laboratuvar analizini, bir uzman ziyaretini ya da üretim hattının bir bölümünün durdurulmasını gerektiriyorsa, sistemin hastalıklı vakaların çoğunu yakalaması yetmez; kullanıcıyı yanlış alarmlara boğmaktan da kaçınmalıdır. Burada kesinlik ile duyarlılık arasındaki fark netleşir:
- Duyarlılık şunu sorar: fiilen hastalıklı olan vakalardan modelin saptadığı kaç tanedir?
- Kesinlik şunu sorar: modelin hastalıklı olduğunu beyan ettiği vakalar içinde kaç uyarı doğruydu?
Bir model bir yanda güçlü, diğer yanda zayıf olabilir; bu nedenle ölçüt seçimi, tarımsal bağlamda hatanın gerçek dünyadaki sonuçlarına bağlanmalıdır. F1 skoru: model, enfeksiyonu saptamayı uyarılarının doğruluğuyla dengeliyor mu? F1 skoru, duyarlılık ile kesinliği tek bir değerde birleştirir. Model iki şeyi aynı anda başardığında yükselir:
- Hastalıklı vakaların iyi bir oranını saptamak.
- Çok sayıda yanlış uyarı vermekten kaçınmak. Bu, enfeksiyonu kaçırmamak ile onunla ilgili uyarıları abartmamak arasındaki dengeye ilişkin özlü bir skor olarak görülebilir. Model her enfeksiyonu saptıyor ama çok sayıda yanlış uyarı veriyorsa F1 skoru olması gerektiği kadar yüksek olmaz. Az sayıdaki uyarısı doğru olup çok sayıda enfeksiyonu kaçırıyorsa da durum aynıdır. Yine de iki boyutu tek bir sayıda birleştirmenin bir bedeli vardır: hata türlerinden birinin diğerinden daha tehlikeli olduğu gerçeğini gizleyebilir. Hızla yayılan salgın bir hastalıkta tek bir enfeksiyonu kaçırmak, birkaç sağlıklı vakayı denetime göndermekten daha zararlı olabilir. Buna karşılık yüksek maliyetli ya da yüksek riskli bir müdahalede yanlış alarmın kendisi ciddi bir soruna dönüşebilir. Dolayısıyla F1 skoru, modelin kendiliğinden "güvenli" ya da "uygun" olduğunu söylemez; yalnızca iki tür performans arasında belli bir matematiksel dengeye ulaştığını söyler. Tarımda gereken denge, hatanın sonuçlarına ve kararın niteliğine göre belirlenir.
Karışıklık matrisi: modelin nerede doğru, nerede yanlış olduğunu gösteren bir tablo Kafa karıştırıcı adına rağmen karışıklık matrisi bir matematik bilmecesi değildir; genel doğruluk gibi tek bir ölçüt de değildir. Yalnızca yukarıdaki dört sonucu bir araya getiren bir tablodur:
- Doğru saptanmış hastalıklı vakalar.
- Modelin kaçırdığı hastalıklı vakalar.
- Doğru dışlanmış sağlıklı vakalar.
- Hastalıklı diye yanlış sınıflandırılmış sağlıklı vakalar. Karışıklık matrisinin değeri, hataları toplu bir sayının ardına gizlememesinde yatar. İki model aynı genel doğruluğa ulaşabilir; ama biri tehlikeli hastalıkları kaçırırken diğeri çok sayıda yanlış uyarı verebilir. Toplu sayı onları benzer gösterebilir, ama hata tablosu çiftçi için önemli olan farkı açığa çıkarır. Bu nedenle terime eşlik edebilecek daha yalın ad şudur:
Karışıklık matrisi: doğru ve yanlış yanıt türlerini gösteren bir tablo. Teşhiste uygun ölçütü nasıl seçeriz? Her durumda geçerli tek bir en iyi ölçüt yoktur. Seçim, tarımsal soruya ve her hata türünün sonucuna bağlıdır.
- Hastalığı kaçırmak geniş bir yayılıma ya da geri döndürülmesi güç kayıplara yol açabiliyorsa Duyarlılık yüksek bir öncelik hâline gelir.
- Her uyarıya yanıt vermek maliyetliyse ya da gereksiz bir müdahaleye yol açabiliyorsa Kesinlik ve Seçicilik daha önemli olur.
- Sınıflar dengesizse tek başına genel doğruluk yeterli değildir.
- Vakaları saptama ile uyarıların doğruluğu arasındaki dengeyi özetleyen karşılaştırmalı bir rakam istiyorsak, hataların ayrıntılarına geri dönmek koşuluyla F1 kullanabiliriz.
- Modelin tam olarak nerede yanıldığını bilmek istiyorsak karışıklık matrisine başvururuz.
Uygulama, yalnızca bu değerlendirmeye dayanarak ilk tanımadan hassas bir tedavi önerisine geçmemelidir. Bir modelin şüpheli bir görüntüyü ayırt etmedeki başarısı, tek başına nedensel teşhisin doğruluğunu ya da önerilen müdahalenin uygunluğunu tesis etmez. Yine de tarla denetimine, laboratuvar analizine, uzman incelemesine ve resmî etiket ile yerel mevzuata başvurmaya ihtiyaç duyulabilir. İkincisi: görev bir nesnenin konumunu belirlemek ya da sınırlarını çizmek olduğunda Sınıflandırma genellikle şöyle bir soruyu yanıtlar: "Görüntüde bir böcek var mı?" Ama bazı uygulamalar daha kesin bilgi ister:
- Böcek tam olarak nerede bulunuyor?
- Görüntüde kaç meyve göründü?
- Yabani otun ürün sıraları arasındaki konumu nedir?
- Yaprağın ne kadarlık alanı etkilendi?
- Sağlıklı kısım nerede bitiyor, hasarlı doku nerede başlıyor? Burada sınıflandırmadan daha ayrıntılı iki görsel göreve geçeriz:
- Saptama (Detection): sistem, nesnenin konumunu bir kutu ya da yaklaşık bir alan içinde belirler; her meyvenin çevresine bir kutu çizmek gibi.
- Bölütleme (Segmentation): sistem, nesnenin ya da bölgenin kesin sınırlarını çizer; yapraktaki bir hastalık lekesinin alanını daha ayrıntılı biçimde tanımlamak gibi. Soru artık yalnızca "Nesne mevcut mu?" olmadığı için, nesnenin konumunu ve sınırlarını, referans görüntülerde uzmanların belirlediği doğru konumla karşılaştıran ölçülere ihtiyaç duyarız.
Kesişim/Birleşim oranı (IoU): tahmin edilen bölge doğru bölgeyle ne ölçüde örtüştü? Bir uzmanın yapraktaki bir hastalık lekesinin doğru sınırlarını çizdiğini, ardından modelin aynı lekeyi temsil ettiğini öngördüğü bir bölge çizdiğini varsayalım. Kesişim/Birleşim ölçüsü iki alanı karşılaştırır:
- uzmanın belirlediği ile modelin belirlediği arasındaki ortak kısım.
- iki bölgenin birlikte kapladığı toplam alan. Gerçek örtüşme ne kadar büyük, fazla ya da eksik kısım ne kadar küçükse ölçünün değeri o kadar yüksek olur. Görsel olarak şöyle anlaşılabilir:
- iki bölgenin tam örtüşmesi, sınırların belirlenmesinde ideal performans anlamına gelir.
- kısmi örtüşme, modelin bir kısmı doğru, bir kısmı yanlış bildiği anlamına gelir.
- hiç örtüşme olmaması, modelin bütünüyle farklı bir konumu belirlediği anlamına gelir. Ama bu ölçüde yüksek bir değer, bölgenin belirli bir tarımsal görevi yerine getirecek ölçüde kesin biçimde belirlenip belirlenmediği sorusunu yanıtlamaz. Etkilenen alanın genişliğini kestirmek için uygun olabilir; ancak daha yüksek uzamsal kesinlik gerektiren bir robot kolunu yönlendirmek için yetersiz kalabilir.
Dice katsayısı: iki alan arasında ne derece benzerlik var? Dice katsayısı da modelin belirlediği bölge ile uzmanın belirlediği referans bölge arasındaki benzerlik derecesini ölçer. Hesaplama yöntemi farklı olsa da kavram olarak Kesişim/Birleşim oranına yakındır. Okuyucunun iki ölçü arasındaki matematiksel farkı ezberlemesi gerekmez. Önemli olan, her ikisinin de şu soruyu yanıtlamaya çalışmasıdır: Model, önemli kısımları dışarıda bırakmadan ya da kendisine ait olmayan alanlar eklemeden doğru bölgeyi ne ölçüde çizdi? Dice katsayısı görüntü bölütleme görevlerinde sıkça karşımıza çıkar; dokuların, yaprakların, meyvelerin ya da etkilenmiş alanların belirlenmesi de buna dâhildir. Ama o, görsel benzerliğin bir ölçüsü olarak kalır; bu bölütlemenin üzerine kurulacak tarımsal kararın başarısının eksiksiz bir kanıtı değildir. Ortalama kesinlik ortalaması (mAP): sistem, nesneleri bulma ve konumlarını belirlemede nasıl bir performans gösterdi? mAP, görüntülerdeki nesne saptama sistemlerinin değerlendirilmesinde sıkça kullanılır; meyvelerin, böceklerin, yabani otların ya da hayvanların saptanması gibi. Birden çok sınıf ya da değerlendirme koşulu boyunca saptama kalitesini özetleyen bileşik bir ölçüdür. Hesaplama formülüne girmek yerine işlevi şöyle anlaşılabilir: Sistem, istenen nesneleri buldu mu, orada olmayan nesneleri saptamaktan kaçındı mı ve konumlarını doğru konumlarla kabul edilebilir bir örtüşme derecesiyle belirledi mi? mAP değeri doğrudan bir "tarımsal başarı oranı" olarak okunmamalıdır. Bir model, bir görüntü kümesi içinde meyveleri saptamada yüksek bir rakama ulaşıyorsa bu, robotun meyvelerin aynı oranını başarıyla toplayacağı anlamına gelmez. Görü sistemi meyveyi iyi görebilir; ardından kol ona erişemeyebilir ya da onu fazla sıkı kavrayabilir ya da ekonomik olmayan bir süre harcayabilir ya da tarladaki aydınlatma, toz ve dal hareketi altında çalışamayabilir. Bir robotik sistemde görü yalnızca ilk halkadır; ardından başka halkalar gelir: hedefi görmek ← konumunu belirlemek ← hareketi planlamak ← ona ulaşmak ← eylemi gerçekleştirmek ← hasardan kaçınmak ← görevi kabul edilebilir süre ve maliyet içinde tamamlamak. Bu nedenle görü doğruluğu, tam tarımsal işlemin başarısından ayırt edilmelidir. Üçüncüsü: görev bir sayıyı öngörmek olduğunda — verim, fiyat ya da talep Bazı uygulamalarda model bitkiyi "hastalıklı" ya da "sağlıklı" diye sınıflandırmaz, bir görüntü içinde meyve de aramaz; bunun yerine sayısal bir değer öngörür:
- beklenen verim miktarı.
- ürünün su ihtiyacı.
- belirli bir dönemdeki beklenen fiyat.
- bir ürüne yönelik talep hacmi.
- kalan depolama ömrü.
- gereken yem ya da enerji miktarı. Bu durumlarda, modelin öngördüğü sayı ile fiilen gerçekleşen sayı arasındaki farkın büyüklüğünü bilmemiz gerekir. Bu farkı hesaplamanın birkaç yolu vardır; çünkü her yöntem başka bir yönü açığa çıkarır.
Ortalama mutlak hata (MAE): model ortalamada ne kadar yanılıyor, hem de çiftçinin anladığı bir birimde? Model hektar başına 5,5 ton verim öngörmüşse ve gerçek verim 6 ton olmuşsa, bu durumdaki hata hektar başına yarım tondur. Ortalama Mutlak Hata, modelin fazla mı yoksa eksik mi tahmin ettiğine bakmaksızın bu hataların büyüklüklerini tüm vakalar boyunca toplar ve ardından ortalamasını hesaplar. Başlıca avantajı, değişkenin kendi biriminde ifade edilmesidir:
- verim öngörülürken hektar başına ton.
- fiyat öngörülürken kilogram başına lira.
- su tüketimi öngörülürken metreküp.
- depolama ömrü öngörülürken gün. Bu nedenle pratik bir soruya en kolay çevrilen ölçülerden biridir:
Bu modele dayanırsam, öngörüsü ortalamada gerçeklikten ne kadar uzak olacak? Ama ortalama, modelin çok büyük hatalar yaptığı birkaç vakayı gizleyebilir; işte burada, o hatalara daha fazla ağırlık veren başka bir ölçüte ihtiyaç duyulur. Karekök ortalama kare hata (RMSE): ortalamanın gizlememesi gereken büyük hatalar var mı? RMSE de öngörü hatasını ölçer, ancak büyük hataları küçüklerden daha ağır cezalandırır. Modelin öngörülerinin çoğu gerçekliğe yakınsa ama bazı mevsimlerde ya da bölgelerde ağır biçimde başarısız oluyorsa, bu başarısızlıkların etkisi bu ölçüde daha açık biçimde görünür. Pratik fikri şudur: Yalnızca ortalama hatayı bilmek istemeyiz; büyük hataların sıradan vakalarmış gibi geçip gitmemesini de isteriz. Bu, hatadaki büyük bir sıçramanın kararı etkilediği durumlarda daha da önemli hâle gelir. Verim öngörüsündeki sınırlı bir hata yönetilebilir olabilir; ama büyük bir sapma uygun olmayan bir satış sözleşmesine, yetersiz depolama kapasitesine ya da nakliye ve finansmanın yanlış kestirilmesine yol açabilir. MAE gibi RMSE de değişkenin kendi biriminde ifade edilir; ancak değeri, büyük hatalı vakalardan daha yüksek derecede etkilenir. Ortalama mutlak yüzde hata (MAPE): gerçek değere göre yüzde kaçlık bir hata var? MAPE, hatayı bir yüzdeye çevirir; bu da onu çekici ve sunulması kolay kılar. "Ortalama hata şu kadar yüzdeye ulaştı" ifadesi, ürünler ve bölgeler arasında değişebilen bir birimdeki rakamdan daha anlaşılır görünür. Ama bu ölçü, gerçek değer çok küçük ya da sıfıra yakın olduğunda yanıltıcı hâle gelebilir. Basit bir sayısal hata, küçük bir değere bölündüğünde vakanın pratik önemini yansıtmayan devasa bir yüzdeye dönüşebilir. Bu nedenle ona dayanmadan önce şunu sormalıyız:
- Gerçek değerler sıfıra yaklaşabilir mi?
- Yüzde, hatayı anlamanın gerçekten en uygun yolu mudur?
- Hatanın özgün birimdeki büyüklüğü de bildirildi mi?
- Yüzde; ürünler, bölgeler ya da mevsimler arasındaki önemli farkları gizliyor mu? Yüzdenin okunma kolaylığı, onun her zaman uygun olduğu anlamına gelmez.
Belirlilik katsayısı (R²): model, sonuçlardaki değişkenliğin ne kadarını açıklayabildi? Belirlilik katsayısı, modelin kullanılan veri ve değerlendirme yöntemi çerçevesinde, gözlenen değerlerdeki değişkenliği açıklayabilme derecesini ölçer. Verimin, birden çok etken nedeniyle tarlalar ve mevsimler arasında farklılaştığını varsayalım. Model, bu değişkenliğin bir kısmını kendisine beslenen verilere dayanarak açıklamaya çalışır: hava durumu, toprak, çeşit ve tarımsal uygulamalar gibi. Belirlilik katsayısı, test çerçevesi içinde istatistiksel bir başlangıç düzeyiyle karşılaştırıldığında modelin varyansın ne kadarını temsil edebildiğini gösterir. Ama bu ölçüt sıkça yanlış yorumlanır. Bir çalışma, kullandığı değerlendirme ortamında R²'nin 0,92'ye ulaştığını bildiriyorsa [SRC006], bunu şu ifadeye çevirmek geçerli değildir: "Sistem %92 doğrudur." İki ifade aynı anlama gelmez. Bir R² değeri bize doğrudan şunları söylemez:
- Modelin kaç ton ya da kilogram yanıldığını.
- Hataların ekonomik olarak kabul edilebilir olup olmadığını.
- Kurak bir mevsimde ya da bir sıcak hava dalgasında başarılı olup olmadığını.
- Başka bir bölgede performansını koruyup korumadığını.
- Öngörünün, kararın değiştirilmesine izin verecek zamanda ulaşıp ulaşmadığını.
- Tarihsel bir ortalamadan ya da daha basit, daha az maliyetli bir kuraldan daha iyi olup olmadığını. Bu nedenle belirlilik katsayısını, hatanın büyüklüğünü anlaşılır bir birimde gösteren bir ölçütle birlikte — MAE ya da RMSE gibi — ve veriye, yere, mevsime ve test yöntemine ilişkin açık bir betimlemeyle birlikte okumak yeğlenir.
Ölçütlerin pratik bir özeti
| Görev türü | Ölçüt | Yanıtladığı basit soru | Nelere dikkat etmeli |
|---|---|---|---|
| Bir bitkiyi ya da hayvanı sınıflandırmak | Genel doğruluk | Model genel olarak kaç vakayı doğru sınıflandırdı? | Sağlıklı vakalar hastalıklı olanlardan çok daha fazlaysa yüksek görünebilir |
| Hastalık saptama | Duyarlılık | Fiilen hastalıklı vakalardan kaçını saptadı? | Daha çok yanlış alarm pahasına yükselebilir |
| Sağlıklı vakaları belirleme | Seçicilik | Sağlıklı vakalardan kaçını doğru belirledi? | Tek başına, modelin hastalık saptama kabiliyetini kanıtlamaz |
| Uyarıların doğruluğunu değerlendirme | Kesinlik | Tüm hastalık uyarıları içinde kaçı doğruydu? | Bir dizi enfeksiyonu kaçırırken yüksek olabilir |
| Saptama ile uyarı kesinliğini dengeleme | F1 | Model, hastalık saptamakla yanlış uyarıları azaltmak arasında denge kurdu mu? | İki hata türünün maliyetindeki farkları gizler |
| Sınıflandırma hatalarını çözümleme | Karışıklık matrisi | Model nerede doğru bildi, hastalığı nerede kaçırdı, nerede yanlış alarm verdi? | Tarımsal yararlılığa dair nihai bir hüküm değildir |
| Görüntüde bir nesneyi konumlandırma | mAP | Sistem hedefleri buldu ve testler boyunca kabul edilebilir biçimde konumlandırdı mı? | Robotun ya da bir bütün olarak tarımsal işlemin başarısını kanıtlamaz |
| Görüntüdeki iki bölgeyi karşılaştırma | IoU | Modelin belirlediği bölge doğru bölgeyle ne kadar örtüştü? | Tek başına, doğruluğun amaçlanan kullanım için yeterli olup olmadığını belirlemez |
| Etkilenen bir alanın sınırlarını çizme | Dice | Öngörülen alan referans alana ne ölçüde benzedi? | Görsel benzerliği ölçer; ona dayanan kararın sonraki sonuçlarını değil |
| Verim ya da fiyat öngörme | MAE | Öngörü hatası ortalamada ne kadar büyük, hem de anlaşılır bir birimde? | Bazı büyük hataları gizleyebilir |
| Büyük hataları açığa çıkarma | RMSE | Daha fazla ağırlık verilmesi gereken büyük sapmalar var mı? | Sınırlı sayıda uç vakadan ağır biçimde etkilenebilir |
| Hatayı yüzde olarak ifade etme | MAPE | Hata, gerçek değerin ortalamada hangi oranını temsil ediyor? | Sıfıra yakın değerlerde istikrarsız ya da yanıltıcı hâle gelir |
| Değerlerdeki değişkenliği açıklama | R² | Model, bu değerlendirme içinde değişkenliğin ne kadarını açıklayabildi? | Bir doğruluk yüzdesi değildir ve hatanın büyüklüğünü tarımsal bir birimde göstermez |
Doğru sayı, karara elverişli değilse yeterli değildir Ölçütü anladıktan sonra daha önemli soru ortada durmayı sürdürür: değerlendirme, çiftçinin fiilen ihtiyaç duyduğu özelliği ölçtü mü? Bir verim öngörüsü gerçekliğe yakın olabilir; ama girdi satın alma ya da depolama ve pazarlama sözleşmelerini düzenleme zamanı geçtikten sonra ulaşabilir. Bir görü modeli bir zararlıyı etkin biçimde saptayabilir; ama izleme gerektiren bir vakayla acil müdahale gerektiren bir vakayı ayırt etmekte başarısız olabilir. Otomatik bir sistem meyvenin konumunu doğru belirleyebilir; ama kolu, dallara zarar vermeden ona ulaşamayabilir. Bir sulama sistemi, verimin kilogramı başına kullanılan su miktarını azaltırken su kaynağından yapılan toplam çekimi azaltmayabilir. Bu nedenle herhangi bir teknik ölçüt okunduktan sonra şu sorular sorulmalıdır:
- Sayı tam olarak hangi görevi ölçtü?
- Test hangi veriyle ve hangi ortamda yapıldı?
- Toplu sayı ne tür hataları gizliyor?
- Çıktı, müdahale penceresi kapanmadan önce ulaştı mı?
- Sistem, daha basit bir alternatiften daha iyi bir performans gösterdi mi?
- Çiftçi öneriyi anlayabildi ve onu yerine getirebildi mi?
- Maliyet ve risk hesaba katıldıktan sonra fayda yerinde kaldı mı?
Görüntü sınıflandırmayı mı, nesne konumlandırmayı mı, miktar öngörmeyi mi, yoksa tam bir tarımsal işlemin başarısını mı ölçtü?
Bunlar, sistemin kullanılacağı ürünü, bölgeyi, mevsimi ve ekipmanı temsil ediyor mu?
Ve daha ciddi sorun vakayı kaçırmak mı, yanlış alarm vermek mi, yoksa öneriyi geciktirmek mi?
Sulama, mücadele ya da hasat zamanı geçtikten sonra gelen doğru bir öngörü, yararlı bir karar değil, gecikmiş bir bilgidir.
Rutin denetim, açık bir ziraî kural, tarihsel bir ortalama ya da daha az maliyetli bir danışmanlık hizmeti gibi.
Öneri muğlaksa, mevcut olmayan kaynaklar gerektiriyorsa ya da yerel kısıtları göz ardı ediyorsa teknik doğruluk faydaya dönüşmez.
Cihazların fiyatı, bağlantı, bakım, abonelik, veri girişi, eğitim ve olası hatalar dâhil.
Özetle ölçütler, okuyucunun ezberlemesi istenen esrarlı formüller değildir; teknolojiye kendiliğinden meşruiyet bahşeden madalyalar da değildir. Belirli soruları yanıtlamaya yarayan araçlardır. Anlayışlı bir okuyucu, neyin ölçüldüğünü, neyin dışarıda bırakıldığını, hatanın maliyetini kimin üstlendiğini ve o performansın test ekranıyla tarladaki yararlı bir karar arasındaki mesafeyi kapatıp kapatamadığını sormadan önce yüksek bir sayıya kapılmaz.
5. Olgunluk Merdiveni: İddia Edilen Bir Özellikten Gösterilmiş Tarımsal Etkiye
Teknik yazın, bazen bir ürünün durumunu iki kelimeye indirger: "var" ya da "yok". Oysa fikir ile tarımsal etki arasında pek çok düzey vardır ve her düzeyin kendine uygun kanıtı bulunur. Bu kitap, olgunluğu anlamak için editoryal bir merdiven önerir. Bu, resmî bir düzenleyici standart değil; okuyucunun bir özelliğin varlığından bir etki iddiasına sıçramayı önlemesine yardımcı olan bir araçtır.
| Düzey | Kanıt neyi ispatlar? | Henüz neyi ispatlamaz? |
|---|---|---|
| 1. Beyan edilmiş amaç | Kuruluş, sistemin belirli bir görev için tasarlandığını söyler | Özelliğin uygulandığını ya da çalıştığını |
| 2. Uygulanmış bileşen | Görevin bir kısmını yerine getiren kod, arayüz ya da prototip vardır | Teknik gösterimin ya da laboratuvarın dışında çalıştığını |
| 3. İç performans | Model, geliştiricinin ya da çalışmanın verisi üzerinde değerlendirilmiştir | Performansının bağımsız veriye aktarılacağını |
| 4. Dış doğrulama | Model kurma sürecinin dışındaki veriyle ya da bu sürecin dışındaki bir tarafça sınanmıştır | Günlük tarımsal işletimde ayakta kalacağını |
| 5. Saha denemesi | Bilinen bir süre ve beyan edilmiş koşullar altında gerçek bir çiftlikte ya da gerçek bir değer zincirinde kullanılmıştır | Mevsimler, konumlar ve kullanıcılar boyunca performansını sürdüreceğini |
| 6. Yinelenen işletim | İzleme, destek, kurtarma ve açık sorumlulukları olan bir hizmet içinde çalışır | Net bir ekonomik ya da çevresel fayda sağladığını |
| 7. Ölçülmüş etki | Uygun bir başlangıç düzeyine göre tarımsal, ekonomik ya da güvenliğe ilişkin bir sonuç değişmiştir | Etkinin her bağlamda yineleneceğini |
Bir araştırma modelinden, iddia etmediği ticari işletim kanıtını talep etmek nasıl adil değilse, ticari bir ürünün bir prototip modelin sonucunu tarla etkisinin kanıtı olarak kullanması da kabul edilebilir değildir. Bir sistem bir düzeyde ileri, başka bir düzeyde geride olabilir. Yazılım mimarisi olgun olabilirken tarımsal kanıt hâlâ ön aşamada kalabilir. Bir tarla denemesi başarılı olabilirken veri hakları ya da bakım planı olgunlaşmamış olabilir. Dolayısıyla boyutları farklılaştığında hazırlık düzeyi, tek bir puana indirgenemez. Meşru olmayan sıçramayı açığa çıkaran üç soru Bir uygulamaya dair herhangi bir tanımı okurken şunu sorun:
- Kanıtın fiilen ortaya koyduğu en yüksek düzey nedir?
- Pazarlama ifadesi hangi düzeye sıçrıyor?
- İkisi arasındaki eksik halka nedir?
Kaynak bir bileşenin varlığını ortaya koyarken ifade kayıpların azaltılmasından söz ediyorsa, gereken şey ifadenin düzeltilmesi değil, henüz kurulmamış olan mesafeyi kat eden kanıttır.
6. Bölgesel Aktarılabilirlik Sınırları: Modelleri Tarımsal Ortamlar Arasında Taşımak
Bir tarımsal yapay zekâ modelinin sonucunu, üretildiği test koşullarıyla sınırlamak aşırı ihtiyatlı görünebilir; ama şu pratik soru sorulduğunda bu ihtiyatın önemi açığa çıkar: Algoritma, eğitim ve test ortamından çıkıp iklimi, toprağı, ürünleri ve tarım uygulamaları farklı bir tarlada kullanıldığında performansını koruyacak mı? Model soyut biçimde "tarımı" öğrenmez; belirli topraklardan, iklimlerden, çeşitlerden, cihazlardan ve ölçüm yöntemlerinden gelen veriler içindeki istatistiksel ilişkileri öğrenir. Bu unsurlardan biri değiştiğinde model zorunlu olarak başarısız olmaz; ama önceki performansı, doğrudan bir vaat olarak geçerliliğini yitirir ve yeniden doğrulama gerektiren bir varsayıma dönüşür.
| Farklılık boyutu | Ne değişti? | Olası etki | Güvenmeden önce gereken |
|---|---|---|---|
| Toprak ve iklim | Nemli ılıman toprak ← kurak ya da tuzlu toprak | Spektral yansıma ve tepki eğrileri değişir | Yerel numuneler, kalibrasyon ve saha doğrulaması |
| İşletme büyüklüğü | Büyük homojen çiftlik ← küçük karma işletme | Homojenlik varsayımı zayıflar | Yeniden eğitim ya da kullanım kapsamının daraltılması |
| Bağlantı kalitesi | İstikrarlı şebeke ← kesintili bağlantı | Bulut çıkarımı başarısız olur ve veri bayatlar | Güvenli yerel kip ve son eşitlemenin kaydı |
| Çeşit ve genetik tip | Sınırlı ticari çeşitler ← yerel ya da atalık çeşitler | Belirtiler ya da görünümler eğitim sınıflarının dışına düşer | Bir "bilinmeyen" sınıfı ve bir üst mercie taşıma yolu |
| Kamera ve sensör | Belirli bir standarda sahip cihaz ← daha ucuz ya da daha eski cihaz | Aydınlatma, çözünürlük ve kalibrasyonda kayma | Fiilen kullanılacak cihaz üzerinde test |
| Mevzuat ve tescil | Bir yargı çevresi ← başka bir yargı çevresi | Bir öneri tescilsiz ya da yerel olarak yasaklı olur | Etiketin gözden geçirilmesi ve yetkili merciye danışılması |
| Dil ve terminoloji | Standartlaştırılmış terim ← ürün ve zararlı için yerel adlar | Çıkarımdan önce sorunun yanlış anlaşılması | Kullanıcının dilinde anlama testi |
| Mevsim ve döngü | Bir ya da iki mevsim ← çok yıllı değişkenlik | Olağandışı bir yılda sınanmamış performans | Mevsimler boyunca doğrulama ve kayma (drift) izleme |
| Çalışma yöntemi | Eğitimli uzman ← farklı deneyime ya da zaman kısıtına sahip kullanıcı | Girdinin ve yanıtın kalitesi değişir | Kullanılabilirlik testi ve uygun eğitim |
| Piyasa ve kurumsal yapı | Erişilebilir müdahale ve yerleşik finansman ← sınırlı alternatifler | Uygulanması mümkün olmayan doğru bir öneri | Uygulama kapasitesi ve maliyet çözümlemesi |
Bu tablo bir yasaklar listesi olarak değil, bir test planı olarak okunmalıdır. Eğitim ortamı ile kullanım ortamı arasındaki fark ne kadar büyükse, yaygın benimsemeden önce sınırlı bir yerel denemeye duyulan ihtiyaç da o kadar artar. Benimsemeden önce yerel doğrulama planı Plan şunları içerebilir:
- Hedef tarlaları, çeşitleri ve koşulları temsil eden bir örneklem seçmek.
- İnsanların fiilen kullanacağı cihazlar ve şebekeler üzerinde test etmek.
- Sistemi mevcut uygulamayla ya da uygun basit bir kuralla karşılaştırmak.
- Nadir sınıflardaki ve alışılmadık durumlardaki performansı incelemek.
- Bir "bilinmeyen" sınıfı ya da çekimserlik mekanizması sağlamak.
- Uzman incelemesi gerektiren durumları tanımlamak.
- Mevsim boyunca performans değişimini izlemek.
- Kesintileri, bozuk okumaları ve insan müdahalelerini kaydetmek.
- Yalnızca teknik göstergeyi değil, tarımsal sonucu ölçmek.
- Çeşit, cihaz, veri kaynağı ya da mevzuat ortamı değişirse yeniden değerlendirmek.
Yerel doğrulamayı şart koşmak, teknolojinin geliştirildiği yerin dışında hiçbir değeri olmadığı anlamına gelmez; değerinin, kararın sonuçlarına insanların ve toprağın katlanacağı yerde gösterilmesi gerektiği anlamına gelir.
7. Hata Tek Bir Sayı Değildir: Yanlış Kararın Bedelini Kim Öder?
Yapay zekâ hataları anlam ve sonuç bakımından eşit değildir. İki sistem aynı oranda hata yapabilir; ama biri giderilebilecek sınırlı bir rahatsızlığa yol açarken diğeri ürün kaybının, kaynak israfının ya da gıdaya, hayvanlara veya işçilere yönelik risklerin kapısını aralayabilir. Bu yüzden şunu sormak yetmez: Model kaç kez yanıldı? Şunu da sormalıyız: Hangi yönde yanıldı, ne zaman yanıldı, ardından hangi karar geldi ve bedelini kim üstlendi? Laboratuvarda hata, bir tablodaki bir vakadan ibarettir. Çiftlikte ise yanlış yere verilmiş suya, saptanmadan kalmış bir hastalığa, gereksiz yere ilaçlanmış bir ürüne, soğutulması geciken bir sevkiyata ya da müdahale penceresi kapandıktan sonra uyarı alan bir işçiye dönüşebilir. Dolayısıyla risk, yalnızca hata sayısıyla değil, sonuçlarının ağırlığıyla ölçülür. İki model genel doğrulukta birbirine yakın görünürken pratik değerde kökten farklılaşabilir. Birincisi fazladan uyarı verebilir ama tehlikeli bir vakayı nadiren kaçırır; ikincisi daha az rahatsız edici olabilir ama sessizliğin bedelinin ağır olduğu anlarda kimi zaman sessiz kalabilir. Hangisi daha iyidir? Toplu sayı tek başına yanıt veremez; yanıt işin niteliğine, denetim maliyetine, gecikmenin tehlikesine, kararın geri döndürülebilirliğine ve insanın müdahale kapasitesine bağlıdır. Hata modelde doğabilir ya da onu çevreleyen sistem tarafından üretilebilir Hatanın tamamını "algoritmaya" yüklemek kolaydır; oysa dijital tarım sistemi birbirine bağlı bir zincirdir: Sensör ya da görüntü ← iletilen veri ← model bunları çözümler ← uyarı ya da öneri ← kullanıcı bunu yorumlar ← eylem uygulanır ← sonuç tarlada belirir. Algoritma doğru olabilirken sensör okuması eski ya da bozuk olabilir. Çözümleme doğru olabilir ama uygulama bunu yanlış ölçü biriminde gösterebilir. Uygun öneri, çiftçinin telefonuna müdahale penceresi kapandıktan sonra ulaşabilir. Kullanıcı, yalnızca denetim gerektiren bir ön işaret olduğu hâlde uyarıyı kesin bir emir olarak anlayabilir. Hatta hata, model sahneden tümüyle çekildikten sonra da meydana gelebilir. Sistem sulama cihazına doğru bir komut gönderebilir ama bağlantıdaki bir arıza komutun yinelenmesine yol açabilir. Miktar hektar başına litre olarak kaydedilirken başka bir program bunu farklı bir birimde yorumlayabilir. Sistem, bir süredir kalibre edilmemiş bir sensörden gelen nem okumasına dayanabilir ve böylece mantıklı bir çıkarımı yanlış bilgi üzerine kurabilir. Bu nedenle üç düzey birbirinden ayrılmalıdır:
- Model hatası: sınıflandırmada, kestirimde ya da öngörüde yanıldı.
- Karar hatası: bilgi yetersizdi ya da vakaya uymayan bir biçimde yorumlandı.
- Sistem hatası: veri, yazılım, donanım, modüller ya da yürütme yolları arızalandı ve doğru veya kabul edilebilir bir sonucu hatalı bir eyleme dönüştürdü. Bu ayrım gereklidir, çünkü her düzey farklı bir çare ister. Modeli iyileştirmek bozuk bir sensörü onarmaz, daha fazla veri eklemek belirsiz bir arayüzü düzeltmez ve doğruluğu yükseltmek, bir yazılım arızası yüzünden bir talimatın iki kez uygulanmasını önlemez.
Yanlış pozitif: olmayan bir sorun varmış gibi uyarı vermek Yanlış pozitif, durum fiilen mevcut değilken sistemin bir hastalığın, zararlının, arızanın ya da riskin varlığını bildirmesiyle ortaya çıkar. Daha basit söylemek gerekirse: sistem uyarı verdi, ama ardından yapılan denetimde böyle bir sorun bulunmadı. Bu hatanın sonucu sınırlı olabilir. Örneğin uygulama, çiftçiye şüpheli bir noktayı doğrulamak için tarlanın yakın bir kesimini ziyaret etmesini önerdiyse ve denetim hızlı, güvenli ve düşük maliyetliyse, zarar biraz zaman ve emekten öteye geçmeyebilir. Bu durumda, ciddi vakaların kaçırılmasını önlemeye yardım ediyorsa bir ölçüde aşırı uyarı kabul edilebilir olabilir. Ama yanlış uyarı her zaman basit kalmaz. Otomatik yürütmeye yaklaştıkça ya da ona yanıt vermenin maliyeti yükseldikçe sonucu da büyür. Örnekler şunlardır:
- bir görsel model, bir besin eksikliğinin belirtilerini mantari bir hastalık olarak yorumlar ve kullanıcıyı, gerçek nedene yönelmeyen bir tedaviyi değerlendirmeye iter.
- bir sulama sistemi, isabetsiz bir okumayı su stresi olarak yorumlar ve hâlâ yeterli nem içeren toprağın sulanmasını önerir.
- bir hayvan izleme sistemi, var olmayan bir sağlık durumu hakkında tekrar tekrar uyarı vererek işçinin ya da veteriner hekimin vaktini tüketir ve bir hayvanın gereksiz yere ayrılmasına yol açar.
- bir soğuk zincir sistemi, bozuk bir sensörden gelen anormal bir okumayı gerçek bir sıcaklık artışı olarak yorumlar ve bir denetimi, durdurmayı ya da maliyetli bir işletim müdahalesini tetikler.
- bir görü sistemi, bir gölgede ya da bitki artıkları arasında bir yabancı ot saptar ve ardından konumunu bir temizleme makinesine veya nokta ilaçlama birimine gönderir. Dolayısıyla aynı uyarının sonucu, ardından ne geldiğine göre değişir. Yalnızca insan denetimine yol açıyorsa hoş görülebilir. Ama doğrudan bir pompayı çalıştırıyor, bir serada iklimi değiştiriyor, bir kimyasal uyguluyor ya da bir sevkiyatı dışarıda bırakıyorsa, yanlış uyarı ekonomik, çevresel ya da güvenlikle ilgili bir zararın potansiyel kaynağına dönüşür. Zararı tek tek olaylarla da sınırlı değildir. Yinelenen yanlış uyarılar, uyarı yorgunluğu denen şeyi yaratır: kullanıcı uyarıyı duymaya alışır, sonra onu ertelemeye ya da göz ardı etmeye başlar. O noktada sistem, uyarısının doğru ve önemli olduğu an gelmeden önce güvenilirliğini yitirmiş olabilir.
Yanlış negatif: sistemin görmediği gerçek bir sorun Yanlış negatif, sorun mevcutken sistemin onu saptamaması ya da durumu normal olarak sınıflandırmasıyla ortaya çıkar. Doğrudan söylemek gerekirse: dikkati hak eden bir sorun vardı, ama sistem sessiz kaldı. Bu hata, özellikle kayıplar zamanla büyüdüğünde yanlış uyarıdan daha tehlikeli olabilir. Örnekler şunlardır:
- uygulamanın saptayamadığı erken bir bitki enfeksiyonu; öyle ki sınırlı sayıda bitkiden daha geniş bir alana yayılıncaya dek sürmüştür.
- görüntüde açıkça belirmeyen ya da modelin eğitim verisinde temsil edilmeyen bir zararlı; sistem durumu normal diye sınıflandırmıştır.
- sistemin saptayamadığı bir su stresi başlangıcı; öyle ki bitki, durumun sınırlı etkiyle düzeltilebileceği bir evreyi geride bırakmıştır.
- izleme sisteminin yakalayamadığı, bir hayvanın davranışındaki anormal bir değişiklik; veteriner muayenesini geciktirmiştir.
- bir sensör arızası ya da veri iletimindeki bir kesinti yüzünden sistemin kaydetmediği, bir sevkiyatın sıcaklığındaki gerçek bir artış; sevkiyat, gözden geçirilmeksizin zincirin daha sonraki bir aşamasına ilerlemiştir.
- kestirimci bakım sisteminin saptayamadığı, bir pompa ya da soğutma ünitesi içinde gelişmekte olan bir arıza; daha ciddi bir durma meydana gelene dek işletim sürmüştür. Bu türün tehlikesi, kullanıcının sistemin yanıldığını bilemeyebilmesinde yatar. Yanlış uyarı kendine dikkat çeker; ama modelin kaçırdığı vaka, etkileri belirene dek gizli kalabilir. Bu nedenle hatanın saptanabilirliği, yalnızca gerçekleşme olasılığı değil, risk değerlendirmesinin bir parçasıdır. Saptanmamış bir vakanın son derece tehlikeli olduğu uygulamalarda sistem daha duyarlı olacak biçimde, yani şüpheli vakaları denetime yönlendirmeye daha yatkın olacak şekilde ayarlanabilir; bu, yanlış uyarılarda artışa yol açsa bile. Ama bu seçim kendiliğinden doğru değildir; insanın denetim kapasitesinin uyarı sayısını soğurabileceği doğrulanmalıdır, aksi hâlde artan duyarlılık, sistemi yararlılığından yoksun bırakan bir tıkanıklığa dönüşür.
Zamanlama hatası: karar penceresi geçtikten sonra ulaşan doğru bir yanıt Model, sorunun türü ve büyüklüğü konusunda doğru olabilir; ama önerisi, eylemin artık mümkün ya da anlamlı olmadığı bir zamanda ulaşır. Bu, zamanlama hatasıdır: sorun yalnızca bilginin doğru olup olmadığında değil, tarımsal takvimin neresine düştüğündedir. Tarımsal kararlar bir müdahale penceresi içinde işler: eylemin sonucu değiştirebileceği sınırlı bir süre. Bu pencere kapandıktan sonra en iyi öneriler bile, olanı değiştirmenin bir aracı olmaktan çıkıp olup biteni betimlemeye dönüşebilir. Örnekler şunlardır:
- sulama tamamlandıktan sonra yağış öngörüsü sunmak; öngörünün artık su ya da enerji tasarrufu sağlayamayacağı bir anda.
- bir enfeksiyonu, yerel bir denetimle ya da sınırlı bir müdahaleyle sınırlandırılabileceği evreyi geçtikten sonra saptamak.
- koruyucu önlemlerin hazırlanması ve devreye alınması zaman gerektirdiği hâlde, sıcaklıklar kritik aralığa girdikten sonra don uyarısı göndermek.
- meyve olgunluğunu, işgücü, ambalaj ya da nakliye düzenleme fırsatı yitirildikten sonra öngörmek.
- bir soğutma arızasını, sevkiyat arızanın onarılabileceği ya da güzergâhın değiştirilebileceği bir noktadan ayrıldıktan sonra saptamak.
- satış sözleşmesi imzalandıktan ya da depolama ve pazarlamaya ilişkin mevcut seçenekler kapandıktan sonra fiyat öngörüsü sağlamak. Bu nedenle bir değerlendirme çalışmasının "Öngörü doğru muydu?" diye sorması yetmez. Şunu da sormalıdır: "Olaydan ne kadar önce geldi? Ve bu öncelik süresi, eylemi gerçekleştirmeye yeterli miydi?" Biraz daha az isabetli bir model, üzerine hareket edilebilecek erken bir uyarı sağlıyorsa, eyleme geçme fırsatı geçtikten sonra ulaşan daha isabetli bir modelden daha değerli olabilir.
Büyüklük hatası: eylem doğru, ama miktarı uygunsuz Bazı durumlarda sistem doğru ihtiyacı tanır ama tepkinin büyüklüğünde yanılır. Ürünün sulamaya ihtiyacı olduğunu tanıyabilir ama gerekenden fazla ya da az bir miktar kestirebilir. Havalandırmanın ya da soğutmanın gerekli olduğunu belirleyebilir ama fiilî koşullara uymayan bir derece veya süre önerebilir. Bu, büyüklük hatasıdır: kararın yönü doğrudur, oysa miktarı, şiddeti ya da süresi yanlıştır. Bu hatanın ciddiyeti birçok uygulamada görünür:
- Sulama: fazlası suyu ve enerjiyi israf edebilir, yıkanmayı ya da kök boğulmasını artırabilir; azı ise sulama yapılmış olmasına rağmen stresi giderilmemiş bırakabilir.
- Gübreleme: önerilen besin uygun olabilir, ama uygulamanın miktarı ya da zamanlaması toprağa veya ürünün evresine uymayabilir.
- Seralar: soğutma ihtiyacı gerçek olabilir, ama ani ya da uzun süreli bir değişiklik başka bir stres biçimi yaratabilir veya enerji tüketimini artırabilir.
- Hayvan besleme: rasyonun ayarlanması gerekçeli olabilir, ama ayarlamanın büyüklüğü üretim durumundan, sağlık durumundan ve rasyonun tam bileşiminden ayrı düşünülmemelidir.
- Depolama ve kurutma: nemi ya da sıcaklığı düşürmek gerekebilir, ama çalışma süresinin fazlası ya da azı kaliteyi ve maliyeti etkileyebilir. Karara kimyasallar, veteriner ilaçları ya da bekleme süreleri girdiğinde riskler daha da yükselir. Bu alanlarda modelin kestirimleri tek başına bir doza ya da bir uygulama emrine dönüştürülmemelidir. Resmî etikete, yerel tescile, yetkili merciin talimatlarına ve nitelikli bir uzmana başvurulmalı; dozlara, hasat öncesi bekleme sürelerine, yeniden giriş sürelerine ve diğer bağlayıcı güvenlik gerekliliklerine uyulmalıdır.
Bağlam hatası: bir yerde doğru, başka bir yerde yanlış olan bilgi Her hata zayıf bir modelden kaynaklanmaz. Bazen bilgi, üretildiği ortamda doğrudur; ama koşulları onu uygulanamaz kılacak biçimde farklılaşan bir kullanıcıya aktarılmıştır. Karar şunlardaki farklılıklar yüzünden değişebilir:
- çeşit, ırk ya da yaşam evresi.
- toprak tipi, tuzluluğu ve su tutma kapasitesi.
- yerel iklim, radyasyon şiddeti, nem ve rüzgârlar.
- zararlı ve hastalık baskısı ile bunların bölgedeki yayılımı.
- sulama sistemi, mevcut ekipman ve sensörlerin isabeti.
- işletmenin biçimi ve ölçeği, işgücü ve uzmanlığın bulunabilirliği.
- girdi ve enerji fiyatları ile alternatiflerin maliyeti.
- yasal olarak tescilli ürünler, güvenlik aralıkları ve mevzuat kısıtları.
- kullanıcının uyarıyı anladığı dil ve kullanıcının buna göre hareket edebilme kabiliyeti. Akademik bir çalışma, belirli deneysel koşullar altında bir ürün tepkisini betimleyebilir ve ardından sonuç, bir uygulama içinde bütün bölgeler için genel bir öneriye dönüştürülebilir. Akıllı bir asistan, yabancı bir kaynaktan bir madde ya da uygulama adını aktarabilir; oysa onun tescili veya kullanım koşulları kullanıcının ülkesinde farklıdır. Bir hastalık modeli, belirli bir melez için iyi aydınlatmada çekilmiş görüntülerde iyi çalışabilir, sonra başka bir çeşitle, farklı bir telefon kamerasıyla ya da bir besin eksikliğiyle örtüşen belirtilerle karşılaştığında zayıflayabilir. Buradaki bilimsel geçerlilik, bilginin ortamlar arasında aktarılmasını reddetmek anlamına gelmez; aktarılabilirliğin sınırlarını beyan etmek ve bunları sınamak anlamına gelir. Soru yalnızca "Bilgi doğru mu?" değil, aynı zamanda "Kim için, nerede, hangi mevsimde ve hangi koşullar altında doğru?" sorusudur.
Veri ve entegrasyon hatası: algoritma masumken kararın yanlış olması Dijital tarım sistemlerinde modelin kendisi sağlam olabilir; ama ona ulaşan veri ya da sonucunun iletilme biçimi kusurlu olabilir. Bu önemli bir kategoridir, çünkü tarım, yazılım ve donanımın kesiştiği yerde meydana gelir. Örnekler şunlardır:
- güncellenmemiş bir sensör okuması; ama uygulama bunu gerçek zamanlıymış gibi gösterir.
- kalibre edilmemiş bir nem sensörü; tutarlı ama yine de yanlış okumalar gönderir.
- veri bir sistemden diğerine geçerken alan, hacim ya da kütle birimlerinin karışması.
- yanlış bir saatin ya da saat diliminin kullanılması; öyle ki uyarı uygunsuz bir saat veya günle ilişkilendirilir.
- bir iletişim kesintisi sırasında kayıtların yitirilmesi ve ardından hesaplamanın, kullanıcı uyarılmaksızın eksik veri üzerinde yapılması.
- cihaz ilk komutu zaten uygulamış olmasına rağmen, bir yazılım yeniden deneme mekanizması yüzünden bir işletim komutunun yinelenmesi.
- bir tarla ya da ürün kaydının, benzer bir ad taşıyan başka bir kayda bağlanması.
- çeşit, mevsim ya da üretim planı değiştikten sonra sistemin eski bir modeli veya öneriyi kullanmayı sürdürmesi.
- model bu ortamda test edilmemiş olduğu hâlde, kullanıcı arayüzünde yüksek bir güven puanının kesinlik çağrıştıracak biçimde gösterilmesi. Bu hatalar yalnızca modelin yeniden eğitilmesiyle çözülmez. Birim doğrulaması, açık zaman damgaları, sensör kalibrasyonu, eksik verinin saptanması, yinelenen komutların önlenmesi, denetim kayıtları ve yazılımla donanım arasında entegrasyon testi gerektirirler.
Bireysel hata ve büyük ölçekli hata Bir hatanın sonucu yalnızca türüne değil, yayılımının ölçeğine de bağlıdır. Bir ziraat mühendisinin görüp reddettiği yanlış bir öneri, aynı komutun otomatik bir sistemce yüzlerce vanada ya da binlerce hektarda uygulanmasından farklıdır. Otomasyon, hataya birbiriyle çelişen iki güç verir:
- doğru kararı hızlı, tutarlı ve geniş ölçekte uygulayabilir.
- aynı biçimde aynı hatayı da hızlı, tutarlı ve aynı ölçekte yineleyebilir. Yürütmenin kapsamı genişledikçe ve insan müdahalesi azaldıkça; işletim sınırlarına, önceden teste, kademeli yaygınlaştırmaya, elle durdurma imkânına, ne olduğunu gösteren bir kayda ve veri veya iletişim yitirildiğinde sistemi güvenli bir duruma döndüren bir mekanizmaya duyulan ihtiyaç da artar. Sorun, makinenin bir kez hata yapabilmesi değildir; tek bir yazılım hatasının, kimse fark etmeden yinelenen bir uygulamaya dönüşebilmesidir.
Eşik, salt istatistiksel bir sayı değil, mesleki bir karardır Modeller her zaman kendiliğinden "enfekte" ya da "sağlıklı" demez. Birçoğu, sinyalin gücünü ya da modelin güvenini ifade eden bir puan üretir; sistem tasarımcıları da çıktının sessiz izlemeden uyarı vermeye geçtiği bir eşik belirler. Eşik düşürülürse sistem şüphelenmekte daha hızlı davranır:
- Genellikle daha çok sayıda gerçek vakayı saptar.
- Ama daha çok sayıda yanlış alarm da gönderebilir. Eşik yükseltilirse daha ihtiyatlı hâle gelir:
- yanlış alarmların sayısı azalır.
- Ama sinyali daha yüksek eşiği aşmayan gerçek vakaları kaçırabilir. Bütün uygulamalara uygun ideal bir eşik yoktur. Seçim, uyarıdan sonra ne olacağına bağlıdır. Uygulama, ziraat mühendisince önce hangilerinin incelenmeyi hak ettiğini belirlemek üzere görüntüleri sıralıyorsa ve bu inceleme hızlı, ucuz ve güvenliyse, eşiği düşürmek ve daha çok sayıda şüpheli vakayı yönlendirmek kabul edilebilir olabilir. Ama eşiğin aşılması doğrudan bir makineyi çalıştırmaya, bir seranın ortamını değiştirmeye, bir sevkiyatı dışarıda bırakmaya ya da kimyasal bir tedaviyi değerlendirmeye yol açıyorsa, ek hata göz ardı edilemeyecek bir maliyet taşıyabilir. "Model güven puanı" da kesinlik olarak anlaşılmamalıdır. Sistem yüksek bir puan gösteriyorsa, model uygun bir kalibrasyondan geçmedikçe ve anlamı hedef ortamda sınanmadıkça bu, kararın doğru olma olasılığının gerçek dünyada o puana eşit olduğu anlamına gelmez. Bu nedenle arayüz, puanın sınırlarını açıklamalı; öneriyi, sahip olmadığı bir kesinlik derecesini çağrıştıran bir sayıyla süslememelidir.
Eşik karara göre nasıl değişir?
| Kullanım türü | Uyarıdan sonra ne olur? | Makul ödünleşim | Gerekli güvence |
|---|---|---|---|
| Başlangıç görüntü tarama aracı | Görüntü insan incelemesine yönlendirilir | Kaçırılan ciddi vakaları azaltmak için ek uyarılar kabul edilebilir | Sonucun kesin bir tanı değil, bir ön şüphe olduğunun beyanı |
| Sulama izleme | Kullanıcı okumayı, hava durumunu ve toprağın durumunu gözden geçirir | Kaçırılan stresle aşırı sulamanın maliyetini dengelemek | Veri kaynağının ve güncelliğinin gösterilmesi, elle doğrulama ya da geçersiz kılmaya izin verilmesi |
| Hastalık ya da zararlı uyarısı | Uzman sahayı ziyaret eder ya da ek bir görüntü veya numune ister | Hızla yayılan durumlarda duyarlılığı yükseltirken uyarı sayısını yönetmek | İnsan ya da laboratuvar teyidi için açık bir yol |
| Sera kontrolü | Havalandırmanın, soğutmanın ya da ısıtmanın işleyişi değişebilir | Karar doğrudan ortamı, üretimi ve enerjiyi etkilediği için daha büyük bir titizlik | Güvenli işletim sınırları, kademeli değişiklikler ve elle durdurma veya geçersiz kılma imkânı |
| Robot ya da tarla makinesi | Saptama harekete ya da fiziksel eyleme dönüşür | Görü isabeti tek başına yetmez; güvenlik ve uçtan uca eylemin tamamı test edilmelidir | Güvenli durdurma, engel algılama ve hız, kuvvet ile işletim bölgesi sınırları |
| Hassas kimyasal ya da veteriner kararı | Bir tedaviye, doza ya da bekleme süresine yol açabilir | Bir model uyarısı, tek başına bir uygulama emrine dönüşmemelidir | Uzman incelemesi ile tescile, resmî etikete ve yasal gerekliliklere başvuru |
Risk yalnızca hata olasılığıyla ölçülmez Bir hata seyrek ama yıkıcı olabilir; ya da sık ama etkisi sınırlı olabilir. Bu nedenle risk değerlendirmesi, birkaç boyuta birlikte bakmayı gerektirir:
- Meydana gelme olasılığı: Bu hatanın ne sıklıkla ortaya çıkması beklenir?
- Sonucun ağırlığı: Sınırlı bir rahatsızlığa mı, mali kayba mı, çevresel zarara mı, yoksa bir güvenlik tehlikesine mi yol açar?
- Maruziyetin ölçeği: Tek bir bitkiyi mi, bütün bir tarlayı mı, bir sürüyü mü, yoksa bir tedarik zincirini mi etkiler?
- Zararın ilerleme hızı: Müdahale için saatler ya da günler var mı, yoksa hata hızla onarılamaz hâle mi gelir?
- Hatanın saptanabilirliği: Kullanıcı onu hemen görür mü, yoksa kayıp ortaya çıkana dek gizli mi kalır?
- Geri döndürülebilirlik: Karar kolayca geri alınabilir mi, yoksa uygulandıktan sonra etkisi geri çevrilemez mi?
- Otomasyon derecesi: Sistem öneride bulunup kararı insana mı bırakır, yoksa eylemi doğrudan kendisi mi uygular?
- Etkilenen taraflar: Faydayı kim devşirir, sistem yanıldığında zararı kim üstlenir? Bu nedenle bir ekrandaki yanlış uyarı, yanlış ölçü birimiyle otomatik olarak uygulanan görünüşte doğru bir komuttan daha az tehlikeli olabilir. Ve sulamayı tahmin ederken tekrarlanan küçük bir hata, bir sezonun tamamında, bir kez gerçekleşip hızla saptanan büyük bir hatadan daha ağır sonuçlar doğurabilir.
Eşiği benimsemeden ya da uygulamaya izin vermeden önce Eşiği programcı tek başına seçmemelidir; o, modelin davranışını bilir ama tarımsal kararın tüm sonuçlarını bilmeyebilir. Tarım uzmanı da hata türlerine ilişkin veriler ve sistemin belirsizliği ifade edebilme kabiliyeti hakkında bilgi olmaksızın onu belirlememelidir. Burası tarımsal bilgi, yazılım mühendisliği, ekonomi, güvenlik ve düzenlemenin buluşma noktasıdır. Bu nedenle aşağıdaki sorular açıkça yanıtlanmalıdır:
- Sistemin saptamaya ya da öngörmeye çalıştığı durum nedir?
- Hangi verilere dayanır ve bunların güncel ve doğru olduğunu nereden biliyoruz?
- Bu kullanımda hangisi daha zararlıdır: yanlış alarm mı, yoksa saptanamadan geçen vaka mı?
- Uyarıyı kim alır ve anlamını ve sınırlarını anlar mı?
- Uyarıdan sonra hangi eylem beklenmektedir?
- Eylem yalnızca bir kontrol müdür, yoksa fiziksel, kimyasal ya da mali bir müdahale mi?
- Uyarı yanlışsa eylemi gerçekleştirmenin maliyeti nedir?
- Sorun mevcut olduğu hâlde sistem uyarı vermezse zarar nedir?
- Uyarı, müdahale için mevcut süre dolmadan ulaşır mı?
- Eylem, gerçekleştirildikten sonra geri alınabilir mi?
- İnsan ekibi yorulmadan kaç vakayı gözden geçirebilir?
- Veriler eksik ya da çelişkili olduğunda sistem ne yapar?
- Öneride bulunmaktan kaçınıp yeterli bilgiye sahip olmadığını beyan edebilir mi?
- Bağlantı, sensör ya da hizmet arıza yaptığında güvenli bir elle işleyen alternatif var mı?
- Sistem; veriyi, öneriyi, eylemi ve onu kimin onayladığını gösteren bir kayıt tutar mı?
- Karar, bir uzmanın ya da hukuki veya mesleki bir merciin gözden geçirmesini gerektirir mi?
- Veri toplamadan eylemin uygulanmasına kadar sistemin tamamı mı sınandı, yoksa yalnızca model mi sınandı?
Sorumlu tasarım hatayı ortadan kaldırmayı vaat etmez; hatanın zarara dönüşmesini önler Hiçbir insan kararı hatadan azade olmadığı gibi, hatadan azade bir model de yoktur. Gerçekçi amaç, belirsizliğin ortadan kaldırıldığını iddia etmek değil; nerede yanılabileceğini bilen, hatayı erken saptayan, etkilerinin yayılmasını sınırlayan ve insan operatöre müdahale için açık bir fırsat tanıyan bir sistem tasarlamaktır. Bu, risk düzeyine göre şu gibi araçlarla sağlanır:
- Güven derecesinin ve sınırlarının açık bir dille gösterilmesi.
- Veriler yetersiz olduğunda ek bir görüntü ya da okuma istenmesi.
- Alışılmadık vakalarda kesin bir öneride bulunmaktan kaçınılması.
- İlk uyarının, teşhisten ya da nihai karardan ayrılması.
- Hassas vakaların bir uzmana yönlendirilmesi.
- Tek bir sensöre dayanmak yerine birden fazla veri kaynağının kullanılması.
- Otomatik olarak uygulanabilecek komutlara güvenli sınırlar konulması.
- Yüksek etkili kararlardan önce insan onayının zorunlu kılınması.
- Arıza hâlinde elle bir durdurma ve güvenli bir işletim kipi sağlanması.
- Soruşturma ve gözden geçirme mümkün olsun diye verilerin, önerilerin ve komutların kaydedilmesi.
- Performanstaki değişimlerin sezonlar, konumlar ve çeşitler boyunca izlenmesi.
- Modeli yalnızca ideal koşullarda sınamak yerine kesintilerin, bayat verinin, birim çatışmalarının ve mükerrer komutların sınanması. Hangi hataların hoş görülebileceğine modelin kendisi karar vermez; bu, hem insan uzmanlığının hem de teknik bilginin rol oynadığı tarımsal, ekonomik, etik ve güvenlikle ilgili bir ödünleşimdir. Bir sistemin olgunluğunun gerçek ölçütü, yalnızca seyrek hata yapması değil; kuşkuya düştüğünde nasıl davranacağını, veriler yetersiz olduğunda nasıl duracağını ve sınırlı bir hatanın geri döndürülemez yaygın bir zarara dönüşmesini nasıl önleyeceğini bilmesidir.
8. İki Sayıyı Değil, İki Uygulamayı Nasıl Karşılaştırırız?
Yüksek sayıyı düşük sayıyla karşılaştırmak yeterli değildir; çünkü uygulamalar görev, veri, bağlam, olgunluk ve işleyiş kipi bakımından farklılaşabilir. Titiz bir karşılaştırma, yanıtı karşılaştırmadan önce soruyu standartlaştırmakla başlar. Bir tarımsal uygulama için değerlendirme formu
| Boyut | Yanıtlanması gereken soru |
|---|---|
| Kimlik ve zaman | Sistemin adı, sürümü ve incelendiği tarih nedir? |
| Görev | Hangi tarımsal kararı iyileştirmeye çalışıyor? |
| Kullanıcı | Onu kim, hangi beceri ve yetkiyle kullanıyor? |
| Olgunluk | Fikir mi, prototip mi, geçerleme mi, tarla denemesi mi, işletim mi, yoksa ölçülmüş etki mi? |
| Veri | Nereden geldi ve hedeflenen ürünü, konumu ve kullanıcıyı temsil ediyor mu? |
| Karşılaştırma | Hangi başlangıç düzeyiyle ya da alternatifle karşılaştırıldı? |
| Gösterge | Nasıl tanımlandı, birimi nedir ve neyi ölçmüyor? |
| Geçerleme | İç mi, dış mı, yerel mi, yoksa saha temelli mi? |
| Hatalar | Hangi hata türleri var ve sonuçlarını kim üstlenir? |
| İşletim | Kesinti, bozuk veri ya da değişen koşullar hâlinde ne olur? |
| Zamanlama | Öneri, müdahale penceresi kapanmadan ulaşıyor mu? |
| Etki | Tarımsal, ekonomik ya da güvenlikle ilgili bir sonuç değişti mi? |
| Maliyet | Sahip olma, işletme ve eğitimin toplam maliyeti nedir? |
| Haklar | Verinin sahibi kim ve nasıl dışa aktarılıyor ya da siliniyor? |
| Sorumluluk | Kararı kim onaylar, kim durdurur ve zararı kim giderir? |
| Çıkar çatışması | Sistemi kim finanse etti, kim betimledi ve kim değerlendirdi? |
Bilgisi bulunmayan bir alan tahminle ya da başka bir üründen alınmış bir ortalamayla doldurulmaz; açıkça "Bilinmiyor" yazılır. Eksik bilgi, gizlenmesi gereken biçimsel bir kusur değil, değerlendirme sonucunun bir parçasıdır. Açıklayıcı bir örnek: %97 mi, %89 mu? Bitki hastalığı görüntülerini sınıflandıran iki uygulama bulunduğunu varsayalım:
- Birinci uygulama, tek bir kaynaktan seçilmiş bir görüntü veri tabanı içinde %97 doğruluk iddia ediyor.
- İkinci uygulama, farklı çiftlikleri ve cihazları kapsayan bir testte %89 iddia ediyor; bir "bilinmiyor" kategorisi sunuyor, görüntü kalitesi kötü olduğunda çekimser kalıyor ve hassas vakaları bir uzmana yönlendiriyor.
Betimlemesi daha sorumlu göründüğü için ikinci uygulamayı üstün ilan etmek nasıl caiz değilse, sayısı daha yüksek diye birinciyi seçmek de caiz değildir. Karşılaştırma; görevin, dağılımın, hata türünün, başlangıç düzeyinin, maliyetin ve işletim koşullarının bilinmesini gerektirir. Yine de örnek temel bir kuralı açığa çıkarır: daha yüksek sayı, aktarılabilirliğe, güvenliğe ve işletime dair kanıtın yokluğunu telafi etmez. Genel göstergesi daha düşük olan bir uygulama, hatalarının örüntüsü biliniyorsa, sınırları beyan edilmişse ve yükseltme yolu işletimsel olarak uygulanabilirse belirli bir görev için daha uygun olabilir. Sağlıklı karşılaştırma, iki sayıdan hangisinin daha büyük olduğunu sormaz. Bu bağlamda hangi sistemin, en uygun kanıtla en yararlı ve en az riskli kararı desteklediğini sorar.
9. Tanıtım Gösteriminde ve Ürün Sayfasında Görünmeyen Nedir?
Tanıtım gösterimi önemlidir; sistemin belirli koşullar altında bir görevi yerine getirebildiğini ortaya koyar. Ama gösterim genellikle sezonun en kötü gününü, en zayıf bağlantıyı, en belirsiz görüntüyü ya da en deneyimsiz kullanıcıyı seçmez. Gösterimde ya da özette şunlar da dahil olmak üzere kritik bilgiler bulunmayabilir:
- Test öncesinde dışarıda bırakılan vakalar.
- Düşük kaliteli görüntüler ya da nadir sınıflar.
- Bağlantı kesintilerinin sayısı.
- Veri temizleme ve hazırlama için gereken süre.
- Sonucun üretilmesine karışan insan müdahalesinin kapsamı.
- Yanlış alarmların sayısı.
- Kullanıcının öneriyi uygulamaktan kaçındığı durumlar.
- Kalibrasyon ve bakım maliyeti.
- Deneme bittikten sonra ortaya çıkan arızalar.
- En iyi saha ile tüm sahaların ortalaması arasındaki fark.
- Sezon, cihaz ya da veri kaynağındaki değişimlerin etkisi.
- Sistemi kullanmayı bırakan kullanıcıların sayısı.
- Sistemi bir prototipten istikrarlı bir hizmete taşımanın maliyeti.
Sistemin "su tüketimini azalttığı" söylenebilir; ama şunlar belirtilmeden:
- Hangi uygulamayla karşılaştırıldığında?
- Su kullanımı hektar başına mı, yoksa ton başına mı azaldı?
- Kaynaktan çekilen toplam su miktarı azaldı mı?
- Verimlilik ve kalite korundu mu?
- Sezon daha yağışlı mıydı?
- Ekili alan genişledi mi?
- Enerji tüketimine ne oldu?
- Sistemin maliyeti, tasarrufun değerine kıyasla nedir?
Ayrıca bir uygulamanın "yapay zekâ destekli" olduğu söylenebilir; oysa algoritma, başarısı ölçümün kalitesine, bağlanabilirliğe, desteğe, bakıma ve kullanıcının tepkisine bağlı bir hizmetin yalnızca küçük bir parçasıdır. Durup düşünmeyi gerektiren işaretler Aşağıdaki örüntülerden biri ya da birkaçı belirdiğinde hüküm daha ihtiyatlı hâle gelmelidir:
- Paydası ya da tanımı olmayan bir yüzde.
- Test kümesinin betimlenmediği bir doğruluk oranı.
- Zayıf bir sistemle ya da hiçbir müdahale olmamasıyla yapılan bir karşılaştırma.
- Hataları sunmadan yalnızca başarı görüntüleri.
- Sürekli bir işletimmiş gibi sunulan kısa bir deneme.
- Ekonomik bir etkiymiş gibi sunulan bir model sonucu.
- Bağımsız bir değerlendirmeymiş gibi sunulan bir satıcı betimlemesi.
- Toplam tüketim bildirilmeden kullanılan "tasarruf" sözcüğü.
- Ölçülmüş bir yanıt süresi olmadan kullanılan "anında" sözcüğü.
- Kullanıcı anlayışı sınanmadan "çok dilli" denmesi.
- Neyin, kime açıklandığı belirtilmeden "yorumlanabilir" denmesi.
- Güvenli durum ya da arıza yanıt planı tanımlanmadan "güvenli" denmesi.
Bir gösterim, sistemin seçilmiş koşullar altında bir kez çalışabildiğini kanıtlar. Tarımsal bir hizmet ise, koşulları kendisi seçmediğinde de çalışabildiğini kanıtlar.
10. Gereken Kanıt, Kararın Riskiyle Orantılıdır
Her dijital işlev aynı düzeyde kanıt gerektirmez. Bir kullanıcıya ürün kontrol tarihini hatırlatmak, kimyasal bir öneri ya da kredi kararıyla aynı sonuçları taşımaz. Ama karar hassassa, uygulamanın düşük maliyeti hatanın sonuçlarını hafifletmez.
| Risk derecesi | Örnekler | Gereken asgari düzey |
|---|---|---|
| Düşük | Kontrol için görüntüleri sıralamak, tarlayı ziyaret hatırlatması, bir kaydı düzenlemek | İşlevsel doğrulama, düzeltme kolaylığı ve çıktının yalnızca bir yardımcı olduğunun açıkça belirtilmesi |
| Orta | Verim tahmini, ön sulama programı, ürün sınıflandırma, bakım uyarısı | Yerel doğrulama, başlangıç düzeyi, işletimsel izleme, elle işleyen alternatif |
| Yüksek | Hassas bir müdahaleye götüren teşhis, otomatik kontrol, gıda güvenliğini etkileyen bir karar | Uzman doğrulaması, insan onayı, karar kaydı, tanımlı sınırlar, çekimserlik ve güvenli bir kip |
| Düzenlemeye tabi ya da sonuçları ağır | Dozlar, pestisitler, PHI, REI, yasal tescil, veteriner kararları, kredi ya da sigorta | Geçerli ve güncel resmî bir kaynak, uzman incelemesi, itiraz hakkı, açık sorumluluk ve yetkisiz uygulamanın önlenmesi |
Not: Burada başlangıç düzeyi (baz çizgi), yapay zekâ sisteminin gerçek bir fayda sağlayıp sağlamadığını belirlemek için performansının karşılaştırıldığı referans anlamına gelir. Sistemin "iyi performans gösterdiğini" söylemek, şunu bilmedikçe yeterli değildir: neye kıyasla iyi? Başlangıç düzeyi şunlardan biri ya da birkaçı olabilir:
- Sistem kullanılmadan önceki mevcut uygulama: Örneğin çiftçinin sulama zamanlamasını tahmin etmek ya da ürünü sınıflandırmak için kullandığı alışılmış yöntem.
- Önceki bir sezonun ya da dönemin sonuçları: Örneğin farklı koşullar hesaba katılarak önceki sezonlardaki ortalama tarla verimi.
- Yapay zekâ içermeyen basit bir yöntem: Örneğin sabit bir sulama programı, açık bir agronomik kural ya da tarihsel bir ortalama.
- Bir insan uzmanın tahmini: Örneğin ziraat mühendisinin verim öngörüsü ya da elle sınıflandırmanın sonucu.
- Mevcut geleneksel bir model: Proje, hâlihazırda kullanımda olan bir sistemin ya da modelin yerini alıyorsa.
Örnek: verim tahmini Bir yapay zekâ modeli ürün verimini öngörüyorsa, tahmininin gerçek sonuca yakın olduğunu söylemek yetmez. Örneğin tarlanın önceki yıllardaki ortalama verimiyle ya da ziraat mühendisinin hâlihazırda kullandığı tahmin yöntemiyle karşılaştırılmalıdır. Model bu basit başlangıç düzeyinden daha iyi değilse ya da tahminini daha uygun bir zamanda sunmuyorsa, yararı veri toplama ve sistem işletme maliyetini haklı çıkarmayabilir. Örnek: sulama programı Sistem sulamanın zamanını ve miktarını öneriyorsa, başlangıç düzeyi alışılmış sulama programıdır ya da çiftçinin gözlem ve deneyimine dayanan kararıdır ya da onaylanmış bir rehber kuraldır. Ardından sonuçlar karşılaştırılır: sistem toplam su ve enerji tüketimini azalttı mı? Verimi ve kaliteyi korudu mu? Su stresini azalttı mı? Ve sensörlerin, bağlanabilirliğin ve bakımın maliyeti hesaba katıldıktan sonra fayda ayakta kaldı mı? Örnek: ürün sınıflandırma Başlangıç düzeyi, mevcut elle sınıflandırma süreci olabilir. Karşılaştırma sistemin hızıyla sınırlı değildir; yanlış sınıflandırılan ürünlerin oranını, kalitenin tutarlılığını, hasarın boyutunu, işletme maliyetini ve işçinin belirsiz vakaları gözden geçirebilme kabiliyetini de kapsar. Örnek: bakım Sistem pompalardaki ya da soğutma ünitelerindeki arızalara ilişkin erken uyarılar veriyorsa, başlangıç düzeyi rutin bakım programı ya da sistem kurulmadan önceki arıza ve duruş sayısı olabilir. Amaç, uygulamanın kaç uyarı ürettiğini bilmek değil; uyarıların duruş süresini ve kayıpları fiilen azaltıp azaltmadığını belirlemektir. Dolayısıyla başlangıç düzeyi bir kabul eşiği değildir, bir programlama başlangıç noktası da değildir; o, sistemden önce neler olup bittiğinin ya da daha basit bir alternatifin neyi başarabileceğinin belgelenmiş bir tablosudur. O olmadan, havanın, değişen fiyatların, işçi deneyiminin ya da sezonlar arasındaki farkların yol açtığı bir iyileşmeyi yapay zekâya atfedebiliriz. Teknik terim tabloda korunacaksa, en açık ifade şudur: Yerel doğrulama, açık bir başlangıç düzeyiyle — yani mevcut uygulamayla ya da basit bir alternatifle — karşılaştırma, işletim boyunca sürekli izleme ve güvenli, elle işleyen bir yedek yolun sağlanması. Düşük riskli işlevler Hatanın saptanması ve geri alınması kolaysa ve araç zararlı bir eylemi uygulamıyorsa daha esnek davranılabilir. Ama burada bile platform sınırlarını gizlememeli ve ihtiyaç duymadığı veriyi toplamamalıdır. Orta riskli işlevler Bunlar gerçekçi bir başlangıç düzeyiyle karşılaştırmayı, yerel veriler üzerinde ve yerel koşullarda test etmeyi ve sistem arıza yaparsa ya da bağlantı kesilirse ne olacağını anlamayı gerektirir. Öneri kendi başına tehlikeli olmayabilir; ama geniş bir alanda kullanıldığında maliyetli hâle gelebilir. Yüksek riskli işlevler Bunlar, model tahmininden doğrudan uygulamaya geçmemelidir. Şunları gerektirir:
- onay vermeye yetkili kişinin belirlenmesi.
- kaynağın ve sınırların gösterilmesi.
- veriler yetersizken yanıt verilmesinin önlenmesi.
- önerinin ve insan müdahalesinin kaydedilmesi.
- bir yükseltme yolunun sağlanması.
- güvenli kipin sınanması.
- genel bilginin, mesleki ya da hukuki hükümden ayrılması.
Hukuken düzenlenmiş işlevler Algoritma; resmî etiketin, yetkili merciin, veteriner hekimin ya da yetkili mühendisin yerine geçmemelidir. Bilgi toplamaya, belgeleri getirmeye ve tutarsızlıkları işaretlemeye yardımcı olabilir; ama sahip olmadığı bir yasal tescili ya da mesleki yetkiyi bahşedemez. Hükmeden kural şudur: doğrulama ve gözetim derecesi, hatanın sonucuyla ve onu geri almanın güçlüğüyle birlikte artmalıdır.
11. Kanıtı Okumaya Dair Üç Vaka İncelemesi
Aşağıdaki vakalar, yeni deneylerin sonuçları değil, öğretici çözümleme örnekleridir. Amaçları, bölümün yönteminin nasıl uygulanacağını göstermektir. Birinci Vaka: Bir Bitki Hastalığını Sınıflandıran Bir Telefon Uygulaması Uygulama yaprağın bir resmini gösterir ve olası bir hastalığın adıyla bir güven skoru döndürür. Hızlı bir okuma şöyle derdi: uygulama hastalığı teşhis ediyor. Disiplinli bir okuma ise iddiayı bileşenlerine ayırır:
- Model, belirlenmiş sınıflar içinde görsel bir örüntüyü mü tanıyor, yoksa tam bir nedensel teşhis mi sunuyor?
- Görüntü veri kümesi, hedeflenen çeşitleri ve ortamı temsil ediyor mu?
- Tarlada telefonla çekilmiş görüntüler üzerinde sınandı mı?
- Vakanın eğitim sınıflarının dışında kaldığını saptayabiliyor mu?
- Bitkinin yaşı, konumu ve belirtilerin yayılımı hakkında bilgi istiyor mu?
- Güven düşük olduğunda ne yapıyor?
- Resmî kaynakları gösteriyor mu?
- Bir tedavi öneriyor mu ve bunu kim onaylıyor?
- Hastalığın adı, şiddeti ve yayılma evresi arasında ayrım yapıyor mu?
- Kullanıcı sonucu düzeltip incelenmek üzere gönderebiliyor mu?
Uygulama, görüntüleri önceliklendirmede ve kontrol edilmeyi hak eden vakaları belirlemede çok yararlı olabilir; mesleki teşhisin yerine geçmeden. İşlevi doğru biçimde betimlemek onun değerini azaltmaz; aksine, tasarlanmadığı bir bağlamda kullanılmasını önler. İkinci Vaka: Sulama Suyunda %30 Tasarruf İddia Eden Bir Sistem Çözümleme amacıyla, bir platformun sulama suyunda %30 azalma iddia ettiğini varsayalım. İfadeyi kabul etmeden önce şunları sormalıyız:
- Yüzde, hektar başına mı, ton başına mı, yoksa çiftliğin tamamı için mi?
- Başlangıç düzeyi nedir: sabit bir program mı, çiftçinin uygulaması mı, yoksa başka bir sistem mi?
- Alan sabit kaldı mı?
- Sezon, yağış ve sıcaklık bakımından karşılaştırılabilir miydi?
- Verimlilik ve kalite değişmeden kaldı mı?
- Su tüketimi başka bir aşamaya mı kaydı?
- Pompalama enerjisine ne oldu?
- Sonuç, kesinti günlerini kapsadı mı?
- Sensörler, bağlanabilirlik ve bakım ne kadara mal oldu?
- Tasarruf birden fazla sezon boyunca sürdü mü?
Ekili alan genişlerken ton başına su kullanımı düşüyorsa, toplam çekim artmış olabilir. Su kullanımı sezon daha yağışlı geçtiği için azaldıysa, sonucun tamamı sisteme atfedilemez. Ve tasarruf, kalitede büyük bir düşüşle birlikte elde edildiyse, sonuç ekonomik olarak kabul edilemez olabilir. Yüzde bir kenara atılmamalıdır; ama paydası, başlangıç düzeyi ve ona eşlik eden sonuçlar olmadan eksiktir. Üçüncü Vaka: Üretken Bir Tarımsal Danışmanlık Asistanı Asistan; hastalığa, sulamaya ya da gübrelemeye ilişkin bir soruyu doğal dilde yanıtlar. Başarısı yalnızca cümlesinin zarafetiyle ölçülmez. Şunlar incelenmelidir:
- Ürünü, bölgeyi ve evreyi anladı mı?
- Güvenilir bir kaynaktan güncel bir referans getirdi mi?
- Kaynağın koşullarını doğru biçimde aktardı mı?
- İki ülkeyi ya da iki yasal tescili birbirine karıştırdı mı?
- Olasılık ile teşhisi birbirinden ayırdı mı?
- Dozu ya da hasat öncesi bekleme süresini uydurmaktan kaçındı mı?
- Eksik bilgiyi sordu mu?
- Gerektiğinde vakayı bir uzmana yükseltti mi?
- Çiftliğin verisi korunmuş kaldı mı?
- Kullanıcı kaynağı görebiliyor, yanıta itiraz edebiliyor ve onu düzeltebiliyor mu?
Asistan; olasılıkları açıklamada, soruları derlemede ve kanıtı düzenlemede mükemmel olabilir, yine de gerekçelendiremeyeceği bir güvenle hassas bir sayı verdiğinde tehlikelidir. Olgunluk burada her şeyi yanıtlamak demek değildir; bir yanıtın ne zaman yararlı olduğunu ve ne zaman yönlendirmenin sorumlu yanıt olduğunu bilmek demektir.
12. Dijital Bir Tarımsal İddiaya Güvenmeden Önce Okurun Protokolü
Aşağıdaki sorular; bir çalışmayı, bir ürün sunumunu ya da bu kitabın bir bölümünü okurken kullanılabilir:
- Belirli tarımsal görev nedir?
- İddia hangi türdendir?
- İddiayı kim ortaya attı ve kim değerlendirdi?
- Verinin kaynağı nedir?
- Başlangıç düzeyi nedir?
- Gösterge nedir?
- Bağımsız ya da yerel bir geçerleme yapıldı mı?
- Hangi hata türü en tehlikelisidir?
- Sonuç zamanında ulaşıyor mu?
- Arıza meydana geldiğinde ne olur?
- Nihai sonuç iyileşti mi?
- Güvenmeden önce ne yerel geçerleme gerektirir?
Saptama mı, sınıflandırma mı, tahmin mi, öneri mi, kontrol mü, yoksa uygulama mı?
Ürünün varlığıyla mı, bir özellikle mi, teknik performansla mı, yoksa tarımsal ve ekonomik etkiyle mi ilgilidir?
Konuşan; geliştirici mi, bağımsız bir kurum mu, araştırmacılar mı, yoksa kullanıcılar mı?
Ve ürün, bölge, sezon, cihaz ve örneklem birimi nedir?
Sistem mevcut uygulamayla mı, bir uzmanla mı, basit bir kuralla mı, yoksa hiçbir müdahale olmamasıyla mı karşılaştırıldı?
Neyi ölçüyor, neyi ölçmüyor ve hatanın sonucuna uygun mu?
Yoksa sonuç hâlâ geliştiricinin verisiyle ya da özgün çalışmayla mı sınırlı?
Ve maliyetini ya da zararını kim üstlenir?
Ve kullanıcı ona göre fiilen hareket edebiliyor mu?
Şebeke çökerse, sensör arıza yaparsa ya da bilinmeyen bir vaka belirirse ne olur?
Verim, kalite, su, enerji, işgücü, maliyet ve risk hesaba katıldıktan sonra?
Ve hangi kullanım sınırları beyan edilmelidir?
Yanıtlandıktan sonra iddia şu dört durumdan birine yerleştirilebilir:
- Bilinen bir bağlamda desteklenmiş: Beyan edilmiş sınırlar içinde kullanıma uygun.
- Umut verici ve yerel geçerlemeye muhtaç: İyi kanıt var, ama aktarılabilirlik gösterilmemiş.
- Sağlayıcısı tarafından betimlenmiş: Sağlayıcının ne iddia ettiğini biliyoruz, ama henüz yeterli bağımsız değerlendirmeye sahip değiliz.
- Kararı desteklemeye yetersiz: Kanıt eksik, uygun değil ya da kullanımın riskiyle orantısız.
Dördüncü durum, teknolojinin değersiz olduğu anlamına gelmez; potansiyel ile gerekçelendirilmiş güven arasındaki açığın henüz kapanmadığı anlamına gelir.
Bölüm Özeti
Bilgi, kaynağı ünlü bir ad taşıdığı için güvenilir hâle gelmez; bir uygulama da modeli yüksek bir skor elde ettiği için olgunlaşmaz. Güven; neyin, hangi veriyle, hangi karşılaştırma ölçütüne karşı ve hangi koşullarda ölçüldüğünü bildiğimizde kurulur; ardından yol, model performansından sistemin işletimine, öneriden eyleme ve eylemden onun tarladaki, ekonomideki ve insan refahındaki etkilerine dek izlenir.
Bir sayı kendi çalışması içinde doğru olabilir, ürün piyasada gerçekten bulunuyor olabilir ve algoritma tasarımı bakımından gelişmiş olabilir; yine de bunların hiçbiri, kararın belirli bir çiftlikte iyileştiğine dair yeterli kanıt değildir. Yöntem işte burada amacına hizmet eder: teknolojinin vaadini karartmak için değil, onu ani bir hayranlıktan sınanabilir bilgiye ve bilgiden de savunulabilir bir karara dönüştürmek için. Bilimsel titizlik, her uygulamadan daha ilk gününde her şeyi kanıtlamasını istemez. Ondan, fiilen neyi kanıtladığını beyan etmesini, ulaştığı düzey ile hedeflediği düzeyi birbirinden ayırmasını ve hatanın sonucu ağırlaştıkça doğrulama derecesini yükseltmesini ister. Okur; görevi, ölçütü, bağlamı, hatayı, olgunluğu, aktarılabilirliği ve etkiyi sormayı öğrendiğinde artık en yüksek sayının ya da en parlak sunumun esiri olmaz. Okur; testte başarılı olan bir modeli, işleyebilen bir sistemi, kararı değiştiren bir uygulamayı ve tarımdaki yerini hak ettiğini kanıtlamış bir teknolojiyi birbirinden ayırt edebilir hâle gelir.
Kanıt Notları
Birinci ve İkinci Bölümler, kitabın nasıl kurulduğunu ve iddialarının nasıl disipline edildiğini anlatır. [SRC004], yayımlanmış bir sistematik derleme örneği olarak kullanılmıştır; onun yöntemsel statüsünü bu çalışmaya devretmek için değil. [SRC006], belirlilik katsayısının çalışmanın kurgusuyla sınırlı olduğunu ve genel bir "doğruluk yüzdesine" dönüştürülmemesi gerektiğini açıklığa kavuşturmak için; [SRC012] ise hesaplamalı sonuçların geldikleri deneylerle sınırlandırılması ve ticari ya da sahaya ilişkin bir güvenceye dönüştürülmemesi gereğine örnek olarak kullanılmıştır. Risk, denetim ve işletim döngüsüne ilişkin tartışma, Yapay Zekâ Risk Yönetimi Çerçevesi [SRC033] tarafından yönlendirilmiştir. Olgunluk merdiveni, değerlendirme kartları, risk düzeyleri ve vaka çalışmaları; okurun kanıtı değerlendirmesine yardımcı olmayı amaçlayan editoryal bir öğretim sentezidir; ne resmî bir düzenleyici standarttır ne de bu kitap için yürütülmüş yeni deneylerin sonuçlarıdır.