Yüzde 90 emin olmak ne demek?
Ağrı Dağı kaç metre? Çoğumuz tam sayıyı bilmez ama bir fikrimiz vardır: “Herhalde 4.000 ile 6.000 arasında.” Bu deneyde senden tam olarak bunu istiyoruz: tek bir tahmin değil, doğru cevabı yüzde 90 olasılıkla içine alacağına inandığın bir aralık. Karar biliminde bu tür sorulara öznel güven aralığı tahmini denir ve bir kişinin belirsizliğini ne kadar dürüst ifade ettiğini ölçmenin en yalın yollarından biridir.
İşin püf noktası şu: iyi bir puan için her şeyi bilmen gerekmez. Bir konuda hiçbir fikrin yoksa aralığını genişletirsin, eminsen daraltırsın. Yüzde 90 emin olduğunu söylediğin on aralıktan yaklaşık dokuzu doğru cevabı yakalıyorsa iyi kalibre sayılırsın. Yani bu test bilgini değil, bilgini ne kadar doğru tarttığını ölçer. Araştırmalar ise insanların bu konuda sistematik olarak fazla iddialı olduğunu gösteriyor.
Harvard'daki sürpriz
Bu olgunun klasik gösterimi karar analizcileri Marc Alpert ve Howard Raiffa'dan geliyor. 1969'da el yazması olarak dolaşan ve 1982'de Kahneman, Slovic ve Tversky'nin derlediği “Judgment under Uncertainty” kitabında yayımlanan çalışmalarında, Harvard'daki öğrencilerinden çeşitli belirsiz miktarlar için olasılık değerleri istediler. Öğrencilerin verdiği değerlerden, doğru cevabın yüzde 98 olasılıkla içinde kalması gereken aralıklar elde ediliyordu.
İdealde doğru cevapların yalnızca yüzde 2'si bu aralıkların dışında kalmalıydı. Don Moore, Elizabeth Tenney ve Uriel Haran'ın sonradan yaptığı özete göre bu aralıklar doğru cevabı ortalama yalnızca yaklaşık yüzde 60 oranında içerdi; yani “neredeyse kesin” denen aralıklar her on sorudan yaklaşık dördünde ıskaladı. Yazarlara göre bu gösterim o günden bu yana yüzlerce kez tekrarlandı: bir gruptan on soru için yüzde 90'lık aralık istediğinizde tipik isabet oranı yüzde 30 ile 60 arasında çıkıyor. Hatta yüzde 98'lik aralıklar bazen yüzde 50'lik aralıklardan pek de geniş olmuyor.
Aşırı güvenin üç yüzü
“Aşırı güven” gündelik dilde tek bir şey gibi kullanılır ama Don Moore ve Paul Healy 2008'de Psychological Review'da bunun aslında üç ayrı olgu olduğunu savundu. Birincisi, kendi performansını olduğundan iyi sanmak (örneğin sınavda gerçekte olduğundan çok soru yaptığını düşünmek). İkincisi, kendini başkalarından iyi sanmak (sürücülerin çoğunun kendini ortalamanın üstünde görmesi gibi). Üçüncüsü ise bildiğinden fazla emin olmak, yani tahminlerinin etrafındaki belirsizliği küçümsemek: aşırı kesinlik.
Bu deney üçüncüsünü ölçüyor ve bunun iyi bir nedeni var. İlk iki tür koşullara göre tersine dönebiliyor: insanlar kolay görevlerde kendi performansını küçümseyebiliyor, zor görevlerde ise kendini başkalarından geride sanabiliyor. Moore ve arkadaşlarının derlemesine göre ise aşırı kesinliğin tersine döndüğü belgelenmiş vaka ya hiç yok ya da çok az. Kısacası, aralık çizme görevinde neredeyse herkes, neredeyse her koşulda aralıklarını gerekenden dar çiziyor.
Aralıklarımız neden bu kadar dar?
Jack Soll ve Joshua Klayman 2004'te yaptıkları deneylerde, insanların aralıklarının bazen iyi kalibre olmak için gereken genişliğin yalnızca yüzde 40'ı kadar olduğunu gösterdi. Aynı çalışmada aşırı kesinliğin miktarı, sorunun alanına ve aralığın nasıl sorulduğuna göre belirgin biçimde değişti. Bir açıklama çapalama ve ayarlamadır: önce akla bir “en iyi tahmin” gelir, sonra alt ve üst sınır bu noktadan biraz uzaklaştırılarak bulunur. Uzaklaşma genellikle yetersiz kalır.
İkinci bir açıklama, akla gelmeyen senaryoların yokmuş gibi davranılmasıdır. Ağrı Dağı'nı düşünürken aklına gelen bir iki ipucu sana tutarlı bir hikâye anlatır ve o hikâyenin yanlış olabileceği yollar görünmez kalır. Araştırmalar, yüksek ve düşük değerleri ayrı ayrı düşünmenin aralıkları genişlettiğini ve aşırı kesinliği azalttığını gösteriyor. Sarah Lichtenstein, Baruch Fischhoff ve Lawrence Phillips'in 1982'deki kapsamlı derlemesi de güven yargılarındaki aşırı iddiacılığın pek çok grupta görüldüğünü, buna karşın hava durumu tahmincileri gibi düzenli ve hızlı geri bildirim alan bazı uzmanların oldukça iyi kalibre olabildiğini ortaya koyar.
Gündelik hayatta: süreler, bütçeler, tahminler
Aşırı kesinlik laboratuvarla sınırlı değil. Bir işin ne kadar süreceğini, bir tadilatın kaça mal olacağını ya da bir yatırımın ne getireceğini tahmin ederken çoğumuz tek bir sayı söyleriz ve o sayının etrafındaki belirsizliği küçümseriz. “En kötü ihtimalle iki hafta” dediğimiz işin bir ay sürmesi, aralığımızın gerçekte ne kadar dar olduğunun gündelik bir kanıtıdır.
Bu yüzden iyi tahminciler tek bir sayı yerine aralıklarla düşünür ve kendi geçmiş tahminlerinin ne sıklıkla tuttuğunu takip eder. Kendi isabet oranını bilmek, “yüzde 90 eminim” cümlesine gerçek bir anlam kazandırır. Bu deneydeki ara sonuç ekranı da tam olarak bunun küçük bir provası: aralıklarının kaçının tuttuğunu görmek, bir sonraki tahminini nasıl verdiğini değiştirebilir mi?
Geri bildirim işe yarar mı?
Moore, Tenney ve Haran'ın derlemesine göre geri bildirim bazı durumlarda aşırı güveni azaltabiliyor ama bu etki evrensel değil; olumlu etki en çok ilk tahminden sonra görülüyor ve sonrasında kaybolabiliyor. Bizim ikinci elimiz tam da bunu soruyor: ilk beş soruda kaç aralığın tuttuğunu gördükten sonra aralıklarını genişletiyor musun ve bu isabetini gerçekten yükseltiyor mu?
Daha kalıcı bir çözüm, soruyu sorma biçimini değiştirmek olabilir. Uriel Haran, Don Moore ve Carey Morewedge 2010'da SPIES adını verdikleri bir yöntem denedi: kişiden tek bir aralık yerine, olası değerleri birkaç dilime bölüp her dilime bir olasılık vermesi istendi. Bir sıcaklık tahmini görevinde klasik yüzde 90'lık aralıklar doğru cevabı yaklaşık yüzde 74 oranında içerirken, SPIES'tan türetilen aralıklar yaklaşık yüzde 88 oranında içerdi. Yani sorun yalnızca bilgisizlikte değil, belirsizliği ifade etmek için kullandığımız araçta da yatıyor.