Bir öküz, 787 bilet
İngiltere'nin Plymouth kentinde düzenlenen West of England Fat Stock and Poultry Exhibition adlı fuarda bir yarışma yapıldı: ziyaretçiler altı peni karşılığında bir bilet alıyor, sergilenen öküzün kesilip temizlendikten sonra kaç libre geleceğini yazıyordu. En yakın tahminler ödül kazanacaktı. İstatistiğin öncülerinden Francis Galton, yarışma bittikten sonra biletleri incelemek için ödünç aldı.
Galton'un 1907'de Nature dergisinde 'Vox Populi' (halkın sesi) başlığıyla yayımladığı kısa yazıya göre yaklaşık 800 bilet satılmış, 13'ü okunaksız ya da eksik olduğu için ayıklanmış, geriye 787 tahmin kalmıştı. Katılımcılar arasında kasaplar ve çiftçiler gibi uzmanlar da vardı, hayvanlardan anlamayan meraklılar da. Galton tahminleri sıraladığında ortadaki değerin 1.207 libre olduğunu gördü. Öküzün gerçek ağırlığı ise 1.198 libreydi: kalabalık yalnızca 9 libre, yani %0,8 yanılmıştı.
Ortanca mı, ortalama mı?
Galton bu deneyi bir demokrasi metaforu olarak gördü: 'bir kişi, bir oy' ilkesine göre her tahmin, ortadaki değeri kendi yönüne çeker; ortanca da tam bu yüzden kalabalığın kararıdır. Ortancanın bir avantajı var: tek bir aşırı uç tahmin, örneğin biri şaka olsun diye 100.000 yazsa bile, ortanca neredeyse hiç kıpırdamaz. Ortalama ise bu tür uçlara karşı savunmasızdır.
İlginç bir ayrıntı: aynı yıl Nature'da yayımlanan 'The Ballot-Box' başlıklı mektubunda Galton, bir okurun kendi tablosundan yaptığı yaklaşık hesapla ortalamayı 1.196 libre bulduğunu, doğru değerin ise 1.197 libre olduğunu yazdı. Bu öküz için ortalama da gerçeğe çok yakındı. Ama her durumda böyle değildir; özellikle şeker kavanozu gibi sayı tahminlerinde ortalama ile ortanca belirgin biçimde ayrışabilir.
Kalabalık ne zaman bilge?
Gazeteci James Surowiecki, 2004'te yayımladığı The Wisdom of Crowds kitabıyla bu fikri geniş kitlelere taşıdı. Kitaba göre bir kalabalığın akıllıca karar verebilmesi için görüşlerin çeşitli olması, insanların birbirinden bağımsız düşünmesi, bilginin merkezileşmemiş olması ve tek tek görüşleri birleştiren bir yöntemin bulunması gerekir.
Bağımsızlık koşulu özellikle kırılgandır. Jan Lorenz ve arkadaşları 2011'de 144 kişiyle yaptıkları deneyde katılımcılara olgusal sorular sordu ve bazı gruplara diğerlerinin tahminlerini gösterdi. Başkalarının tahminlerini gören gruplarda görüşler birbirine yaklaştı ama kalabalığın hatası azalmadı; gerçek değer tahminlerin kenarına itildi ve insanların kendine güveni, isabetleri artmadığı halde yükseldi. Yani birbirini dinleyen bir kalabalık daha emin ama daha bilge değil.
Kavanozun özel sorunu: sayılar logaritmik
Kavanozdaki şekerleri tahmin etmek, öküzün ağırlığını tahmin etmekten farklıdır. İnsanlar büyük miktarları gözle tahmin ederken sistematik olarak eksik söyleme eğilimindedir. Véronique Izard ve Stanislas Dehaene (2008), nokta kümeleri gösterdikleri katılımcıların tahminlerinin miktarla birlikte arttığını ama gerçeğin altında kaldığını buldu; birkaç denemede 'bu ekranda 30 nokta var' bilgisinin verilmesi ise tüm aralıktaki tahminleri ayarlamaya yetti.
Albert Kao ve arkadaşları (2018) 54 ile 27.852 arasında nesne içeren kavanozlarla yaptıkları deneylerde, tahminlerin normal değil log-normal dağıldığını gösterdi: çoğu tahmin gerçeğe yakın ya da biraz altında toplanır, az sayıda tahmin ise çok yükseğe uzanır. Topladıkları beş veri setinin dördünde aritmetik ortalama gerçeğin üstünde, ortanca ise gerçeğin altında kaldı. Bu yüzden kavanoz tahminlerinde tek bir 'doğru' özet yoktur; ortanca ve geometrik ortalama genellikle aritmetik ortalamadan daha güvenilirdir.
Sınıftaki fasulye kavanozu
Finans profesörü Jack Treynor, 1987'de Financial Analysts Journal'da yayımladığı yazıda öğrencileriyle yaptığı bir fasulye kavanozu deneyini piyasaların verimliliği için bir benzetme olarak kullandı. Aktarıldığına göre grubun ortalama tahmini, öğrencilerin neredeyse hepsinden daha isabetliydi; ama öğrencilere kavanozla ilgili yanıltıcı bir bilgi verildiğinde grup tahmini belirgin biçimde kötüleşti.
Treynor'un dersi açık: kalabalığın gücü, hataların birbirinden bağımsız olmasından gelir. Herkes aynı yanlış bilgiyle aynı yöne saparsa hatalar birbirini götürmez, üst üste biner. Bu ilke, piyasalardan seçimlere ve uzman panellerine kadar pek çok alanda karşımıza çıkar.
İkinci kavanoz: sayı büyüdükçe ne olur?
İkinci elde farklı biçimli bir kavanoz görüyorsun ve içindeki şeker sayısı da farklı. Bunun nedeni, gözle yapılan miktar tahminlerinin büyüklükle birlikte değişen bir yapısı olması. Izard ve Dehaene'nin (2008) deneylerinde tahminler miktarla birlikte artıyor ama gerçeğin altında kalıyordu; Kao ve arkadaşları (2018) da çok farklı büyüklüklerde aritmetik ortalamanın gerçeği aşma, ortancanın ise altında kalma eğiliminde olduğunu gösterdi.
İki kavanozu aynı kişiye sormak bize şunu da söyler: birinci kavanozda eksik tahmin eden biri, ikincide de eksik mi tahmin ediyor? Kişisel bir 'kalibrasyon' eğilimi varsa iki tahmin arasında bir ilişki görmeyi bekleriz. Kavanozun biçimi de tahmini etkileyebilecek bir değişken. Bu iki etkiyi tek bir karşılaştırmayla ayıramayacağımızı baştan söyleyelim; asıl merak ettiğimiz, kalabalığın ikinci kavanozda da aynı bilgeliği gösterip göstermediği.
Kalabalığı görünce fikrini değiştirmeli misin?
Üçüncü elde birinci kavanoza geri dönüyoruz, ama bu kez kalabalığın ortanca tahminini görerek. Lorenz ve arkadaşlarının (2011) deneyinde başkalarının tahminlerini görmek görüşleri birbirine yaklaştırmış ama kalabalığı daha isabetli yapmamıştı. Joshua Becker, Devon Brackbill ve Damon Centola (2017) tabloyu karmaşıklaştırdı: herkesin birkaç kişinin tahminini gördüğü ve kimsenin baskın olmadığı merkezsiz ağlarda bilgi alışverişi grup tahminini güvenilir biçimde iyileştirdi; birkaç merkezi kişinin etkisinin baskın olduğu ağlarda ise grup tahmininin hatası artabiliyordu.
Bireysel düzeyde ise iyi bilinen bir eğilim var: tavsiyeyi hafife alırız. Yaniv ve Kleinberger (2000) insanların başkalarının görüşünü kendi görüşlerine göre iskontoladığını gösterdi; Soll ve Larrick (2009) ise insanların iki tahmini ortalamak yerine çoğu zaman birini seçtiğini, oysa katılımcıların çoğunun her seferinde ortalama alsaydı daha isabetli olacağını buldu. Bizim ölçümümüz basit: ilk tahmininle kalabalığın ortancası arasındaki yolun ne kadarını yürüdün? Sıfır kendi tahmininde ısrar ettiğini, bir tamamen kalabalığa uyduğunu gösterir. Üç el bitince hem senin hem de kalabalığın ikinci tahminlerinin gerçeğe yaklaşıp yaklaşmadığını gösteriyoruz.
Bu deneyi nasıl okumalı?
Bizim kavanozumuz ekrana çizilmiş bir kavanoz; derinlik yok, şekerlerin bir kısmı üst üste biniyor ve ekran boyutu herkeste farklı. Yine de görevin özü aynı: saymadan, bir bakışta büyük bir miktarı tahmin etmek. Kalabalığın ortancasını ve geometrik ortalamasını gerçek sayıyla karşılaştırıyoruz; literatüre bakılırsa ortancanın gerçeğin biraz altında kalmasını bekleyebiliriz.
Sonucu gördükten sonra arkadaşına tahminini söylemeden önce testi yapmasını iste: kalabalığın bilgeliği, herkes kendi kafasıyla tahmin ettiği sürece işler.