Open Estimation Galton, 1907a

Kavanozda kaç şeker var?

Tek başına tahminin muhtemelen isabetsiz; peki yüzlerce tahmin bir araya gelince ne olur? Kalabalığı gördükten sonra fikrini değiştirmek işe yarar mı?

2 dkto take part 7responses Anonymousno sign-up needed
?
EXP. 006

Kavanozdaki şekerleri saymadan, kaç tane olduğunu tahmin et ve yaz.

Loading the experiment… It needs JavaScript to run; you can still read the science box and the article below.

Play again, climb higher

Leaderboard.

  1. No one is on the leaderboard yet. Be the first.
Only volunteers appear on the leaderboard. Your anonymous plays are linked to your account when you volunteer.Volunteer estimation error · each person’s best play counts · “Today” resets every midnight (Istanbul time)
Take part first.

Reading the science could sway your answer. Everything unlocks once you take part, but you can read it now if you prefer.

Back to the experiment
Science box

Birbirinden habersiz tahminlerin ortancası, çoğu bireyden daha isabetli olabilir.

What we measure

Kavanozdaki şekerleri tek tek saymadan tahmin ediyorsun. Herkesin tahminini topluyor, kalabalığın ortanca (medyan, yani tahminler sıralandığında tam ortadaki değer) tahmininin gerçek sayıya ne kadar yaklaştığını ve senin tahmininin kalabalığın içinde nerede durduğunu gösteriyoruz. İkinci elde farklı biçimli ve farklı sayıda şeker içeren ikinci bir kavanozu tahmin ediyorsun; iki kavanozdaki hatanı karşılaştırınca, sayı büyüdükçe tahminlerin nasıl değiştiğini ve kişisel bir eksik ya da fazla tahmin eğilimi olup olmadığını görebiliyoruz. Üçüncü elde birinci kavanoz için kalabalığın ortanca tahminini gösteriyor ve tahminini güncellemeni istiyoruz. İlk tahmininden kalabalığa doğru ne kadar kaydığın (0 = hiç, 1 = tamamen kalabalığın değeri) senin sosyal bilgiye verdiğin ağırlık; kalabalığın ikinci tahminleri de sosyal etkinin kalabalığın bilgeliğini artırıp azalttığını gösteriyor.

What the research says

Francis Galton 1907'de Nature'da, Plymouth'taki bir hayvancılık fuarında kesilip temizlenecek bir öküzün ağırlığı için yapılmış 787 geçerli tahmini inceledi: ortanca tahmin 1.207 libre, gerçek ağırlık 1.198 libreydi, yani fark yalnızca %0,8'di. Galton aynı yıl yazdığı ikinci mektupta tahminlerin ortalamasının da 1.197 libre civarında olduğunu belirtti. Kao ve arkadaşları (2018) kavanozdaki nesneleri sayma deneylerinde tahminlerin log-normal dağıldığını, ortalamanın gerçek sayıyı çoğunlukla abarttığını, ortancanın ise çoğunlukla hafifçe altında kaldığını gösterdi. Lorenz ve arkadaşları (2011) 144 kişilik bir deneyde, başkalarının tahminlerini görmenin görüş çeşitliliğini daralttığını ve kalabalığın bilgeliğini zayıflattığını buldu. Sosyal etkinin her zaman zararlı olmadığı da gösterildi: Becker, Brackbill ve Centola (2017), kimsenin baskın olmadığı merkezsiz ağlarda bilgi alışverişinin grup tahminlerini güvenilir biçimde iyileştirdiğini, birkaç merkezi kişinin baskın olduğu ağlarda ise hatanın artma olasılığının yükseldiğini buldu. Kao ve arkadaşları (2018) da kişilerin kendi tahminleriyle sosyal bilgiyi nasıl birleştirdiğini ölçen bir deney yaptı. Tavsiye alma araştırmalarında insanların başkalarının görüşünü kendi görüşlerine göre iskontoladığı (Yaniv ve Kleinberger, 2000) ve iki tahmini ortalamak çoğu ortamda daha isabetli olacakken çoğu zaman ikisinden birini seçmeyi tercih ettiği (Soll ve Larrick, 2009) bilinir.

Why it happens

Bağımsız tahminlerdeki hatalar farklı yönlere dağıldığında birbirini kısmen götürür; geriye ortak bilgi kalır. Ama gözle büyük miktarları tahmin ederken hatalar simetrik değildir: kalibrasyon olmadan genellikle eksik söyleriz (Izard ve Dehaene, 2008), ara sıra gelen devasa tahminler ise ortalamayı yukarı çeker. Bu yüzden ortanca ya da tahminlerin logaritmasının ortalaması (geometrik ortalama) aritmetik ortalamadan daha sağlam bir özettir. Kalabalığın ortancası çok sayıda bağımsız tahminin özeti olduğu için genellikle tek bir kişinin tahmininden daha iyi bir tavsiyedir. Ama herkes aynı değere doğru kaydığında görüş çeşitliliği azalır ve sonraki tahminler artık bağımsız olmaz; Lorenz ve arkadaşlarının (2011) uyardığı durum budur. Kendi görüşümüze fazladan ağırlık vermemizin bir nedeni de, kendi gerekçelerimizi bilip başkalarınınkini bilmememizdir (Yaniv ve Kleinberger, 2000).

Limitations

Ekrana çizilmiş bir kavanozda derinlik yoktur ve ekran boyutu kişiden kişiye değişir; bu, gerçek bir kavanozdan farklı bir görevdir. Sonuçları gördükten sonra tekrar deneyenler ya da tahminini arkadaşlarıyla paylaşanlar bağımsızlığı bozar; bu yüzden kalabalığın değerini yalnızca tahminini yaptıktan sonra gösteriyoruz. Üçüncü elde gösterdiğimiz ortanca, senden önceki ziyaretçilerin birinci el tahminlerinden hesaplanıyor; az kişi varken bu değer oynak olabilir. Gerçek sayıları üç el bitmeden göstermiyoruz, çünkü cevabı bilmek hem ikinci kavanozu hem de güncellemeyi anlamsız kılar. İkinci kavanozun hem biçimi hem şeker sayısı farklı olduğu için iki kavanozdaki hata farkını bu iki etkiden birine bağlayamıyoruz.

1.207 / 1.198 libre (%0,8 fark, n=787)Galton'un öküzü: ortanca tahmin / gerçek ağırlıkGalton, 1907a
~1.197 libreGalton'un verisinde tahminlerin ortalamasıGalton, 1907b
çoğunlukla gerçeğin biraz altında (5 veri setinin 4'ü)Kavanoz deneylerinde ortancaKao vd., 2018
çoğunlukla gerçeğin üstünde (5 veri setinin 4'ü)Kavanoz deneylerinde aritmetik ortalamaKao vd., 2018
  1. Galton, F. (1907). Vox populi. Nature, 75(1949), 450–451. View source ↗
  2. Galton, F. (1907). The ballot-box. Nature, 75(1952), 509–510. View source ↗
  3. Lorenz, J., Rauhut, H., Schweitzer, F., & Helbing, D. (2011). How social influence can undermine the wisdom of crowd effect. Proceedings of the National Academy of Sciences, 108(22), 9020–9025. View source ↗
  4. Kao, A. B., Berdahl, A. M., Hartnett, A. T., Lutz, M. J., Bak-Coleman, J. B., Ioannou, C. C., Giam, X., & Couzin, I. D. (2018). Counteracting estimation bias and social influence to improve the wisdom of crowds. Journal of the Royal Society Interface, 15(141), 20180130. View source ↗
  5. Izard, V., & Dehaene, S. (2008). Calibrating the mental number line. Cognition, 106(3), 1221–1247. View source ↗
  6. Treynor, J. L. (1987). Market efficiency and the bean jar experiment. Financial Analysts Journal, 43(3), 50–53. View source ↗
  7. Becker, J., Brackbill, D., & Centola, D. (2017). Network dynamics of social influence in the wisdom of crowds. Proceedings of the National Academy of Sciences, 114(26), E5070–E5076. View source ↗
  8. Yaniv, I., & Kleinberger, E. (2000). Advice taking in decision making: Egocentric discounting and reputation formation. Organizational Behavior and Human Decision Processes, 83(2), 260–281. View source ↗
  9. Soll, J. B., & Larrick, R. P. (2009). Strategies for revising judgment: How (and how well) people use others' opinions. Journal of Experimental Psychology: Learning, Memory, and Cognition, 35(3), 780–805. View source ↗

Bir öküz, 787 bilet

İngiltere'nin Plymouth kentinde düzenlenen West of England Fat Stock and Poultry Exhibition adlı fuarda bir yarışma yapıldı: ziyaretçiler altı peni karşılığında bir bilet alıyor, sergilenen öküzün kesilip temizlendikten sonra kaç libre geleceğini yazıyordu. En yakın tahminler ödül kazanacaktı. İstatistiğin öncülerinden Francis Galton, yarışma bittikten sonra biletleri incelemek için ödünç aldı.

Galton'un 1907'de Nature dergisinde 'Vox Populi' (halkın sesi) başlığıyla yayımladığı kısa yazıya göre yaklaşık 800 bilet satılmış, 13'ü okunaksız ya da eksik olduğu için ayıklanmış, geriye 787 tahmin kalmıştı. Katılımcılar arasında kasaplar ve çiftçiler gibi uzmanlar da vardı, hayvanlardan anlamayan meraklılar da. Galton tahminleri sıraladığında ortadaki değerin 1.207 libre olduğunu gördü. Öküzün gerçek ağırlığı ise 1.198 libreydi: kalabalık yalnızca 9 libre, yani %0,8 yanılmıştı.

Ortanca mı, ortalama mı?

Galton bu deneyi bir demokrasi metaforu olarak gördü: 'bir kişi, bir oy' ilkesine göre her tahmin, ortadaki değeri kendi yönüne çeker; ortanca da tam bu yüzden kalabalığın kararıdır. Ortancanın bir avantajı var: tek bir aşırı uç tahmin, örneğin biri şaka olsun diye 100.000 yazsa bile, ortanca neredeyse hiç kıpırdamaz. Ortalama ise bu tür uçlara karşı savunmasızdır.

İlginç bir ayrıntı: aynı yıl Nature'da yayımlanan 'The Ballot-Box' başlıklı mektubunda Galton, bir okurun kendi tablosundan yaptığı yaklaşık hesapla ortalamayı 1.196 libre bulduğunu, doğru değerin ise 1.197 libre olduğunu yazdı. Bu öküz için ortalama da gerçeğe çok yakındı. Ama her durumda böyle değildir; özellikle şeker kavanozu gibi sayı tahminlerinde ortalama ile ortanca belirgin biçimde ayrışabilir.

Kalabalık ne zaman bilge?

Gazeteci James Surowiecki, 2004'te yayımladığı The Wisdom of Crowds kitabıyla bu fikri geniş kitlelere taşıdı. Kitaba göre bir kalabalığın akıllıca karar verebilmesi için görüşlerin çeşitli olması, insanların birbirinden bağımsız düşünmesi, bilginin merkezileşmemiş olması ve tek tek görüşleri birleştiren bir yöntemin bulunması gerekir.

Bağımsızlık koşulu özellikle kırılgandır. Jan Lorenz ve arkadaşları 2011'de 144 kişiyle yaptıkları deneyde katılımcılara olgusal sorular sordu ve bazı gruplara diğerlerinin tahminlerini gösterdi. Başkalarının tahminlerini gören gruplarda görüşler birbirine yaklaştı ama kalabalığın hatası azalmadı; gerçek değer tahminlerin kenarına itildi ve insanların kendine güveni, isabetleri artmadığı halde yükseldi. Yani birbirini dinleyen bir kalabalık daha emin ama daha bilge değil.

Kavanozun özel sorunu: sayılar logaritmik

Kavanozdaki şekerleri tahmin etmek, öküzün ağırlığını tahmin etmekten farklıdır. İnsanlar büyük miktarları gözle tahmin ederken sistematik olarak eksik söyleme eğilimindedir. Véronique Izard ve Stanislas Dehaene (2008), nokta kümeleri gösterdikleri katılımcıların tahminlerinin miktarla birlikte arttığını ama gerçeğin altında kaldığını buldu; birkaç denemede 'bu ekranda 30 nokta var' bilgisinin verilmesi ise tüm aralıktaki tahminleri ayarlamaya yetti.

Albert Kao ve arkadaşları (2018) 54 ile 27.852 arasında nesne içeren kavanozlarla yaptıkları deneylerde, tahminlerin normal değil log-normal dağıldığını gösterdi: çoğu tahmin gerçeğe yakın ya da biraz altında toplanır, az sayıda tahmin ise çok yükseğe uzanır. Topladıkları beş veri setinin dördünde aritmetik ortalama gerçeğin üstünde, ortanca ise gerçeğin altında kaldı. Bu yüzden kavanoz tahminlerinde tek bir 'doğru' özet yoktur; ortanca ve geometrik ortalama genellikle aritmetik ortalamadan daha güvenilirdir.

Sınıftaki fasulye kavanozu

Finans profesörü Jack Treynor, 1987'de Financial Analysts Journal'da yayımladığı yazıda öğrencileriyle yaptığı bir fasulye kavanozu deneyini piyasaların verimliliği için bir benzetme olarak kullandı. Aktarıldığına göre grubun ortalama tahmini, öğrencilerin neredeyse hepsinden daha isabetliydi; ama öğrencilere kavanozla ilgili yanıltıcı bir bilgi verildiğinde grup tahmini belirgin biçimde kötüleşti.

Treynor'un dersi açık: kalabalığın gücü, hataların birbirinden bağımsız olmasından gelir. Herkes aynı yanlış bilgiyle aynı yöne saparsa hatalar birbirini götürmez, üst üste biner. Bu ilke, piyasalardan seçimlere ve uzman panellerine kadar pek çok alanda karşımıza çıkar.

İkinci kavanoz: sayı büyüdükçe ne olur?

İkinci elde farklı biçimli bir kavanoz görüyorsun ve içindeki şeker sayısı da farklı. Bunun nedeni, gözle yapılan miktar tahminlerinin büyüklükle birlikte değişen bir yapısı olması. Izard ve Dehaene'nin (2008) deneylerinde tahminler miktarla birlikte artıyor ama gerçeğin altında kalıyordu; Kao ve arkadaşları (2018) da çok farklı büyüklüklerde aritmetik ortalamanın gerçeği aşma, ortancanın ise altında kalma eğiliminde olduğunu gösterdi.

İki kavanozu aynı kişiye sormak bize şunu da söyler: birinci kavanozda eksik tahmin eden biri, ikincide de eksik mi tahmin ediyor? Kişisel bir 'kalibrasyon' eğilimi varsa iki tahmin arasında bir ilişki görmeyi bekleriz. Kavanozun biçimi de tahmini etkileyebilecek bir değişken. Bu iki etkiyi tek bir karşılaştırmayla ayıramayacağımızı baştan söyleyelim; asıl merak ettiğimiz, kalabalığın ikinci kavanozda da aynı bilgeliği gösterip göstermediği.

Kalabalığı görünce fikrini değiştirmeli misin?

Üçüncü elde birinci kavanoza geri dönüyoruz, ama bu kez kalabalığın ortanca tahminini görerek. Lorenz ve arkadaşlarının (2011) deneyinde başkalarının tahminlerini görmek görüşleri birbirine yaklaştırmış ama kalabalığı daha isabetli yapmamıştı. Joshua Becker, Devon Brackbill ve Damon Centola (2017) tabloyu karmaşıklaştırdı: herkesin birkaç kişinin tahminini gördüğü ve kimsenin baskın olmadığı merkezsiz ağlarda bilgi alışverişi grup tahminini güvenilir biçimde iyileştirdi; birkaç merkezi kişinin etkisinin baskın olduğu ağlarda ise grup tahmininin hatası artabiliyordu.

Bireysel düzeyde ise iyi bilinen bir eğilim var: tavsiyeyi hafife alırız. Yaniv ve Kleinberger (2000) insanların başkalarının görüşünü kendi görüşlerine göre iskontoladığını gösterdi; Soll ve Larrick (2009) ise insanların iki tahmini ortalamak yerine çoğu zaman birini seçtiğini, oysa katılımcıların çoğunun her seferinde ortalama alsaydı daha isabetli olacağını buldu. Bizim ölçümümüz basit: ilk tahmininle kalabalığın ortancası arasındaki yolun ne kadarını yürüdün? Sıfır kendi tahmininde ısrar ettiğini, bir tamamen kalabalığa uyduğunu gösterir. Üç el bitince hem senin hem de kalabalığın ikinci tahminlerinin gerçeğe yaklaşıp yaklaşmadığını gösteriyoruz.

Bu deneyi nasıl okumalı?

Bizim kavanozumuz ekrana çizilmiş bir kavanoz; derinlik yok, şekerlerin bir kısmı üst üste biniyor ve ekran boyutu herkeste farklı. Yine de görevin özü aynı: saymadan, bir bakışta büyük bir miktarı tahmin etmek. Kalabalığın ortancasını ve geometrik ortalamasını gerçek sayıyla karşılaştırıyoruz; literatüre bakılırsa ortancanın gerçeğin biraz altında kalmasını bekleyebiliriz.

Sonucu gördükten sonra arkadaşına tahminini söylemeden önce testi yapmasını iste: kalabalığın bilgeliği, herkes kendi kafasıyla tahmin ettiği sürece işler.

FAQ

Kalabalığın bilgeliği nedir?

Birbirinden bağımsız çok sayıda tahminin ortanca ya da ortalamasının, çoğu zaman tek tek bireylerin tahminlerinden daha isabetli olmasıdır. En bilinen örneği, Galton'un 1907'de incelediği öküz ağırlığı yarışmasıdır.

Neden ortalama yerine ortanca gösteriyorsunuz?

Ortanca, uç tahminlerden neredeyse etkilenmez. Kavanoz tahminleri log-normal dağıldığı için aritmetik ortalama genellikle gerçeği abartır (Kao vd., 2018); ortanca ve geometrik ortalama daha sağlam özetlerdir.

Kavanozdaki şeker sayısını daha iyi nasıl tahmin ederim?

Bir sıradaki ya da bir katmandaki şekerleri sayıp kavanozun kaç sıra ya da katmandan oluştuğunu tahmin etmek, tek bakışlık bir tahminden genellikle daha iyidir. Şekerlerin arasında boşluk kaldığını, yani kavanozun hacminin tamamen dolu olmadığını da hesaba kat.

Başkalarının tahminini görmek neden sonucu bozar?

Lorenz ve arkadaşlarının (2011) deneyinde başkalarının tahminlerini görenlerin görüşleri birbirine yaklaştı ama kalabalığın hatası azalmadı, insanların kendine güveni ise arttı. Bağımsız hatalar birbirini götürür; ortaklaşan hatalar götürmez.

Kalabalığın tahminini gördükten sonra fikrimi değiştirmeli miyim?

Bağımsız tahminlerden hesaplanan ortanca genellikle iyi bir tavsiyedir ve araştırmalar insanların başkalarının görüşüne gereğinden az ağırlık verme eğiliminde olduğunu gösteriyor (Yaniv ve Kleinberger, 2000; Soll ve Larrick, 2009). Ama herkes aynı değere kayarsa kalabalığın çeşitliliği azalır; bu yüzden ilk tahminini kalabalığı göstermeden önce alıyoruz.

Discussion 0 comments

Volunteer to comment and vote. It takes 20 seconds.
Log inVolunteer
No comments yet. Be the first.

Threads about this experiment

Start a new thread →
There’s no separate thread for this experiment yet. Start one to critique the method, share a paper or ask a new question.