Open Confidence Alpert ve Raiffa, 1982

Ne kadar eminsin?

On soru, her birine yüzde 90 emin olduğun bir alt ve üst sınır. Ne bildiğini değil, ne bilmediğini ne kadar iyi bildiğini ölçüyoruz.

4 dkto take part 0responses Anonymousno sign-up needed
actual90%?
EXP. 026

On sayısal soru: her birinde doğru cevabın yüzde 90 olasılıkla içinde kalacağı bir aralık verebilir misin?

Loading the experiment… It needs JavaScript to run; you can still read the science box and the article below.

Play again, climb higher

Leaderboard.

  1. No one is on the leaderboard yet. Be the first.
Only volunteers appear on the leaderboard. Your anonymous plays are linked to your account when you volunteer.Volunteer calibration · each person’s best play counts · “Today” resets every midnight (Istanbul time)
Take part first.

Reading the science could sway your answer. Everything unlocks once you take part, but you can read it now if you prefer.

Back to the experiment
Science box

Yüzde 90 emin olduğumuzu söylediğimiz aralıklar, doğru cevabı çoğu zaman bunun çok altında bir oranda yakalar.

What we measure

Her soruda tek bir tahmin değil, iki sayı istiyoruz: doğru cevabın yüzde 90 olasılıkla arasında kaldığına inandığın bir alt ve bir üst sınır. Bilgisi az olan biri de iyi kalibre olabilir; yeter ki aralığını bilgisizliğine göre genişletsin. Ölçtüğümüz şey isabet oranı (on aralığından kaçı doğru cevabı içeriyor; hedef yaklaşık dokuz), aralıklarının genişliği ve ikinci elde, ilk elin geri bildirimini gördükten sonra aralıklarının genişleyip genişlemediği.

What the research says

Marc Alpert ve Howard Raiffa'nın 1969'da el yazması olarak dolaşan, 1982'de yayımlanan çalışmasında Harvard'daki öğrencilerden istenen yüzde 98'lik aralıklar, Moore, Tenney ve Haran'ın (2015) özetine göre doğru cevabı ortalama yalnızca yaklaşık yüzde 60 oranında içerdi. Aynı yazarlara göre bir gruptan on soru için yüzde 90'lık aralık istendiğinde isabet oranı tipik olarak yüzde 30 ile 60 arasında çıkıyor. Soll ve Klayman (2004), öznel aralıkların bazen iyi kalibre olmak için gereken genişliğin yalnızca yüzde 40'ı kadar olduğunu buldu. Haran, Moore ve Morewedge (2010) ise yüzde 90'lık aralıkların doğru cevabı yaklaşık yüzde 74 oranında içerdiği bir görevde, olası değer aralıklarının her birine olasılık dağıtan SPIES yöntemiyle isabeti yaklaşık yüzde 88'e çıkardı.

Why it happens

Moore ve Healy (2008) aşırı güveni üç ayrı olguya ayırır: kendi performansını olduğundan iyi sanmak, kendini başkalarından iyi sanmak ve bildiğinden fazla emin olmak (aşırı kesinlik). Bu deney üçüncüsünü ölçer. Olası açıklamalar arasında akla gelen ilk tahmini bir çapa gibi kullanıp ondan yeterince uzaklaşmamak, akla gelmeyen olasılıkları hesaba katmamak ve 'yüzde 90' gibi soyut bir sayıyı somut bir genişliğe çevirmenin zorluğu sayılır. Aralığın nasıl sorulduğu da önemlidir: alt ve üst sınırı ayrı ayrı düşünmek aralıkları genişletip aşırı kesinliği azaltabiliyor.

Limitations

On soru az bir sayıdır: birkaç soruda şans, isabet oranını kolayca 10–20 puan oynatabilir. Katılımcılar internetten kendiliğinden geliyor ve cevabı aramak mümkün; bazı sorular (özellikle Türkiye'yle ilgili olanlar) bazı kişilere daha tanıdık gelebilir. Bazı ölçümler kaynaktan kaynağa küçük farklılıklar gösterebilir; puanlamada her sorunun yanında belirttiğimiz kaynaktaki değeri esas alıyoruz.

~%60Yüzde 98'lik aralıkların doğru cevabı içerme oranı (Alpert ve Raiffa'nın öğrencileri)Moore, Tenney ve Haran, 2015
%30–60On soru için yüzde 90'lık aralık: tipik isabet oranıMoore, Tenney ve Haran, 2015
bazen yalnızca %40'ıÖznel aralıkların genişliği, iyi kalibrasyon için gerekeninSoll ve Klayman, 2004
~%74 / ~%88Yüzde 90'lık aralıkların isabeti: klasik yöntem / SPIESHaran, Moore ve Morewedge, 2010
  1. Alpert, M., & Raiffa, H. (1982). A progress report on the training of probability assessors. In D. Kahneman, P. Slovic, & A. Tversky (Eds.), Judgment under uncertainty: Heuristics and biases (pp. 294–305). Cambridge University Press. View source ↗
  2. Lichtenstein, S., Fischhoff, B., & Phillips, L. D. (1982). Calibration of probabilities: The state of the art to 1980. In D. Kahneman, P. Slovic, & A. Tversky (Eds.), Judgment under uncertainty: Heuristics and biases (pp. 306–334). Cambridge University Press. View source ↗
  3. Soll, J. B., & Klayman, J. (2004). Overconfidence in interval estimates. Journal of Experimental Psychology: Learning, Memory, and Cognition, 30(2), 299–314. View source ↗
  4. Moore, D. A., & Healy, P. J. (2008). The trouble with overconfidence. Psychological Review, 115(2), 502–517. View source ↗
  5. Haran, U., Moore, D. A., & Morewedge, C. K. (2010). A simple remedy for overprecision in judgment. Judgment and Decision Making, 5(7), 467–476. View source ↗
  6. Moore, D. A., Tenney, E. R., & Haran, U. (2015). Overprecision in judgment. In G. Keren & G. Wu (Eds.), The Wiley Blackwell handbook of judgment and decision making (pp. 182–209). Wiley. View source ↗

Yüzde 90 emin olmak ne demek?

Ağrı Dağı kaç metre? Çoğumuz tam sayıyı bilmez ama bir fikrimiz vardır: “Herhalde 4.000 ile 6.000 arasında.” Bu deneyde senden tam olarak bunu istiyoruz: tek bir tahmin değil, doğru cevabı yüzde 90 olasılıkla içine alacağına inandığın bir aralık. Karar biliminde bu tür sorulara öznel güven aralığı tahmini denir ve bir kişinin belirsizliğini ne kadar dürüst ifade ettiğini ölçmenin en yalın yollarından biridir.

İşin püf noktası şu: iyi bir puan için her şeyi bilmen gerekmez. Bir konuda hiçbir fikrin yoksa aralığını genişletirsin, eminsen daraltırsın. Yüzde 90 emin olduğunu söylediğin on aralıktan yaklaşık dokuzu doğru cevabı yakalıyorsa iyi kalibre sayılırsın. Yani bu test bilgini değil, bilgini ne kadar doğru tarttığını ölçer. Araştırmalar ise insanların bu konuda sistematik olarak fazla iddialı olduğunu gösteriyor.

Harvard'daki sürpriz

Bu olgunun klasik gösterimi karar analizcileri Marc Alpert ve Howard Raiffa'dan geliyor. 1969'da el yazması olarak dolaşan ve 1982'de Kahneman, Slovic ve Tversky'nin derlediği “Judgment under Uncertainty” kitabında yayımlanan çalışmalarında, Harvard'daki öğrencilerinden çeşitli belirsiz miktarlar için olasılık değerleri istediler. Öğrencilerin verdiği değerlerden, doğru cevabın yüzde 98 olasılıkla içinde kalması gereken aralıklar elde ediliyordu.

İdealde doğru cevapların yalnızca yüzde 2'si bu aralıkların dışında kalmalıydı. Don Moore, Elizabeth Tenney ve Uriel Haran'ın sonradan yaptığı özete göre bu aralıklar doğru cevabı ortalama yalnızca yaklaşık yüzde 60 oranında içerdi; yani “neredeyse kesin” denen aralıklar her on sorudan yaklaşık dördünde ıskaladı. Yazarlara göre bu gösterim o günden bu yana yüzlerce kez tekrarlandı: bir gruptan on soru için yüzde 90'lık aralık istediğinizde tipik isabet oranı yüzde 30 ile 60 arasında çıkıyor. Hatta yüzde 98'lik aralıklar bazen yüzde 50'lik aralıklardan pek de geniş olmuyor.

Aşırı güvenin üç yüzü

“Aşırı güven” gündelik dilde tek bir şey gibi kullanılır ama Don Moore ve Paul Healy 2008'de Psychological Review'da bunun aslında üç ayrı olgu olduğunu savundu. Birincisi, kendi performansını olduğundan iyi sanmak (örneğin sınavda gerçekte olduğundan çok soru yaptığını düşünmek). İkincisi, kendini başkalarından iyi sanmak (sürücülerin çoğunun kendini ortalamanın üstünde görmesi gibi). Üçüncüsü ise bildiğinden fazla emin olmak, yani tahminlerinin etrafındaki belirsizliği küçümsemek: aşırı kesinlik.

Bu deney üçüncüsünü ölçüyor ve bunun iyi bir nedeni var. İlk iki tür koşullara göre tersine dönebiliyor: insanlar kolay görevlerde kendi performansını küçümseyebiliyor, zor görevlerde ise kendini başkalarından geride sanabiliyor. Moore ve arkadaşlarının derlemesine göre ise aşırı kesinliğin tersine döndüğü belgelenmiş vaka ya hiç yok ya da çok az. Kısacası, aralık çizme görevinde neredeyse herkes, neredeyse her koşulda aralıklarını gerekenden dar çiziyor.

Aralıklarımız neden bu kadar dar?

Jack Soll ve Joshua Klayman 2004'te yaptıkları deneylerde, insanların aralıklarının bazen iyi kalibre olmak için gereken genişliğin yalnızca yüzde 40'ı kadar olduğunu gösterdi. Aynı çalışmada aşırı kesinliğin miktarı, sorunun alanına ve aralığın nasıl sorulduğuna göre belirgin biçimde değişti. Bir açıklama çapalama ve ayarlamadır: önce akla bir “en iyi tahmin” gelir, sonra alt ve üst sınır bu noktadan biraz uzaklaştırılarak bulunur. Uzaklaşma genellikle yetersiz kalır.

İkinci bir açıklama, akla gelmeyen senaryoların yokmuş gibi davranılmasıdır. Ağrı Dağı'nı düşünürken aklına gelen bir iki ipucu sana tutarlı bir hikâye anlatır ve o hikâyenin yanlış olabileceği yollar görünmez kalır. Araştırmalar, yüksek ve düşük değerleri ayrı ayrı düşünmenin aralıkları genişlettiğini ve aşırı kesinliği azalttığını gösteriyor. Sarah Lichtenstein, Baruch Fischhoff ve Lawrence Phillips'in 1982'deki kapsamlı derlemesi de güven yargılarındaki aşırı iddiacılığın pek çok grupta görüldüğünü, buna karşın hava durumu tahmincileri gibi düzenli ve hızlı geri bildirim alan bazı uzmanların oldukça iyi kalibre olabildiğini ortaya koyar.

Gündelik hayatta: süreler, bütçeler, tahminler

Aşırı kesinlik laboratuvarla sınırlı değil. Bir işin ne kadar süreceğini, bir tadilatın kaça mal olacağını ya da bir yatırımın ne getireceğini tahmin ederken çoğumuz tek bir sayı söyleriz ve o sayının etrafındaki belirsizliği küçümseriz. “En kötü ihtimalle iki hafta” dediğimiz işin bir ay sürmesi, aralığımızın gerçekte ne kadar dar olduğunun gündelik bir kanıtıdır.

Bu yüzden iyi tahminciler tek bir sayı yerine aralıklarla düşünür ve kendi geçmiş tahminlerinin ne sıklıkla tuttuğunu takip eder. Kendi isabet oranını bilmek, “yüzde 90 eminim” cümlesine gerçek bir anlam kazandırır. Bu deneydeki ara sonuç ekranı da tam olarak bunun küçük bir provası: aralıklarının kaçının tuttuğunu görmek, bir sonraki tahminini nasıl verdiğini değiştirebilir mi?

Geri bildirim işe yarar mı?

Moore, Tenney ve Haran'ın derlemesine göre geri bildirim bazı durumlarda aşırı güveni azaltabiliyor ama bu etki evrensel değil; olumlu etki en çok ilk tahminden sonra görülüyor ve sonrasında kaybolabiliyor. Bizim ikinci elimiz tam da bunu soruyor: ilk beş soruda kaç aralığın tuttuğunu gördükten sonra aralıklarını genişletiyor musun ve bu isabetini gerçekten yükseltiyor mu?

Daha kalıcı bir çözüm, soruyu sorma biçimini değiştirmek olabilir. Uriel Haran, Don Moore ve Carey Morewedge 2010'da SPIES adını verdikleri bir yöntem denedi: kişiden tek bir aralık yerine, olası değerleri birkaç dilime bölüp her dilime bir olasılık vermesi istendi. Bir sıcaklık tahmini görevinde klasik yüzde 90'lık aralıklar doğru cevabı yaklaşık yüzde 74 oranında içerirken, SPIES'tan türetilen aralıklar yaklaşık yüzde 88 oranında içerdi. Yani sorun yalnızca bilgisizlikte değil, belirsizliği ifade etmek için kullandığımız araçta da yatıyor.

FAQ

Kalibrasyon ne demek?

Verdiğin güven düzeyiyle gerçek isabet oranının örtüşmesidir. Yüzde 90 emin olduğunu söylediğin aralıkların yaklaşık yüzde 90'ı doğru cevabı içeriyorsa iyi kalibre sayılırsın. Bu, ne kadar bildiğinden bağımsızdır.

On sorudan kaçını tutturmam gerekir?

İdeal olarak yaklaşık dokuzunu. On sorunun hepsini yakalamak da tam isabet değildir; aralıklarının gereğinden geniş olduğuna işaret edebilir. Ama araştırmalarda çok daha sık görülen sorun, aralıkların dar kalmasıdır.

İnsanlar bu testte genellikle ne kadar başarılı?

Moore, Tenney ve Haran'ın derlemesine göre on soru için yüzde 90'lık aralık istendiğinde tipik isabet oranı yüzde 30 ile 60 arasındadır. Alpert ve Raiffa'nın öğrencilerinin yüzde 98'lik aralıkları doğru cevabı ortalama yaklaşık yüzde 60 oranında içeriyordu.

Çok geniş aralıklar verip hepsini tutturursam?

İsabet oranın yüzde 100 olur ama bu da kalibrasyondan sapmadır. Ayrıca çok geniş bir aralık bilgi taşımaz: “0 ile 1 milyon arası” demek, hiçbir şey söylememek gibidir. Puanlamada eşitlik durumunda daha dar aralık vereni öne alıyoruz.

Aşırı kesinliği nasıl azaltabilirim?

Önce alt ve üst sınırı ayrı ayrı düşün: “Cevabın bundan küçük olma ihtimali gerçekten yüzde 5 mi?” diye sor. Olası değerleri dilimlere bölüp her dilime olasılık vermek ve kendi geçmiş tahminlerinin isabetini takip etmek de işe yarayabilir.

Discussion 0 comments

Volunteer to comment and vote. It takes 20 seconds.
Log inVolunteer
No comments yet. Be the first.

Threads about this experiment

Start a new thread →
There’s no separate thread for this experiment yet. Start one to critique the method, share a paper or ask a new question.