Açık Özgüven Alpert ve Raiffa, 1982

Ne kadar eminsin?

On soru, her birine yüzde 90 emin olduğun bir alt ve üst sınır. Ne bildiğini değil, ne bilmediğini ne kadar iyi bildiğini ölçüyoruz.

4 dksürer 0katılım Anonimkayıt gerekmez
gerçek%90?
EXP. 026

On sayısal soru: her birinde doğru cevabın yüzde 90 olasılıkla içinde kalacağı bir aralık verebilir misin?

Deney yükleniyor… JavaScript kapalıysa deney çalışmaz; bilim kutusunu ve makaleyi aşağıda okuyabilirsin.

Tekrar oyna, yüksel

Sıralama.

  1. Henüz kimse sıralamaya girmedi. İlk sen ol.
Sıralamada yalnızca gönüllüler görünür. Anonim oynayışların, gönüllü olunca hesabına bağlanır.Gönüllü ol kalibrasyon · her kişinin en iyi oynayışı sayılır
Önce deneye katıl.

Bilimi okumak cevabını etkileyebilir. Katıldıktan sonra her şey açılır; istersen yine de şimdi okuyabilirsin.

Deneye dön
Bilim kutusu

Yüzde 90 emin olduğumuzu söylediğimiz aralıklar, doğru cevabı çoğu zaman bunun çok altında bir oranda yakalar.

Ne ölçüyoruz

Her soruda tek bir tahmin değil, iki sayı istiyoruz: doğru cevabın yüzde 90 olasılıkla arasında kaldığına inandığın bir alt ve bir üst sınır. Bilgisi az olan biri de iyi kalibre olabilir; yeter ki aralığını bilgisizliğine göre genişletsin. Ölçtüğümüz şey isabet oranı (on aralığından kaçı doğru cevabı içeriyor; hedef yaklaşık dokuz), aralıklarının genişliği ve ikinci elde, ilk elin geri bildirimini gördükten sonra aralıklarının genişleyip genişlemediği.

Araştırmalar ne diyor

Marc Alpert ve Howard Raiffa'nın 1969'da el yazması olarak dolaşan, 1982'de yayımlanan çalışmasında Harvard'daki öğrencilerden istenen yüzde 98'lik aralıklar, Moore, Tenney ve Haran'ın (2015) özetine göre doğru cevabı ortalama yalnızca yaklaşık yüzde 60 oranında içerdi. Aynı yazarlara göre bir gruptan on soru için yüzde 90'lık aralık istendiğinde isabet oranı tipik olarak yüzde 30 ile 60 arasında çıkıyor. Soll ve Klayman (2004), öznel aralıkların bazen iyi kalibre olmak için gereken genişliğin yalnızca yüzde 40'ı kadar olduğunu buldu. Haran, Moore ve Morewedge (2010) ise yüzde 90'lık aralıkların doğru cevabı yaklaşık yüzde 74 oranında içerdiği bir görevde, olası değer aralıklarının her birine olasılık dağıtan SPIES yöntemiyle isabeti yaklaşık yüzde 88'e çıkardı.

Neden böyle

Moore ve Healy (2008) aşırı güveni üç ayrı olguya ayırır: kendi performansını olduğundan iyi sanmak, kendini başkalarından iyi sanmak ve bildiğinden fazla emin olmak (aşırı kesinlik). Bu deney üçüncüsünü ölçer. Olası açıklamalar arasında akla gelen ilk tahmini bir çapa gibi kullanıp ondan yeterince uzaklaşmamak, akla gelmeyen olasılıkları hesaba katmamak ve 'yüzde 90' gibi soyut bir sayıyı somut bir genişliğe çevirmenin zorluğu sayılır. Aralığın nasıl sorulduğu da önemlidir: alt ve üst sınırı ayrı ayrı düşünmek aralıkları genişletip aşırı kesinliği azaltabiliyor.

Sınırlılık

On soru az bir sayıdır: birkaç soruda şans, isabet oranını kolayca 10–20 puan oynatabilir. Katılımcılar internetten kendiliğinden geliyor ve cevabı aramak mümkün; bazı sorular (özellikle Türkiye'yle ilgili olanlar) bazı kişilere daha tanıdık gelebilir. Bazı ölçümler kaynaktan kaynağa küçük farklılıklar gösterebilir; puanlamada her sorunun yanında belirttiğimiz kaynaktaki değeri esas alıyoruz.

~%60Yüzde 98'lik aralıkların doğru cevabı içerme oranı (Alpert ve Raiffa'nın öğrencileri)Moore, Tenney ve Haran, 2015
%30–60On soru için yüzde 90'lık aralık: tipik isabet oranıMoore, Tenney ve Haran, 2015
bazen yalnızca %40'ıÖznel aralıkların genişliği, iyi kalibrasyon için gerekeninSoll ve Klayman, 2004
~%74 / ~%88Yüzde 90'lık aralıkların isabeti: klasik yöntem / SPIESHaran, Moore ve Morewedge, 2010
  1. Alpert, M., & Raiffa, H. (1982). A progress report on the training of probability assessors. In D. Kahneman, P. Slovic, & A. Tversky (Eds.), Judgment under uncertainty: Heuristics and biases (pp. 294–305). Cambridge University Press. Kaynağa git ↗
  2. Lichtenstein, S., Fischhoff, B., & Phillips, L. D. (1982). Calibration of probabilities: The state of the art to 1980. In D. Kahneman, P. Slovic, & A. Tversky (Eds.), Judgment under uncertainty: Heuristics and biases (pp. 306–334). Cambridge University Press. Kaynağa git ↗
  3. Soll, J. B., & Klayman, J. (2004). Overconfidence in interval estimates. Journal of Experimental Psychology: Learning, Memory, and Cognition, 30(2), 299–314. Kaynağa git ↗
  4. Moore, D. A., & Healy, P. J. (2008). The trouble with overconfidence. Psychological Review, 115(2), 502–517. Kaynağa git ↗
  5. Haran, U., Moore, D. A., & Morewedge, C. K. (2010). A simple remedy for overprecision in judgment. Judgment and Decision Making, 5(7), 467–476. Kaynağa git ↗
  6. Moore, D. A., Tenney, E. R., & Haran, U. (2015). Overprecision in judgment. In G. Keren & G. Wu (Eds.), The Wiley Blackwell handbook of judgment and decision making (pp. 182–209). Wiley. Kaynağa git ↗

Yüzde 90 emin olmak ne demek?

Ağrı Dağı kaç metre? Çoğumuz tam sayıyı bilmez ama bir fikrimiz vardır: “Herhalde 4.000 ile 6.000 arasında.” Bu deneyde senden tam olarak bunu istiyoruz: tek bir tahmin değil, doğru cevabı yüzde 90 olasılıkla içine alacağına inandığın bir aralık. Karar biliminde bu tür sorulara öznel güven aralığı tahmini denir ve bir kişinin belirsizliğini ne kadar dürüst ifade ettiğini ölçmenin en yalın yollarından biridir.

İşin püf noktası şu: iyi bir puan için her şeyi bilmen gerekmez. Bir konuda hiçbir fikrin yoksa aralığını genişletirsin, eminsen daraltırsın. Yüzde 90 emin olduğunu söylediğin on aralıktan yaklaşık dokuzu doğru cevabı yakalıyorsa iyi kalibre sayılırsın. Yani bu test bilgini değil, bilgini ne kadar doğru tarttığını ölçer. Araştırmalar ise insanların bu konuda sistematik olarak fazla iddialı olduğunu gösteriyor.

Harvard'daki sürpriz

Bu olgunun klasik gösterimi karar analizcileri Marc Alpert ve Howard Raiffa'dan geliyor. 1969'da el yazması olarak dolaşan ve 1982'de Kahneman, Slovic ve Tversky'nin derlediği “Judgment under Uncertainty” kitabında yayımlanan çalışmalarında, Harvard'daki öğrencilerinden çeşitli belirsiz miktarlar için olasılık değerleri istediler. Öğrencilerin verdiği değerlerden, doğru cevabın yüzde 98 olasılıkla içinde kalması gereken aralıklar elde ediliyordu.

İdealde doğru cevapların yalnızca yüzde 2'si bu aralıkların dışında kalmalıydı. Don Moore, Elizabeth Tenney ve Uriel Haran'ın sonradan yaptığı özete göre bu aralıklar doğru cevabı ortalama yalnızca yaklaşık yüzde 60 oranında içerdi; yani “neredeyse kesin” denen aralıklar her on sorudan yaklaşık dördünde ıskaladı. Yazarlara göre bu gösterim o günden bu yana yüzlerce kez tekrarlandı: bir gruptan on soru için yüzde 90'lık aralık istediğinizde tipik isabet oranı yüzde 30 ile 60 arasında çıkıyor. Hatta yüzde 98'lik aralıklar bazen yüzde 50'lik aralıklardan pek de geniş olmuyor.

Aşırı güvenin üç yüzü

“Aşırı güven” gündelik dilde tek bir şey gibi kullanılır ama Don Moore ve Paul Healy 2008'de Psychological Review'da bunun aslında üç ayrı olgu olduğunu savundu. Birincisi, kendi performansını olduğundan iyi sanmak (örneğin sınavda gerçekte olduğundan çok soru yaptığını düşünmek). İkincisi, kendini başkalarından iyi sanmak (sürücülerin çoğunun kendini ortalamanın üstünde görmesi gibi). Üçüncüsü ise bildiğinden fazla emin olmak, yani tahminlerinin etrafındaki belirsizliği küçümsemek: aşırı kesinlik.

Bu deney üçüncüsünü ölçüyor ve bunun iyi bir nedeni var. İlk iki tür koşullara göre tersine dönebiliyor: insanlar kolay görevlerde kendi performansını küçümseyebiliyor, zor görevlerde ise kendini başkalarından geride sanabiliyor. Moore ve arkadaşlarının derlemesine göre ise aşırı kesinliğin tersine döndüğü belgelenmiş vaka ya hiç yok ya da çok az. Kısacası, aralık çizme görevinde neredeyse herkes, neredeyse her koşulda aralıklarını gerekenden dar çiziyor.

Aralıklarımız neden bu kadar dar?

Jack Soll ve Joshua Klayman 2004'te yaptıkları deneylerde, insanların aralıklarının bazen iyi kalibre olmak için gereken genişliğin yalnızca yüzde 40'ı kadar olduğunu gösterdi. Aynı çalışmada aşırı kesinliğin miktarı, sorunun alanına ve aralığın nasıl sorulduğuna göre belirgin biçimde değişti. Bir açıklama çapalama ve ayarlamadır: önce akla bir “en iyi tahmin” gelir, sonra alt ve üst sınır bu noktadan biraz uzaklaştırılarak bulunur. Uzaklaşma genellikle yetersiz kalır.

İkinci bir açıklama, akla gelmeyen senaryoların yokmuş gibi davranılmasıdır. Ağrı Dağı'nı düşünürken aklına gelen bir iki ipucu sana tutarlı bir hikâye anlatır ve o hikâyenin yanlış olabileceği yollar görünmez kalır. Araştırmalar, yüksek ve düşük değerleri ayrı ayrı düşünmenin aralıkları genişlettiğini ve aşırı kesinliği azalttığını gösteriyor. Sarah Lichtenstein, Baruch Fischhoff ve Lawrence Phillips'in 1982'deki kapsamlı derlemesi de güven yargılarındaki aşırı iddiacılığın pek çok grupta görüldüğünü, buna karşın hava durumu tahmincileri gibi düzenli ve hızlı geri bildirim alan bazı uzmanların oldukça iyi kalibre olabildiğini ortaya koyar.

Gündelik hayatta: süreler, bütçeler, tahminler

Aşırı kesinlik laboratuvarla sınırlı değil. Bir işin ne kadar süreceğini, bir tadilatın kaça mal olacağını ya da bir yatırımın ne getireceğini tahmin ederken çoğumuz tek bir sayı söyleriz ve o sayının etrafındaki belirsizliği küçümseriz. “En kötü ihtimalle iki hafta” dediğimiz işin bir ay sürmesi, aralığımızın gerçekte ne kadar dar olduğunun gündelik bir kanıtıdır.

Bu yüzden iyi tahminciler tek bir sayı yerine aralıklarla düşünür ve kendi geçmiş tahminlerinin ne sıklıkla tuttuğunu takip eder. Kendi isabet oranını bilmek, “yüzde 90 eminim” cümlesine gerçek bir anlam kazandırır. Bu deneydeki ara sonuç ekranı da tam olarak bunun küçük bir provası: aralıklarının kaçının tuttuğunu görmek, bir sonraki tahminini nasıl verdiğini değiştirebilir mi?

Geri bildirim işe yarar mı?

Moore, Tenney ve Haran'ın derlemesine göre geri bildirim bazı durumlarda aşırı güveni azaltabiliyor ama bu etki evrensel değil; olumlu etki en çok ilk tahminden sonra görülüyor ve sonrasında kaybolabiliyor. Bizim ikinci elimiz tam da bunu soruyor: ilk beş soruda kaç aralığın tuttuğunu gördükten sonra aralıklarını genişletiyor musun ve bu isabetini gerçekten yükseltiyor mu?

Daha kalıcı bir çözüm, soruyu sorma biçimini değiştirmek olabilir. Uriel Haran, Don Moore ve Carey Morewedge 2010'da SPIES adını verdikleri bir yöntem denedi: kişiden tek bir aralık yerine, olası değerleri birkaç dilime bölüp her dilime bir olasılık vermesi istendi. Bir sıcaklık tahmini görevinde klasik yüzde 90'lık aralıklar doğru cevabı yaklaşık yüzde 74 oranında içerirken, SPIES'tan türetilen aralıklar yaklaşık yüzde 88 oranında içerdi. Yani sorun yalnızca bilgisizlikte değil, belirsizliği ifade etmek için kullandığımız araçta da yatıyor.

Sık sorulanlar

Kalibrasyon ne demek?

Verdiğin güven düzeyiyle gerçek isabet oranının örtüşmesidir. Yüzde 90 emin olduğunu söylediğin aralıkların yaklaşık yüzde 90'ı doğru cevabı içeriyorsa iyi kalibre sayılırsın. Bu, ne kadar bildiğinden bağımsızdır.

On sorudan kaçını tutturmam gerekir?

İdeal olarak yaklaşık dokuzunu. On sorunun hepsini yakalamak da tam isabet değildir; aralıklarının gereğinden geniş olduğuna işaret edebilir. Ama araştırmalarda çok daha sık görülen sorun, aralıkların dar kalmasıdır.

İnsanlar bu testte genellikle ne kadar başarılı?

Moore, Tenney ve Haran'ın derlemesine göre on soru için yüzde 90'lık aralık istendiğinde tipik isabet oranı yüzde 30 ile 60 arasındadır. Alpert ve Raiffa'nın öğrencilerinin yüzde 98'lik aralıkları doğru cevabı ortalama yaklaşık yüzde 60 oranında içeriyordu.

Çok geniş aralıklar verip hepsini tutturursam?

İsabet oranın yüzde 100 olur ama bu da kalibrasyondan sapmadır. Ayrıca çok geniş bir aralık bilgi taşımaz: “0 ile 1 milyon arası” demek, hiçbir şey söylememek gibidir. Puanlamada eşitlik durumunda daha dar aralık vereni öne alıyoruz.

Aşırı kesinliği nasıl azaltabilirim?

Önce alt ve üst sınırı ayrı ayrı düşün: “Cevabın bundan küçük olma ihtimali gerçekten yüzde 5 mi?” diye sor. Olası değerleri dilimlere bölüp her dilime olasılık vermek ve kendi geçmiş tahminlerinin isabetini takip etmek de işe yarayabilir.

Tartışma 0 yorum

Yorum yazmak ve oy vermek için gönüllü ol. 20 saniye sürer.
GirişGönüllü ol
Henüz yorum yok. İlk yazan sen ol.

Bu deney hakkında konular

Yeni konu aç →
Bu deney için açılmış ayrı bir konu yok. Yöntemi eleştirmek, bir makale paylaşmak ya da yeni bir soru sormak için konu açabilirsin.