Open Thinking Frederick, 2005

Sopa ve top.

Yedi kolay görünen soru. Asıl tuzak, kolay görünmeleri.

3 dkto take part 3responses Anonymousno sign-up needed
1.10 TL
EXP. 013

Yedi kısa soruyu cevapla: aklına ilk geleni mi yazacaksın, yoksa bir kez daha mı düşüneceksin?

Loading the experiment… It needs JavaScript to run; you can still read the science box and the article below.

Play again, climb higher

Leaderboard.

  1. No one is on the leaderboard yet. Be the first.
Only volunteers appear on the leaderboard. Your anonymous plays are linked to your account when you volunteer.Volunteer correct · each person’s best play counts · “Today” resets every midnight (Istanbul time)
Take part first.

Reading the science could sway your answer. Everything unlocks once you take part, but you can read it now if you prefer.

Back to the experiment
Science box

Yanlış cevap hızlı ve kendinden emin gelir; doğrusu için bir saniye durmak gerekir.

What we measure

Bilişsel Refleksiyon Testi (CRT), akla ilk gelen ama yanlış olan cevabı fark edip durdurma eğilimini ölçer. Üç sorunun her birinin cazip bir 'sezgisel' cevabı (10, 100, 24) ve biraz kontrol gerektiren doğru cevabı (5, 5, 47) var. Toplam puanını ve yanlışlarının sezgisel tuzağa düşüp düşmediğini kaydediyoruz. 2. ve 3. ellerde Thomson ve Oppenheimer'ın (2016) CRT-2 adlı alternatif formundaki dört soruyu Türkçeye ve metrik sisteme uyarladık. Bu sorular da cazip bir yanlış cevap sunuyor (birinci, 7, Haziran, 27), ama doğrusu için hesaptan çok dikkat gerekiyor. Yedi sorudaki toplam puanını ve sezgisel tuzağa kaç kez düştüğünü kaydediyoruz.

What the research says

Shane Frederick 2005'te 35 çalışmadaki 3.428 kişinin üç sorudan ortalama 1,24'ünü doğru yanıtladığını ve yalnızca %17'sinin üçünü de bildiğini raporladı; örneklem ortalamaları Toledo Üniversitesi'nde 0,57'den MIT'de 2,18'e uzanıyordu. 118 çalışmada 44.558 kişiyi birleştiren meta-analizde sopa-top sorusunu yaklaşık %32, makine sorusunu %40, nilüfer sorusunu %48 doğru yanıtladı; katılımcıların yaklaşık %38'i hiçbirini bilemedi (Brañas-Garza ve ark., 2019). Toplak, West ve Stanovich (2011), CRT'nin karar yanlılıklarına yatkınlığı zekâ, düşünme eğilimleri ve yürütücü işlev ölçümlerinden daha iyi öngördüğünü gösterdi. Thomson ve Oppenheimer'ın (2016) CRT-2 çalışmasında UCLA'dan 143 lisans öğrencisinin dört soruyu doğru yanıtlama oranları sırasıyla %62,9 (yarış), %83,2 (koyunlar), %62,4 (kızın adı) ve %16,1 (çukur) idi; çukur sorusunda öğrencilerin %83,9'u sıfırdan farklı bir sayı yazdı. CRT-2 klasik testle güçlü biçimde ilişkiliydi (rs = 0,51), ama sayısal beceriyle ilişkisi belirgin biçimde daha zayıftı (0,31'e karşı 0,58). Amazon Mechanical Turk çalışanlarında klasik sorulardan en az birini daha önce görenlerin oranı %63-94 iken, CRT-2 için bu oran %17-29'du.

Why it happens

İkili süreç kuramlarına göre zihnimizde hızlı, otomatik ve zahmetsiz bir işleyiş (Sistem 1) ile yavaş, kontrollü ve emek isteyen bir işleyiş (Sistem 2) birlikte çalışır. Bu sorular Sistem 1'e hazır bir cevap sunar: 110 ile 100 kendiliğinden '100 + 10' diye ayrılır, '5-5-5' kalıbı '100-100-100'ü çağırır, 'yarısı' kelimesi '48'in yarısı'nı. Doğru cevap için önce bu cevabın kontrol edilmesi gerektiğini fark etmek, sonra küçük bir hesap yapmak gerekir. CRT-2 soruları bilerek matematik bilgisi gerektirmeyecek şekilde seçildi: 'ikinciyi geçmek' kendiliğinden 'birinci olmak'ı çağrıştırır, 'Nisan, Mayıs' dizisi 'Haziran'ı getirir, 3 × 3 × 3 hesabı ise çukurun içinin boş olduğunu unutturur. Böylece puan, hesap becerisinden çok akla gelen cevabı kontrol etme alışkanlığını yansıtır.

Limitations

Bu sorular çok ünlü: daha önce gördüysen puanın büyük olasılıkla yükselir. Süresi, dikkati ve ortamı kontrol edilmeyen tek seferlik üç soruluk bir test kişisel bir 'zekâ' ölçümü değildir; sonuçları yalnızca kalabalıkla eğlenceli bir karşılaştırma olarak oku. CRT-2 soruları internette dolaşan şaşırtmacalardan derlendi ve Türkçe uyarlamalar ayrı bir geçerlik çalışmasıyla sınanmadı. Soru başına 60 saniyelik süre sınırı da orijinal çalışmalarda yoktu; puanını literatürle karşılaştırırken bunu hesaba kat.

1,24Ortalama CRT puanı (3 üzerinden, 3.428 kişi)Frederick, 2005
%17Üç soruyu da doğru yanıtlayanlarFrederick, 2005
~%32 / %40 / %48Doğru yanıt oranı: sopa-top / makine / nilüfer (44.558 kişi)Brañas-Garza, Kujal & Lenkei, 2019
~%38Hiçbir soruyu bilemeyenler (meta-analiz)Brañas-Garza, Kujal & Lenkei, 2019
  1. Frederick, S. (2005). Cognitive reflection and decision making. Journal of Economic Perspectives, 19(4), 25–42. View source ↗
  2. Toplak, M. E., West, R. F., & Stanovich, K. E. (2011). The Cognitive Reflection Test as a predictor of performance on heuristics-and-biases tasks. Memory & Cognition, 39(7), 1275–1289. View source ↗
  3. Brañas-Garza, P., Kujal, P., & Lenkei, B. (2019). Cognitive reflection test: Whom, how, when. Journal of Behavioral and Experimental Economics, 82, 101455. View source ↗
  4. Haigh, M. (2016). Has the standard Cognitive Reflection Test become a victim of its own success? Advances in Cognitive Psychology, 12(3), 145–149. View source ↗
  5. Bialek, M., & Pennycook, G. (2018). The cognitive reflection test is robust to multiple exposures. Behavior Research Methods, 50(5), 1953–1959. View source ↗
  6. Stagnaro, M. N., Pennycook, G., & Rand, D. G. (2018). Performance on the Cognitive Reflection Test is stable across time. Judgment and Decision Making, 13(3), 260–267. View source ↗
  7. Thomson, K. S., & Oppenheimer, D. M. (2016). Investigating an alternate form of the cognitive reflection test. Judgment and Decision Making, 11(1), 99–113. View source ↗

Dünyanın en kısa zekâ testi mi?

2005'te davranışsal iktisatçı Shane Frederick, Journal of Economic Perspectives'te yalnızca üç sorudan oluşan bir test yayımladı: Bilişsel Refleksiyon Testi, kısaca CRT. Soruların hiçbiri ileri matematik gerektirmiyor; zorlukları, akla hemen gelen ve kulağa doğru gelen bir cevap sunmalarından kaynaklanıyor. Orijinal sorular dolar ve sent üzerineydi; biz ilk soruyu Türk lirasına uyarladık. Sopa ve top birlikte 110 TL ise ve sopa toptan 100 TL pahalıysa, akla gelen cevap 10 TL'dir. Ama o zaman sopa 110 TL, toplam 120 TL olurdu. Doğrusu 5 TL: sopa 105, top 5.

Diğer iki soru da aynı mantıkla çalışır. 5 makine 5 parçayı 5 dakikada üretiyorsa, her makine bir parçayı 5 dakikada üretiyor demektir; 100 makine 100 parçayı yine 5 dakikada bitirir, 100 dakikada değil. Göldeki nilüferler her gün iki katına çıkıyor ve gölü 48 günde kaplıyorsa, bir gün önce gölün yarısı doluydu: cevap 24 değil, 47.

Sistem 1, Sistem 2

Frederick testi, psikolojide yaygın olan ikili süreç yaklaşımına dayandırdı. Keith Stanovich ve Richard West'in adlandırmasıyla Sistem 1 hızlı, otomatik ve sezgiseldir; Sistem 2 ise yavaş, bilinçli ve çaba isteyen düşünmedir. Daniel Kahneman'ın 'Hızlı ve Yavaş Düşünme' kitabı bu terimleri geniş kitlelere taşıdı ve sopa-top sorusunu kitabın en bilinen örneklerinden biri yaptı.

CRT'nin asıl ilginç yanı yanlış cevapların dağılımı: yanlış yapanların büyük kısmı rastgele bir sayı değil, tam olarak sezgisel cevabı yazar. Yani insanlar hesap yapamadığı için değil, hesap yapma gereğini fark etmediği için yanılıyor. Frederick'in verilerinde en yüksek ortalamaya sahip MIT öğrencilerinin bile yalnızca yaklaşık yarısı üç soruyu da doğru yanıtlamıştı.

Puanın neyi öngörüyor?

Frederick, yüksek CRT puanı alanların zamanla ilgili seçimlerde daha sabırlı davrandığını ve kumar benzeri seçimlerde farklı risk tercihleri gösterdiğini raporladı. Toplak, West ve Stanovich'in 2011'deki çalışması, CRT'nin geniş bir klasik karar yanlılığı görevleri setindeki performansı; zekâ testlerinin, düşünme eğilimi ölçeklerinin ve yürütücü işlev testlerinin ötesinde açıkladığını buldu. Yazarlara göre CRT, 'zihinsel cimrilik' denen eğilimi, yani zahmetli düşünmeden kaçınma alışkanlığını yakalıyor.

Puanlar zaman içinde de oldukça tutarlı. Stagnaro, Pennycook ve Rand'in 2018'de birleştirdiği 11 çevrimiçi çalışmada testi birden fazla kez çözen 3.302 kişinin ilk ve son puanları arasındaki korelasyon r = 0,81'di; aralarında iki yıldan fazla zaman olan ölçümlerde bile r = 0,76 civarındaydı.

Tartışma 1: herkes bu soruları biliyor mu?

CRT'nin şöhreti kendi sorununu yarattı. Haigh'in 2016'daki çevrimiçi çalışmasında 142 katılımcının %51,4'ü sorulardan en az birini daha önce görmüştü ve bu grubun ortalaması 2,36 iken soruları ilk kez görenlerinki 1,48'di. Belirli bir soruyu daha önce görenler o soruyu neredeyse her zaman doğru yanıtlıyordu.

Ama puanların yükselmesi testin işe yaramadığı anlamına gelmiyor. Bialek ve Pennycook'un yaklaşık 2.500 kişilik altı çalışmasında, daha önce görenlerin puanı yükselse de CRT'nin dindarlık, sezgisel yanlılıklar ve sayısal beceri gibi 17 değişkeni öngörme gücü anlamlı biçimde azalmadı. Yazarların yorumuna göre sezgisel düşünenler, aynı 'kolay' soruyla tekrar karşılaşmanın sorunun aslında zor olduğuna işaret ettiğini fark etmiyor. Yine de araştırmacılar artık genellikle yeni, daha az bilinen sorular ekleyerek ya da önceki deneyimi sorarak çalışıyor.

Tartışma 2: cinsiyet ve matematik

Frederick'ten bu yana birçok çalışma, erkeklerin CRT'de ortalama olarak daha yüksek puan aldığını bildirdi; 44.558 kişilik meta-analiz de bu farkın üç soruda da tutarlı olduğunu buldu. Bu fark kolayca yanlış yorumlanabilir. CRT soruları sayısal sorular olduğu için puanlar matematik eğitimi, matematik kaygısı ve özgüvenle de ilişkili; fark 'düşünme kapasitesi' hakkında doğrudan bir hüküm değildir ve gruplar arasında büyük örtüşme vardır. Aynı meta-analiz parasal ödülün performansı değiştirmediğini, öğrencilerin öğrenci olmayanlardan, testi deneyin başında çözenlerin sonunda çözenlerden daha yüksek puan aldığını da gösterdi.

Kısacası CRT, iyi kurulmuş ama sınırları olan bir araç. Bir kişinin değerini değil, belirli bir anda 'dur, bir kontrol edeyim' deme alışkanlığını yokluyor.

Hesap istemeyen dört yeni tuzak

CRT'nin ünlenmesi iki soruna yol açtı: sorular fazla bilinir oldu ve puanlar matematik becerisiyle fazlasıyla iç içe geçti. Keela Thomson ve Daniel Oppenheimer 2016'da Judgment and Decision Making'de bu iki soruna yanıt olarak CRT-2'yi önerdi: internetteki şaşırtmacalardan seçilmiş, yapı olarak CRT'ye benzeyen ama neredeyse hiç hesap gerektirmeyen dört soru. Bir yarışta ikinciyi geçen kaçıncı olur? Birinci değil, ikinci. 15 koyundan 8'i hariç hepsi ölürse kaç koyun kalır? 7 değil, 8. Orijinal üçüncü soru Emily'nin babasının April ve May adlı kızlarını sorar; biz bunu Türkçede de işleyecek biçimde 'Ayşe'nin babası, Nisan ve Mayıs' olarak uyarladık: cevap Haziran değil, Ayşe. Son soru 3 m × 3 m × 3 m'lik bir çukurdaki toprağı soruyor: 27 değil, sıfır; çukurun içi boştur.

Sonuçlar bu tasarımın işe yaradığını düşündürüyor. Amazon Mechanical Turk çalışanları arasında klasik CRT sorularından en az birini daha önce görmüş olanlar örnekleme göre %63 ile %94 arasındayken, CRT-2 için bu oran %17 ile %29 arasında kaldı. UCLA'daki 143 lisans öğrencisiyle yapılan ikinci çalışmada CRT-2 klasik CRT ile güçlü biçimde ilişkiliydi, ama sayısal beceriyle ilişkisi belirgin olarak daha zayıftı. En zor soru açık ara çukurdu: öğrencilerin yalnızca %16'sı doğru yanıt verdi. Yedi soruluk toplam puanın bu yüzden klasik üç soruya göre hem daha az ezberlenmiş hem de matematikten daha bağımsız bir ölçüm olması bekleniyor.

FAQ

Sopa ve top sorusunun cevabı nedir?

Top 5 TL, sopa 105 TL. Akla gelen 10 TL cevabı yanlıştır, çünkü o durumda sopa 110 TL olur ve toplam 120 TL'ye çıkar.

Bilişsel Refleksiyon Testi neyi ölçer?

Akla ilk gelen sezgisel cevabı sorgulayıp düzeltme eğilimini ölçer. Zekâyla orta düzeyde ilişkilidir ama karar yanlılıklarını zekâ testlerinin ötesinde de öngördüğü bulunmuştur.

CRT'de ortalama puan kaçtır?

Frederick'in 3.428 kişilik verisinde ortalama 3 üzerinden 1,24'tü; büyük bir meta-analizde katılımcıların yaklaşık %18'i üç soruyu da, yaklaşık %38'i hiçbirini doğru yanıtlayamadı.

Soruları daha önce gördüysem sonuç geçersiz mi?

Puanın muhtemelen yükselir, bu yüzden kişisel sonucun daha az bilgilendirici olur. Ancak araştırmalar, testin diğer değişkenleri öngörme gücünün tekrar maruz kalmayla belirgin biçimde bozulmadığını gösteriyor.

Sistem 1 ve Sistem 2 nedir?

Sistem 1 hızlı ve otomatik düşünmeyi, Sistem 2 yavaş ve bilinçli düşünmeyi anlatan bir benzetmedir. Beyinde iki ayrı 'organ' değil, iki farklı işleyiş tarzını tarif eder.

Yeni sorular neden matematik istemiyor, tekrar çözebilir miyim?

CRT-2 soruları, klasik testin sayısal beceriyle fazla iç içe olduğu eleştirisine yanıt olarak seçildi; tuzak hesapta değil, sorunun nasıl okunduğunda. Tekrar çözebilirsin, ama artık doğru cevapları bildiğin için ikinci puanın düşünme alışkanlığından çok hafızanı ölçer.

Discussion 0 comments

Volunteer to comment and vote. It takes 20 seconds.
Log inVolunteer
No comments yet. Be the first.

Threads about this experiment

Start a new thread →
There’s no separate thread for this experiment yet. Start one to critique the method, share a paper or ask a new question.