Dünyanın en kısa zekâ testi mi?
2005'te davranışsal iktisatçı Shane Frederick, Journal of Economic Perspectives'te yalnızca üç sorudan oluşan bir test yayımladı: Bilişsel Refleksiyon Testi, kısaca CRT. Soruların hiçbiri ileri matematik gerektirmiyor; zorlukları, akla hemen gelen ve kulağa doğru gelen bir cevap sunmalarından kaynaklanıyor. Orijinal sorular dolar ve sent üzerineydi; biz ilk soruyu Türk lirasına uyarladık. Sopa ve top birlikte 110 TL ise ve sopa toptan 100 TL pahalıysa, akla gelen cevap 10 TL'dir. Ama o zaman sopa 110 TL, toplam 120 TL olurdu. Doğrusu 5 TL: sopa 105, top 5.
Diğer iki soru da aynı mantıkla çalışır. 5 makine 5 parçayı 5 dakikada üretiyorsa, her makine bir parçayı 5 dakikada üretiyor demektir; 100 makine 100 parçayı yine 5 dakikada bitirir, 100 dakikada değil. Göldeki nilüferler her gün iki katına çıkıyor ve gölü 48 günde kaplıyorsa, bir gün önce gölün yarısı doluydu: cevap 24 değil, 47.
Sistem 1, Sistem 2
Frederick testi, psikolojide yaygın olan ikili süreç yaklaşımına dayandırdı. Keith Stanovich ve Richard West'in adlandırmasıyla Sistem 1 hızlı, otomatik ve sezgiseldir; Sistem 2 ise yavaş, bilinçli ve çaba isteyen düşünmedir. Daniel Kahneman'ın 'Hızlı ve Yavaş Düşünme' kitabı bu terimleri geniş kitlelere taşıdı ve sopa-top sorusunu kitabın en bilinen örneklerinden biri yaptı.
CRT'nin asıl ilginç yanı yanlış cevapların dağılımı: yanlış yapanların büyük kısmı rastgele bir sayı değil, tam olarak sezgisel cevabı yazar. Yani insanlar hesap yapamadığı için değil, hesap yapma gereğini fark etmediği için yanılıyor. Frederick'in verilerinde en yüksek ortalamaya sahip MIT öğrencilerinin bile yalnızca yaklaşık yarısı üç soruyu da doğru yanıtlamıştı.
Puanın neyi öngörüyor?
Frederick, yüksek CRT puanı alanların zamanla ilgili seçimlerde daha sabırlı davrandığını ve kumar benzeri seçimlerde farklı risk tercihleri gösterdiğini raporladı. Toplak, West ve Stanovich'in 2011'deki çalışması, CRT'nin geniş bir klasik karar yanlılığı görevleri setindeki performansı; zekâ testlerinin, düşünme eğilimi ölçeklerinin ve yürütücü işlev testlerinin ötesinde açıkladığını buldu. Yazarlara göre CRT, 'zihinsel cimrilik' denen eğilimi, yani zahmetli düşünmeden kaçınma alışkanlığını yakalıyor.
Puanlar zaman içinde de oldukça tutarlı. Stagnaro, Pennycook ve Rand'in 2018'de birleştirdiği 11 çevrimiçi çalışmada testi birden fazla kez çözen 3.302 kişinin ilk ve son puanları arasındaki korelasyon r = 0,81'di; aralarında iki yıldan fazla zaman olan ölçümlerde bile r = 0,76 civarındaydı.
Tartışma 1: herkes bu soruları biliyor mu?
CRT'nin şöhreti kendi sorununu yarattı. Haigh'in 2016'daki çevrimiçi çalışmasında 142 katılımcının %51,4'ü sorulardan en az birini daha önce görmüştü ve bu grubun ortalaması 2,36 iken soruları ilk kez görenlerinki 1,48'di. Belirli bir soruyu daha önce görenler o soruyu neredeyse her zaman doğru yanıtlıyordu.
Ama puanların yükselmesi testin işe yaramadığı anlamına gelmiyor. Bialek ve Pennycook'un yaklaşık 2.500 kişilik altı çalışmasında, daha önce görenlerin puanı yükselse de CRT'nin dindarlık, sezgisel yanlılıklar ve sayısal beceri gibi 17 değişkeni öngörme gücü anlamlı biçimde azalmadı. Yazarların yorumuna göre sezgisel düşünenler, aynı 'kolay' soruyla tekrar karşılaşmanın sorunun aslında zor olduğuna işaret ettiğini fark etmiyor. Yine de araştırmacılar artık genellikle yeni, daha az bilinen sorular ekleyerek ya da önceki deneyimi sorarak çalışıyor.
Tartışma 2: cinsiyet ve matematik
Frederick'ten bu yana birçok çalışma, erkeklerin CRT'de ortalama olarak daha yüksek puan aldığını bildirdi; 44.558 kişilik meta-analiz de bu farkın üç soruda da tutarlı olduğunu buldu. Bu fark kolayca yanlış yorumlanabilir. CRT soruları sayısal sorular olduğu için puanlar matematik eğitimi, matematik kaygısı ve özgüvenle de ilişkili; fark 'düşünme kapasitesi' hakkında doğrudan bir hüküm değildir ve gruplar arasında büyük örtüşme vardır. Aynı meta-analiz parasal ödülün performansı değiştirmediğini, öğrencilerin öğrenci olmayanlardan, testi deneyin başında çözenlerin sonunda çözenlerden daha yüksek puan aldığını da gösterdi.
Kısacası CRT, iyi kurulmuş ama sınırları olan bir araç. Bir kişinin değerini değil, belirli bir anda 'dur, bir kontrol edeyim' deme alışkanlığını yokluyor.
Hesap istemeyen dört yeni tuzak
CRT'nin ünlenmesi iki soruna yol açtı: sorular fazla bilinir oldu ve puanlar matematik becerisiyle fazlasıyla iç içe geçti. Keela Thomson ve Daniel Oppenheimer 2016'da Judgment and Decision Making'de bu iki soruna yanıt olarak CRT-2'yi önerdi: internetteki şaşırtmacalardan seçilmiş, yapı olarak CRT'ye benzeyen ama neredeyse hiç hesap gerektirmeyen dört soru. Bir yarışta ikinciyi geçen kaçıncı olur? Birinci değil, ikinci. 15 koyundan 8'i hariç hepsi ölürse kaç koyun kalır? 7 değil, 8. Orijinal üçüncü soru Emily'nin babasının April ve May adlı kızlarını sorar; biz bunu Türkçede de işleyecek biçimde 'Ayşe'nin babası, Nisan ve Mayıs' olarak uyarladık: cevap Haziran değil, Ayşe. Son soru 3 m × 3 m × 3 m'lik bir çukurdaki toprağı soruyor: 27 değil, sıfır; çukurun içi boştur.
Sonuçlar bu tasarımın işe yaradığını düşündürüyor. Amazon Mechanical Turk çalışanları arasında klasik CRT sorularından en az birini daha önce görmüş olanlar örnekleme göre %63 ile %94 arasındayken, CRT-2 için bu oran %17 ile %29 arasında kaldı. UCLA'daki 143 lisans öğrencisiyle yapılan ikinci çalışmada CRT-2 klasik CRT ile güçlü biçimde ilişkiliydi, ama sayısal beceriyle ilişkisi belirgin olarak daha zayıftı. En zor soru açık ara çukurdu: öğrencilerin yalnızca %16'sı doğru yanıt verdi. Yedi soruluk toplam puanın bu yüzden klasik üç soruya göre hem daha az ezberlenmiş hem de matematikten daha bağımsız bir ölçüm olması bekleniyor.