Açık Yapay zekâ Porter ve Machery, 2024

İnsan mı yazdı, yapay zekâ mı?

Dört şairden sekiz kısa parça. Her biri ya şairin kendisinden ya da onun üslubunda yazan bir yapay zekâdan. Önce ne kadar beğendiğini söyle, sonra tahmin et: insan mı, yapay zekâ mı?

3 dksürer 1katılım Anonimkayıt gerekmez
?
EXP. 063

Yunus Emre’nin, Karacaoğlan’ın, Namık Kemal’in ve Tevfik Fikret’in dizelerini, onların üslubunda yazan bir yapay zekâdan ayırt edebilir misin?

Deney yükleniyor… JavaScript kapalıysa deney çalışmaz; bilim kutusunu ve makaleyi aşağıda okuyabilirsin.

Tekrar oyna, yüksel

Sıralama.

  1. 1B@berke12/8
Sıralamada yalnızca gönüllüler görünür. Anonim oynayışların, gönüllü olunca hesabına bağlanır.Gönüllü ol doğru tahmin · her kişinin en iyi oynayışı sayılır · “Bugün” her gece yarısı (İstanbul) sıfırlanır
Önce deneye katıl.

Bilimi okumak cevabını etkileyebilir. Katıldıktan sonra her şey açılır; istersen yine de şimdi okuyabilirsin.

Deneye dön
Bilim kutusu

Şiir okurlarının çoğu, yapay zekânın bir şairin üslubunda yazdığı dizeleri şairin kendi dizelerinden ayırt edemiyor; hatta yapay zekâ şiirlerini daha çok beğenip daha sık “insan yazmış” diyor.

Ne ölçüyoruz

Brian Porter ve Édouard Machery’nin (2024) “insan mı, yapay zekâ mı?” deneyini Türkçe ve İngilizce şiirle tekrarlıyoruz. Dört şairin her birinden iki kısa parça görüyorsun: Türkçede Yunus Emre, Karacaoğlan, Namık Kemal ve Tevfik Fikret; İngilizcede Shakespeare, Keats, Whitman ve Dickinson. Havuzda her şair için iki gerçek parça ve iki yapay zekâ parçası var; sana hangilerinin geleceğini oyunun tohumu belirliyor, yani bir şairin iki parçasının ikisi de insan, ikisi de yapay zekâ ya da biri insan biri yapay zekâ olabilir. İnsan parçaları yalnızca 1929’dan önce yayımlanmış ve kamu malı olan eserlerden; yapay zekâ parçalarını bu deney için bir yapay zekâ modeli (Claude, Anthropic) her şairin üslubunda yazdı ve hepsini sonuç ekranındaki çözümde açıklıyoruz. Her parça için önce ne kadar beğendiğini 1–5 arasında söylüyor, sonra “insan” ya da “yapay zekâ” diye tahmin ediyorsun. Puanın, sekiz tahminden doğru olanların sayısı; şans düzeyi 4.

Araştırmalar ne diyor

Porter ve Machery (2024), 1.634 katılımcıya on İngilizce şairden birinin beş şiirini ve ChatGPT-3.5’in aynı şairin üslubunda yazdığı beş şiiri gösterdi. Katılımcıların doğruluğu %46,6 ile şans düzeyinin (%50) biraz altındaydı; yapay zekâ şiirlerine “insan yazdı” deme olasılıkları, gerçek şairlerin şiirlerine göre daha yüksekti. İkinci çalışmada 696 katılımcı şiirleri 14 nitelik üzerinden puanladı: yapay zekâ şiirleri ritim ve güzellik gibi niteliklerde daha yüksek puan aldı; ama aynı şiir “yapay zekâ yazdı” denerek gösterildiğinde puanlar düştü. Köbis ve Mossink (2021), daha eski bir model olan GPT-2 ile yazılmış şiirlerde insanların, şiirler rastgele seçildiğinde yapay zekâyı ayırt edebildiğini ama bir insanın en iyi şiiri seçtiği durumda ayırt edemediğini bulmuştu.

Neden böyle

Porter ve Machery’ye göre okurlar ortak ama hatalı bir kural kullanıyor: anlaşılması kolay, ahenkli ve duyguyu doğrudan söyleyen şiiri insana, karmaşık ve anlaşılması zor şiiri yapay zekâya yakıştırıyorlar. Oysa yapay zekâ şiirleri çoğu zaman daha erişilebilir, gerçek şairlerin şiirleri ise daha katmanlı. Sonuçta okurlar kendi beğenilerini insan yazdığına dair bir kanıt gibi okuyor. Onların veri setinde yapay zekâ şiirlerinin %89’u uyaklıydı, insan şiirlerinin yalnızca %40’ı; yani “yapay zekâ uyak yapamaz” gibi kurallar da yanıltıcı. Bu deneyde beğeniyi tahminden önce sorarak beğeni ile “insan” deme arasındaki ilişkiye bakıyoruz.

Sınırlılık

Parçalar kısa (dört dize kadar) ve bütün şiirler değil; Porter ve Machery bütün şiirler kullandı. Yapay zekâ parçalarını tek bir model yazdı ve onları biz seçtik; yani yapay zekâ parçalarının kalitesi, bizim yazdırma ve seçme kararlarımıza bağlı. İnsan parçaları ünlü şairlerden; bir parçayı tanıyorsan tahminin kolaylaşır. Eski Türkçe metinler kaynaktaki yazımla verildi; aruz ve hece ölçüsüne aşina okurlar biçimden ipucu yakalayabilir, bu yüzden Türkçe ve İngilizce sonuçlar doğrudan karşılaştırılamayabilir. Puan, sekiz parçalık küçük bir örneklem; kişisel bir yetenek ölçüsü olarak okunmamalı. Bu laboratuvar bir yapay zekâ stüdyosunun parçası; deneyi, yapay zekânın ne yapabildiğini ve okurların onu nasıl algıladığını açıkça göstermek için tasarladık.

%46,6Yapay zekâ şiirlerini insan şiirlerinden ayırt etme doğruluğu (1.634 katılımcı)Porter ve Machery, 2024
%50Şans düzeyiPorter ve Machery, 2024
yapay zekâ şiirleriRitim ve güzellik gibi niteliklerde daha yüksek puan alanPorter ve Machery, 2024
düştü“Yapay zekâ yazdı” denince aynı şiire verilen puanPorter ve Machery, 2024
  1. Porter, B., & Machery, E. (2024). AI-generated poetry is indistinguishable from human-written poetry and is rated more favorably. Scientific Reports, 14, 26133. Kaynağa git ↗
  2. Köbis, N., & Mossink, L. D. (2021). Artificial intelligence versus Maya Angelou: Experimental evidence that people cannot differentiate AI-generated from human-written poetry. Computers in Human Behavior, 114, 106553. Kaynağa git ↗

Bir şiirin yazarını dizelerden bilebilir misin?

Yunus Emre’nin sadeliği, Karacaoğlan’ın türküleri, Namık Kemal’in coşkusu, Tevfik Fikret’in hüznü: bu şairlerin sesleri o kadar tanıdık ki, bir dizeyi duyunca kime ait olduğunu bildiğimizi düşünürüz. Peki bir yapay zekâ aynı sesi taklit ederse ne olur?

Bu deneyde dört şairin her birinden iki kısa parça okuyorsun. Her parça ya şairin kendi eserinden ya da onun üslubunda yazan bir yapay zekâdan. Önce parçayı ne kadar beğendiğini söylüyor, sonra kimin yazdığını tahmin ediyorsun. Sonuç ekranında bütün parçaların kaynaklarını ve kalabalığın en çok hangi parçada yanıldığını görebilirsin.

Porter ve Machery’nin deneyi

Brian Porter ve Édouard Machery (2024), Chaucer’dan Dorothea Lasky’ye on İngilizce şairin her birinden beş şiir topladı ve ChatGPT-3.5’ten her şairin üslubunda beş şiir yazmasını istedi. Yapay zekânın ilk yazdığı beş şiiri olduğu gibi kullandılar; en iyilerini seçmediler. 1.634 katılımcının her biri bir şairin beş gerçek ve beş yapay zekâ şiirini okuyup her birinin kimin elinden çıktığını tahmin etti.

Doğruluk %46,6’ydı: şans düzeyinin biraz altında. Daha da çarpıcısı, katılımcılar yapay zekâ şiirlerine gerçek şiirlerden daha sık “insan yazdı” diyordu. “İnsan” denme oranı en düşük beş şiirin beşi de gerçek şairlere aitti; en yüksek beş şiirin dördü yapay zekâ yazımıydı.

Daha çok beğeniyoruz ama bilince küçümsüyoruz

İkinci çalışmada 696 katılımcı aynı şiirleri ritim, imge, güzellik, anlam gibi 14 nitelik üzerinden puanladı. Yapay zekâ şiirleri bu niteliklerin çoğunda gerçek şiirlerden daha yüksek puan aldı. Ama katılımcılara bir şiirin yapay zekâ tarafından yazıldığı söylendiğinde, aynı şiire verilen puanlar düştü.

Yazarlar bunu şöyle açıklıyor: uzman olmayan okurlar, duyguyu ve fikri daha doğrudan ve anlaşılır biçimde söyleyen yapay zekâ şiirlerini daha çok beğeniyor; ama yapay zekâ şiirinin kötü olacağını bekliyorlar. Bu yüzden beğendikleri şiiri insanın yazdığını düşünüyor, anlamakta zorlandıkları karmaşık şiirleri ise yapay zekâya yakıştırıyorlar.

Eski modeller, yeni modeller

Birkaç yıl önce tablo farklıydı. Köbis ve Mossink (2021), GPT-2 ile yazılmış şiirleri gerçek şiirlerle karşılaştırdı. Yapay zekânın yazdıkları arasından rastgele bir şiir seçildiğinde katılımcılar onu ayırt edebiliyordu; ama bir insan en iyi şiiri seçtiğinde ayırt edemiyordu. Katılımcılar ayrıca yapay zekâ şiirlerine karşı hafif bir isteksizlik gösteriyordu.

Porter ve Machery’nin sonuçları, daha yeni bir modelle, insanın seçim yapmadığı durumda bile ayrımın kaybolduğunu gösteriyor. Bu deneyde kullandığımız yapay zekâ parçaları ise bir yapay zekâ modeline (Claude, Anthropic) yazdırıldı ve bizim tarafımızdan seçildi; yani “insanın döngüde olduğu” koşula daha yakın.

Neden bir yapay zekâ stüdyosu bu deneyi yapıyor?

ba creative labs bir yapay zekâ stüdyosu ve bu laboratuvar onun vitrini. Yapay zekânın neler yapabildiğini göstermenin en dürüst yolu, insanlara kendileri sınayabilecekleri bir deney sunmak ve sonra her şeyi açıklamak. Bu yüzden yapay zekâ parçalarının hepsini çözüm bölümünde işaretliyoruz ve gerçek parçaların kaynaklarını veriyoruz.

Sonuç ne çıkarsa çıksın, bir şey değişmiyor: Yunus Emre’nin “Bu can gövdeye konuktur” dizesi yedi yüz yıllık bir hayatın ve bir dünya görüşünün ürünü. Yapay zekâ onun sesini taklit edebilir; ama taklit edebilmesi, o sesin değerini azaltmıyor. Belki de asıl soru “ayırt edebilir miyiz?” değil, “ayırt etmek bizim için neden önemli?”

Sık sorulanlar

İnsan parçaları nereden geliyor?

Yalnızca 1929’dan önce yayımlanmış ve kamu malı olan eserlerden: Yunus Emre, Karacaoğlan, Namık Kemal ve Tevfik Fikret’in şiirleri Vikikaynak’taki metinlerden; Shakespeare, Keats, Whitman ve Dickinson’ın şiirleri Project Gutenberg’deki basımlardan. Kaynakların hepsi sonuç ekranındaki çözümde bağlantılarıyla duruyor.

Yapay zekâ parçalarını kim yazdı?

Bu deney için bir yapay zekâ modeli (Claude, Anthropic) her şairin üslubunda yazdı. Hiçbiri şairlerin gerçek dizelerinden kopyalanmadı. Sonuç ekranında hangi parçaların yapay zekâya ait olduğunu tek tek gösteriyoruz.

Puanım nasıl hesaplanıyor?

Sekiz tahminden doğru olanların sayısı: en az 0, en çok 8. Yazı-tura atan biri ortalama 4 tutturur. Beğeni puanların puanı etkilemez ama kalabalık sonucunda beğeni ile “insan” deme arasındaki ilişkiyi gösteriyoruz.

Her şairin iki parçasından biri mi yapay zekâ?

Hayır. Her şairin iki parçası havuzdan rastgele seçilir: ikisi de şairden, ikisi de yapay zekâdan ya da biri şairden biri yapay zekâdan olabilir. Yani bir parçaya verdiğin cevaptan öbürünü çıkaramazsın.

Bu sonuç, yapay zekânın şairler kadar iyi olduğu anlamına mı gelir?

Hayır. Kısa bir parçada kimin yazdığını ayırt edememek, iki metnin aynı değerde olduğunu göstermez. Porter ve Machery’nin katılımcıları çoğunlukla şiir okumayan kişilerdi ve yazarların açıklamasına göre anlaşılır olanı insana, karmaşık olanı yapay zekâya yakıştırıyorlardı.

Tartışma 0 yorum

Tartışmaya katılOkumak serbest. Yorum yazmak ve oy vermek için gönüllü ol; 20 saniye sürer.
Henüz yorum yok.İlk yazan sen ol; iyi bir soru tartışmayı başlatır.

Bu deney hakkında konular

Yeni konu aç →
Bu deney için açılmış ayrı bir konu yok. Yöntemi eleştirmek, bir makale paylaşmak ya da yeni bir soru sormak için konu açabilirsin.