Yapay zeka endüstrisinin en büyük vaatlerinden biri olan sistemlerin insan müdahalesi olmadan tamamen kendi kendilerini geliştirmesi (özyinelemeli öz geliştirme), yeni bir akademik çalışmaya göre, öngörülenden çok daha uzak bir gelecekte gerçekleşebilir. Princeton Üniversitesi liderliğinde yürütülen son araştırma, mevcut yapay zeka ajanlarının mühendislik görevlerini başarıyla yerine getirebilmesine rağmen, açık uçlu bilimsel araştırma yürütmek için gereken yaratıcılık, muhakeme ve tat yeteneğinden hâlâ yoksun olduğunu ortaya koydu.
Yeni Araştırma Nasıl Yapıldı ve "Gölge Değerlendirme" Nedir?
Princeton Üniversitesi'nden Peter Kirgis ve Sayash Kapoor öncülüğündeki çok kurumlu araştırma grubu, yapay zeka modellerinin üst düzey araştırma yapma kapasitesini test etmek için "gölge değerlendirme" (shadow evaluation) adı verilen yeni bir yöntem geliştirdi. Bu test kapsamında, Anthropic'in Claude Opus 4.8 modeli; henüz kamuoyuna açıklanmamış, prestijli makine öğrenimi konferansı NeurIPS 2026'ya sunulmuş iki yüksek kaliteli makalenin araştırma sorularını çözmekle görevlendirildi.
Ajanlara bu süreçte altı gün süre, 3.000 dolarlık API kredisi, GPU bütçesi, sanal bilgisayarlar ve internet erişimi sağlandı. Böylece modellerin eğitim verilerinden ezber yapması engellenerek tamamen özgün bilimsel muhakeme yetenekleri sınandı.
Mühendislik Başarısı Var, Bilimsel Yaratıcılık Eksik
Test sonucunda, orijinal makalelerin insan yazarları yapay zeka tarafından üretilen her iki çalışmayı da reddetti. Araştırma bulguları, sürecin teknik ve pratik yönlerinde yapay zekanın gösterdiği performans ile stratejik karar alma aşamasındaki eksikliklerini net bir şekilde gözler önüne serdi:
- Başarılı Olunan Alanlar: Ajanlar literatür taraması yapma, yüzlerce deneyi otomatik olarak yürütme, kod yazma ve sonuçları derleme gibi mühendislik gerektiren görevlerde başarılı oldu.
- Yetersiz Kalınan Alanlar: Modeller; doğru hipotezleri seçme, hangi kanıtların bir soruyu çözüme kavuşturacağını kestirme, anlamsız veya küçük sentetik veri setleriyle zaman kaybetmeme ve alanına özgün, yayımlanabilir nitelikte yenilikçi bir katkı sunma konusunda zayıf kaldı.
Sektörel Yansımalar ve Yapay Zeka Geliştirme Takvimleri
Yapay zeka modellerinin kod yazma, sentetik veri üretme ve çip optimizasyonu gibi dar kapsamlı teknik görevlerdeki hızı, sektörde tam otonom bir öz geliştirme döngüsünün an meselesi olduğu algısını yaratmıştı. Ancak bu yeni çalışma, üst düzey bilimsel araştırma süreçlerinin gerektirdiği yargı, zevk ve açık uçlu problem çözme yeteneklerinin mevcut mimarilerle hemen ikame edilemeyeceğini gösteriyor. Bu durum, yapay zekada eksponansiyel ilerleme vadettiğini öne süren spekülatif takvimlerin somut kanıtlarla yeniden gözden geçirilmesi gerektiğini işaret ediyor.
Sıkça Sorulan Sorular
"Gölge değerlendirme" yöntemi yapay zekanın hangi sınırlarını ortaya çıkarmak için tasarlandı?
Bu yöntem, yapay zekanın sadece önceden bilinen ve net yanıtları olan dar testlerdeki (benchmark) başarısını değil; henüz yayınlanmamış, açık uçlu ve özgün bilimsel muhakeme gerektiren konulardaki stratejik karar alma kapasitesini test etmek için tasarlandı.
Mevcut dil modelleri teknik görevlerde başarılıyken neden üst düzey araştırma makalesi üretemiyor?
Çünkü mühendislik problemleri belirli kurallar çerçevesinde çözülebilirken; bilimsel araştırma yapmak, hangi hipotezin deneneceğini seçmek, ne zaman baştan başlanacağına karar vermek ve yaratıcı bir bakış açısı geliştirmek gibi insan yargısı gerektiren soyut yetenekler talep ediyor.
*Bu haber MIT Tech Review — AI tarafından yayınlanan verilere dayanarak hazırlanmıştır.
💬 Yorumlar
Henüz yorum yok. İlk yorumu sen yap!
Yorum yapmak için giriş yapmalısınız.
🔑 Giriş Yap