MIT News
Bilim · 2 sa önce · 3 dk okuma
Gizli bilgili oyunlarda insan şampiyonları geçen yapay zekâ

MIT, Carnegie Mellon Üniversitesi, New York Üniversitesi ve Stanford Üniversitesi’nden araştırmacıların geliştirdiği bir yapay zekâ sistemi, masa oyunu Stratego’nun dünyanın en iyi insan oyuncularını büyük farkla yendi. Gizli bilgilere dayalı zorlu oyunlarda üstün başarı gösteren sistem, gelecekte askeri manevralardan iş görüşmelerine ve siber güvenliğe kadar, tarafların birbirlerinin elindeki bilgileri bilmediği durumlarda insanlara strateji seçmede yardımcı olabilir. Araştırma Nature dergisinde yayımlandı.
Stratego, satranç benzeri bir savaş oyunudur. İki oyuncu tahtanın kendi tarafında 40’ar taş dizer ve rakibin bayrağını ele geçirmek için taşlarını hareket ettirir. Taşların kimliği karşılaşana kadar gizlidir; karşılaşma olduğunda rütbesi düşük olan taş elenir. Bu belirsizlik oyunu son derece karmaşık kılar: Taşların olası dizilişlerinin sayısı 10 üzeri 66’yı aşar; bu, satrançtaki olasılık sayısından katbekat fazladır. Bu nedenle Stratego, yapay zekânın stratejik düşünme yeteneğini sınamak için kullanılan önemli bir ölçüttür.
Araştırma ekibinin geliştirdiği Ataraxos, adını kaygısız ya da sarsılmaz kişiyi anlatan Yunanca bir sözcükten alıyor. Önceki sistemler, örneğin DeepMind’ın DeepNash’i, yüksek hesaplama gücü gerektiren ve eğitim maliyeti ağır yöntemlere dayanıyordu. Milyonlarca dolarlık eğitim harcamalarına rağmen bu modeller dünyanın en iyi Stratego oyuncularını yenememişti. Araştırmacılar, Ataraxos’u daha düşük maliyetle insanüstü performansa ulaştırmak için verimli eğitim algoritmalarını, gizli bilginin bulunduğu durumlarda karar vermeye yönelik yeni tekniklerle birleştirdi.
Sistem, kendi kendine oynayarak öğrenen pekiştirmeli öğrenme yöntemiyle eğitildi. Ataraxos çok sayıda oyun boyunca kendisiyle mücadele ederek Stratego’da başarılı olmaya yönelik bir temel strateji geliştirdi. Araştırmacıların tasarladığı algoritmalar, sistemin önceki yöntemlerden daha hızlı öğrenmesini sağladı; ayrıca onu her olası hamleyi tek tek tahmin etmeye çalışırken çıkmaza girmekten korudu. Gabriele Farina’ya göre Ataraxos, DeepNash’ten daha güçlü bir oyun düzeyine ulaşırken eğitim örneklerinin yüzde birinden, kendi kendine oynanan oyunların ise yüzde üçünün altından daha azını kullandı.
Ataraxos oyun sırasında temel stratejisini tahtayı kurmak ve her turda ilk hamle seçeneklerini belirlemek için kullanıyor. Ancak hamle yapmadan önce karar anında planlama adı verilen bir yöntemle seçeneklerini yeniden değerlendiriyor. Üretici bir model, rakibin gizli taşlarının kimliğine ilişkin olasılık tahminleri oluşturuyor; sistem de bu tahminlerden yararlanarak gelecekteki olası hamleleri inceliyor. Böylece gelişigüzel tahmin yürütmek yerine karşılaştığı tahta ve rakip için en olası durumlara odaklanabiliyor. Farina, bu üretici modelin karar anında planlamayla kullanılmasının, Ataraxos’un insanüstü başarıya ulaşmasını sağlayan eksik parçayı tamamladığını belirtiyor.
Sonuçlar dikkat çekici: Ataraxos, dünyanın en güçlü Stratego oyuncusunu 15-1-4’lük skorla rekor farkla yendi; Stratego dünya şampiyonasındaki üst düzey insan oyuncularına karşı da 39-2’lik sonuç elde etti. Farina, sistemin riski insanlardan farklı biçimde hesaplayabildiğini söylüyor. İnsan oyuncu en değerli taşı açıkta kaldığında paniğe kapılıp aşırı tepki verebilir; bot ise soğukkanlı kalıp kendi planını ele verecek hamlelerden kaçınabiliyor.
Araştırmacılar yöntemi başka eksik bilgili oyunlara da uyarladı: Daha az taşla oynanan hızlı Stratego türü Barrage Stratego’ya, çok oyunculu ve işbirliğine dayalı Hanabi’ye, ayrıca iki oyuncunun üçüncü bir oyuncuya karşı birlikte mücadele ettiği Dou dizhu’ya. Ataraxos bu oyunların her birinde de insanüstü performans gösterdi. Bu sonuç, yöntemin tek bir oyuna özgü olmadığını ortaya koyuyor.
Gerçek dünyadaki belirsiz durumlarda olasılıkların tümünü sıralayıp incelemek çoğu zaman mümkün değildir; seçenekler çok fazladır. Araştırmacılar bu tür sorunlarda işe yarayabilecek genel amaçlı yapay zekâ algoritmaları geliştirmeyi önemli bir ilerleme olarak görüyor. Bununla birlikte, sistemi gerçek karar süreçlerinde kullanmadan önce kararlarını insanların anlayabileceği biçimde açıklamasını ve denetlenebilmesini sağlamak gerekiyor. Farina, önerilerin uygulanıp uygulanmayacağına son kertede insanların karar vermesi gerektiğini vurguluyor. Ekip, Ataraxos’a açıklanabilirlik ölçütleri eklemeyi planlıyor; bu konuda daha yapılacak çok iş olduğunu da kabul ediyor.
Yapay zekâ ile Türkçeye aktarıldı.
Orijinal yazıyı oku