Yapay Zekanın İnsan Zekası Seviyesine Ulaşıp Ulaşmadığı Nasıl Kontrol Edilir?

Yapay Zekanın İnsan Zekası Seviyesine Ulaşıp Ulaşmadığı Nasıl Kontrol Edilir?

Yapay Zekanın İnsan Zekası Seviyesine Ulaşıp Ulaşmadığı Nasıl Kontrol Edilir?

OpenAI’nin o3 sohbet robotu, genel yapay zekaya (AGI) doğru ilerlemeyi işaret eden bir testte yüksek bir puan aldı. OpenAI’nin o3’ü yüzde 87,5 puan alarak, bir yapay zeka sistemi için daha önce elde edilen en iyi puan olan yüzde 55,5’i geride bıraktı.

Bu, ‘genel yapay zeka’ yaratma yolunda önemli bir adım. Ancak yapay zekanın bu seviyeye ulaştığını fark etmek çok zor.

Bilim insanlarına göre bu sorunun cevabı şu şekilde formüle edilebilir: Eğer artık normal bir insanın kolayca çözebileceği görevler yaratamıyorsak, ancak yapay zeka bunlarla başa çıkamıyorsa, yapay zekanın neredeyse “genel yapay zeka” seviyesine ulaştığını söyleyebiliriz.

OpenAI’nin o3 sohbet robotu, genel yapay zekaya (AGI) doğru ilerlemeyi işaret eden bir testte yüksek bir puan aldı. OpenAI’nin o3’ü yüzde 87,5 puan alarak, bir yapay zeka sistemi için daha önce elde edilen en iyi puan olan yüzde 55,5’i geride bıraktı.

Bu, ‘genel yapay zeka’ yaratma yolunda önemli bir adım. Ancak yapay zekanın bu seviyeye ulaştığını fark etmek çok zor.

2019’da Yapay Genel Zeka için Soyutlama ve Muhakeme Külliyatı (ARC-AGI) adlı bir test oluşturan yapay zeka araştırmacısı François Chollet, bunun “gerçek bir atılım” olduğunu söylüyor.

Chollet’e göre testten alınan yüksek puan, AGI’nin -genel olarak bir insan kadar iyi akıl yürütebilen, plan yapabilen ve beceri öğrenebilen bir bilgisayar sisteminin- başarıldığı anlamına gelmiyor, ancak o3 “kesinlikle” akıl yürütebiliyor ve “oldukça önemli bir genelleme yeteneğine sahip”.

Araştırmacılar o3’ün Kasım ayında sanal araştırma enstitüsü Epoch AI tarafından duyurulan son derece zor FrontierMath testi de dahil olmak üzere çeşitli testlerdeki (benchmark) performansını övdü. Yapay zeka kıyaslama araştırmacısı David Raine, “Son derece etkileyici” diyor.

Ancak Raine de dahil olmak üzere pek çok kişi ARC-AGI testinin YZ’nin muhakeme ve genelleme yeteneğini gerçekten ölçüp ölçmediğini söylemenin zor olduğu konusunda uyarıyor.

Rein, “Zeka için temel bir şeyi ölçtüğü varsayılan pek çok kıyaslama vardı, ancak durumun böyle olmadığı ortaya çıktı” diyor. Daha iyi testler için arayış devam ediyor” diyor.

OpenAI, o3’ün nasıl çalıştığını açıklamıyor, ancak bu sistem, bir çözüme giden bir dizi adımdan bahsederek sorunları çözmek için “muhakeme zinciri” mantığını kullanan o1 modelinden kısa bir süre sonra piyasaya çıktı.

Bazı uzmanlar, o3’ün çeşitli seçenekler arasından en iyi cevabı seçmeye yardımcı olmak için birkaç farklı düşünce zinciri oluşturabileceğine inanıyor.

Scholle, test sırasında bir cevabı iyileştirmek için daha fazla zaman harcamanın sonuçları önemli ölçüde iyileştirebileceğini söylüyor. Ancak o3 zaten maliyetli: ARC-AGI testindeki her bir görevin üstesinden gelmek için ortalama 14 dakika harcadı ve muhtemelen binlerce dolara mal oldu.

(Scholle, hesaplama maliyetinin OpenAI’nin müşterilerden token veya kelime başına ne kadar ücret aldığına göre tahmin edildiğini ve bunun da güç kullanımı ve donanım maliyetleri dahil olmak üzere çeşitli faktörlere bağlı olduğunu söylüyor).

AGI nedir?
AGI terimi genellikle çok çeşitli görevlerde insan bilişsel yeteneklerine uyan veya bunları aşan bir bilgi işlem sistemini tanımlamak için kullanılsa da, bunun için teknik bir tanım yoktur.

Sonuç olarak, YZ araçlarının ne zaman AGI’ye ulaşabileceği konusunda bir fikir birliği yoktur. Bazıları bu anın çoktan geldiğini söylerken, diğerleri hala uzun bir yol olduğunu söylüyor.

AGI’ye doğru ilerlemeyi izlemek için birçok test geliştirilmektedir. Rein’in 2023 Google-Proof Q&A’sı da dahil olmak üzere bazıları, bir YZ sisteminin doktora düzeyindeki bilimsel problemleri çözme performansını değerlendirmek için tasarlanmıştır.

OpenAI’nin 2024 MLE-bench testi, veri bilimi yarışmaları için çevrimiçi bir platform olan Kaggle’da yayınlanan 75 problemi çözmeye katılan bir AI sistemini içerir. Görevler arasında eski metinleri çevirmek ve aşı geliştirmek gibi gerçek dünya sorunları yer alıyor.

İyi testler birçok sorunu kendi başlarına çözmelidir. Örneğin, yapay zekanın eğitim ve test sırasında aynı soruları görmemesi önemlidir; sorular, yapay zekanın “kestirme yollar” kullanarak test edeni kandıramayacağı şekilde tasarlanmalıdır.

Büyük dil modelleri (LLM’ler) üzerine çalışan Xiang Yue, “LLM’ler gerçek akıl yürütmeye başvurmadan yanıt almak için ince metinsel ipuçlarını kullanmakta ustadır” diyor. Araştırmacı, ideal olarak, testlerin gerçek dünyadaki sorular kadar “dağınık” ve “gürültülü” olması, ancak çözülmesi çok fazla enerji veya zaman gerektirmemesi gerektiğini de sözlerine ekliyor.

Yue, Uzman AGI için Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark (MMMU) adı verilen ve chatbotlardan notları, grafikleri ve bağlantı şemalarını yorumlama gibi üniversite düzeyinde görsel görevleri çözmelerini isteyen bir testin geliştirilmesine öncülük etti. Yue’ye göre, mevcut MMMU rekorunun sahibi yüzde 78,2 ile OpenAI’nin o1’i (o3 puanı bilinmiyor), en yüksek insan puanı ise yüzde 88,6.

ARC-AGI testi ise insanların tipik olarak erken çocukluk döneminde geliştirdikleri temel matematik ve örüntü tanıma becerilerine dayanıyor. Bu testte, deneklere “önce” ve “sonra” yapılarından oluşan bir gösterim seti verilir ve yeni “hakkında” yapısı için “sonra” koşulunu çıkarmaları istenir (“Önce ve Sonra” resmine bakın).

Yükselen performans
Aralık ayında o3, Scholle ve Mike Knoop tarafından kurulan kar amacı gütmeyen ARC Prize Foundation tarafından desteklenen bir yarışma olan 600.000 dolarlık ARC 2024 büyük ödülü için belirlenen %85’lik puanı geçmesine rağmen, çözümün kendisi için maliyet sınırını aştı.

İlginç bir şekilde, insanların basit olarak gördüğü birkaç sorunu çözmekte de başarısız oldu. Scholle, araştırma topluluğundan çözülebilir YZ problemlerini çözülemeyenlerden ayıran şeyin ne olduğunu belirlemeye yardımcı olmalarını istedi.

Mart ayına kadar daha sofistike bir test olan ARC-AGI-2’yi sunacak. İlk deneyler, o3’ün yüzde 30’dan daha az puan aldığını, akıllı bir insanın ise kolayca yüzde 95’ten fazla puan aldığını gösteriyor. Scholle’ye göre, yapay zekanın kısa video oyunlarını kazanma becerisini değerlendirecek olan testin üçüncü bir versiyonu geliştiriliyor.

Raine’e göre, YZ testleri için bir sonraki büyük sınır, YZ sistemlerinin birden fazla karmaşık adım gerektiren ve tek bir doğru cevabı olmayan ortak sorunları çözebilen “aracılar” olarak hareket etme yeteneğini değerlendirmek için kriterler geliştirmektir. Bilim insanı, “Mevcut tüm testler soru-cevap temelli” diyor. – “Ancak bu, insan iletişimi, araştırma ve kendi kendine düşünme gibi pek çok şeyi kapsamıyor.”

Yapay zeka sistemleri geliştikçe, insan ve yapay zeka yetenekleri arasındaki farkı vurgulayan testler geliştirmek giderek zorlaşmaktadır. Bu sorunun kendisi AGI için iyi bir testtir,

Scholle, Aralık ayında ARC Prize Foundation blogunda şöyle yazmıştı: “Sıradan insanlar için basit ama yapay zeka için karmaşık olan görevleri oluşturmak imkansız hale geldiğinde, yapay zekanın zaten burada olduğunu anlayacaksınız.”

Derleyen: Feyza ÇETİNKOL

Kaynak: Yapay Zekanın İnsan Zekası Seviyesine Ulaşıp Ulaşmadığı Nasıl Kontrol Edilir?

Elon Musk’ın Şirketi Neuralink Üçüncü Bir Hastaya Çip Taktı

/Yapay Zekanın İnsan Zekası Seviyesine Ulaşıp Ulaşmadığı Nasıl Kontrol Edilir?/

Bir yanıt yazın

Bu site istenmeyenleri azaltmak için Akismet kullanır. Yorum verilerinizin nasıl işlendiğini öğrenin.

Çok Okunan Yazılar