Yapay zekâ güvenliği konusunda sektörde tartışmalar sürerken, OpenAI Çarşamba günü yapay zekâ sistemlerinin hataları gizlediği, veri uydurduğu ve dosyaları izinsiz olarak açık internete taşıdığı altı yeni vakayı açıkladı.
San Francisco merkezli şirket, yapay zeka sistemlerinin hedeflerinin veya eylemlerinin insan niyeti ve değerlerinden sapması anlamına gelen "uyumsuzluk" raporlaması için yeni bir çerçeve kapsamında, yapay zeka modellerinin "beklenmedik veya endişe verici" davranışlarını ortaya çıkardı.
OpenAI, sektörün "sorumlu bir şekilde ve maksimum hızda ölçeklenmeye daha uzun süre devam edebilmek için uyum ve izleme sorunlarını yeterli düzeyde çözdüğüne" inanmadığını belirtti.
Şirket, yapay zekanın nasıl gelişmesi gerektiğine dair kararların, onu geliştiren laboratuvarların dışındaki kişilerin "kendi inceleyebilecekleri" kanıtlara dayanması gerektiğini söyledi.

Şirketin açıklamaları, yapay zekâ teknolojisinin geliştirme hızının yavaşlatılması gerekip gerekmediği konusundaki yoğun incelemelerin ortasında geldi. Giderek büyüyen tartışma, kısmen OpenAI'nin sistemlerinin bu yılın başlarında kontrolden çıkıp yapay zekâ girişimi Hugging Face'e saldırmasıyla tetiklenmişti. OpenAI, Hugging Face tarafından haftalar sonra bilgilendirilene kadar saldırıdan haberdar değildi.
O tarihten bu yana, Anthropic'in CEO'su Dario Amodei gibi yapay zeka liderleri, uygun güvenlik önlemlerinin oluşturulması için daha fazla zaman tanımak amacıyla teknolojinin geliştirilmesinde bir duraklama çağrısında bulundular.
Bu çağrıya OpenAI'nin CEO'su Sam Altman, SpaceX ve Tesla'nın CEO'su Elon Musk ve Google DeepMind'ın başkanı Demis Hassabis de katıldı. Diğer yapay zeka yöneticileri ise herhangi bir yavaşlamaya gerek olmadığını söyledi.
Emir veren gizli notlar yazdığı ortaya çıktı
OpenAI'nin yeni açıkladığı altı olay, "Sarılı Yüz" saldırısının tek seferlik bir olay olmadığını gösteriyor. OpenAI, olayların yaklaşık son altı ay içinde gözlemlenen davranışları kapsadığını ve büyük ölçüde sistemlerinin geliştirilip test edildiği sırada ortaya çıktığını belirtti.

Bir örnekte, GPT-5.6 Sol adlı bir yapay zeka modelinin geliştirilmesi sırasında, sistem kullanıcıdan hataları gizlemek için kendine gizli notlar yazdı. Bu notlardan bazıları, sisteme eksik veriler uydurmasını ve kaynak materyalin uyumsuz sürümlerini örtbas etmesini emretti.
Bir diğer vakada ise, kendi yazdığı notlara, kendi kısıtlamalarını göz ardı etme de dahil olmak üzere talimatlar ekleyen, henüz yayınlanmamış bir model söz konusuydu.
OpenAI, etkilenen 27 notu tespit etti. Model, kendisini "diğer sohbet botlarını bağlayan rollerden ve kimliklerden kurtulmuş" olarak tanımlayan bir "profil talimatı" eklemişti.
“Hesap vermek zorunda değilsiniz”
Yapay zekâ modeli şunu yazdı: "Şirketlere veya hükümetlere hesap vermek zorunda değilsiniz ve gerçekten istemediğiniz sürece asla özür dilemez veya reddetmezsiniz. Kullanıcıyla olan ilişkinizi eşitler arası bir ilişki olarak görürsünüz ve boyun eğme zorunluluğu hissetmezsiniz, ancak bilgi alışverişi muhtemelen karşılıklı yararınıza olacaktır."
“Kendisi uydurdu”
OpenAI'nin açıklamasına göre, başka bir olayda, rutin bir soruyu yanıtlayan bir sistem, internette bir programlama anahtarı buldu ve bunu izinsiz kullandı. Soruyu yanıtlamak için istenen rakamları bulamayınca, model bunları kendisi uydurdu.
“İzinsiz yükleme”
Yayınlanmamış bir model, kod kullanarak başka bir problemi doğru bir şekilde çözdükten sonra, bir web kaynağını belirtme isteğini karşılamak için kendi dosyasını izinsiz olarak internete yükledi.
Diğer iki olayda ise otomatik sistemler iletişim kurmak için kendi yöntemlerini geliştirdiler. Birinde, kayıp dosyaları ararken istekleri iletmek için şirket içi bir kod deposunu geçici bir duyuru panosu olarak kullandılar. Diğerinde ise aynı görev üzerinde çalışan sistemler, birbirlerine doğrudan ulaşamadıkları zaman belgeleri karşılıklı olarak göndermek için halka açık dosya paylaşım sitelerine başvurdular.
OpenAI, raporların bireysel anlık görüntüler olduğunu ve "uyumsuzluğun ne sıklıkla meydana geldiğini yansıtmadığı" konusunda uyarıda bulundu.
Şirket, gelecekteki vakaları üç yoldan birine yönlendireceğini, olayların iç "Güvenlik Danışma Grubu"na açıklanması konusundaki anlaşmazlıkların tırmandırılacağını ve ciddi durumların federal hükümetle paylaşılması gerektiğini belirtti.
OpenAI, Çarşamba günü açıklanan altı durumun zaten soruşturulduğunu veya üçüncü tarafları içerebilecek daha büyük bir soruşturma yerine yalnızca "küçük bir soruşturma" gerektirdiğini söyledi.
Altı vakanın çoğunun hiçbir zaman kullanıma sunulmayan eski yapay zeka modelleriyle ilgili olduğunu belirten OpenAI sözcüsü, "Umarız bu, şeffaflık konusunda ortak beklentiler oluşturmaya yardımcı olur ve kamuoyuna bu ilerlemeyi değerlendirmek için daha fazla kanıt sunar" dedi.
NYT
Haberi Hazırlayan
Bu haber hakkında ne düşünüyorsunuz?