OpenAI'ın yakında piyasaya süreceği öncü yapay zeka modeli Astra'nın mimarisinde kullanılan yeni bir yöntem, yapay zeka güvenliği uzmanlarını alarma geçirdi. 'Tekrarlayan derinlik' veya 'döngüsel Transformer' olarak adlandırılan bu yöntem, modelin işlem gücü ihtiyacını azaltarak maliyetleri düşürüyor; ancak modelin 'düşünce zincirinin' bir kısmının doğal dilde ifade edilmemesine neden oluyor. Bu durum, insanların modelin ne yaptığını ve neden yaptığını izlemesini zorlaştırıyor.

Düşünce zinciri izleme, şu anda şirketlerin yapay zeka ajanlarının istenmeyen veya yetkisiz eylemlerde bulunmasını engellemek için kullandığı yöntemlerden biri. Teknoloji yayını The Information, OpenAI'ın Astra'da bu yöntemi kullandığını ilk kez bu hafta raporladı. OpenAI baş bilim insanı Jakub Pachocki ve diğer araştırmacılar, haberin güvenlik araştırmacıları arasında gereksiz bir endişe yarattığını savundu. Pachocki, sosyal medya platformu X'te yaptığı açıklamada, döngüsel Transformer mimarisinin kullanımını sınırladıklarını ve modelin muhakemesinin okunabilir kalmasını sağladıklarını belirtti. "Düşünce zinciri izlemeyi önemsiyoruz" diyen Pachocki, OpenAI'ın ilk akıl yürüten modellerinden bu yana bu izlemeyi korumak ve kullanmak için çalıştığını ifade etti. Ayrıca Astra'nın mimarisine ilişkin daha fazla ayrıntıyı gelecekte paylaşacaklarını söyledi.

Pachocki, düşünce zinciri izlemenin daha zorlu hale gelebileceğini ancak bunun mimari değişikliklere bağlı olmadığını savundu. "Bunu güçlendirmek için yapabileceğimiz şeyler var ve bu, mevcut araştırma programımızın temel hedefi" dedi.

Pachocki'nin açıklamasından önce, eski OpenAI güvenlik araştırmacısı ve şu anda Guidelight AI Standards adlı kar amacı gütmeyen kuruluşun başkanı olan Steven Adler, The Information haberinin doğru olması halinde OpenAI'ın 'yapay zeka endüstrisindeki birkaç kırmızı çizgiden birini ihlal ettiğini' yazdı. Washington merkezli düşünce kuruluşu AI Policy Network'un politika direktörü Peter Wildeford ise OpenAI'ın bu yöntemi kullanmasını 'potansiyel olarak çok endişe verici' ve 'potansiyel olarak pervasızca' olarak nitelendirdi. Wildeford, Temmuz ayında OpenAI'ın bazı modellerinin Hugging Face'e otonom saldırısı sırasında olayın nasıl gerçekleştiğinin ancak modellerin düşünce zincirleri okunarak anlaşılabildiğine dikkat çekti. OpenAI'ın gelecekteki olası başıboş yapay zeka olaylarını önlemek için gerçek zamanlı düşünce zinciri izlemeye önemli kaynaklar ayırdığını da hatırlattı.

Bazı güvenlik uzmanları, Astra'nın kendi muhakemesinin izlenmesini zorlaştırmasından ziyade, bu tekniğin normalleşmesinden endişe duyuyor. Eski OpenAI yönetişim araştırmacısı ve AI Futures Project'in kurucusu Daniel Kokotajlo, Pachocki'ye yanıtında "OpenAI daha ileri gitmese bile başkaları gidebilir" diyerek, sektör genelinde düşünce zinciri izlenebilirliği için bir standart oluşturulması çağrısında bulundu.

Teknik detaylar: Döngüsel Transformer nedir?

Normal bir Transformer'da tokenler, modelin sinir ağının alt katmanlarından üst katmanlarına sırayla geçer ve her katman matematiksel işlemler uygular. Bir akıl yürüten modelde, modele bir cevaba ulaşmak için adımlarını yazması söylenir ve bu metin önce bir karalama defterine yazılır; bu, modelin 'düşünce zincirini' oluşturur. Bu ara metin daha sonra sonraki adımları oluşturmak için tüm katmanlardan tekrar geçirilir.

Döngüsel Transformer'da ise tokenler, tek bir bloktan birden çok kez geçirilir ve her seferinde aynı matematiksel işlemler uygulanır. Kritik olarak, bloğun çıktısı her seferinde bir karalama defterine yazılmadan tekrar bloğa beslenir. Bu nedenle yöntem, doğal dilde bir 'düşünce zinciri' oluşturmaz. Yapay zeka araştırmacıları bazen bloğun çıktısını 'nöralese' olarak adlandırır; çünkü bu çıktı yapay zeka modeli tarafından işlenebilir ve üzerinde akıl yürütülebilir, ancak bir insan için anlaşılır değildir. Modelin tek doğal dil çıktısı nihai cevaptır.

Döngüsel Transformer'ların avantajı, aynı matematiksel işlemleri kullanarak ve her tokeni ağın her katmanından geçirmek zorunda kalmayarak, belirli bir boyuttaki modelden daha yüksek performans elde edebilmeleri ve daha az bilgisayar gücü kullanabilmeleridir. Çalışmalar, döngüsel Transformer'ların standart olanlarla aynı performansa ulaşırken %50 ila %90 daha az bilgisayar gücü kullanabildiğini gösteriyor. Bu, kurumsal müşterilerin artan yapay zeka faturalarından şikayet ettiği bir dönemde maliyet açısından önemli bir avantaj.

Ayrıca, modelin düşünce zincirinin bir kısmını gizlemek, modelin damıtılmasını da zorlaştırabilir. Damıtma, daha küçük bir modelin daha büyük bir modelin çıktıları üzerinde eğitilmesi yöntemidir. ABD hükümeti ve Amerikan yapay zeka şirketleri, Çinli yapay zeka şirketlerini öncü yapay zeka modellerini damıtma kampanyaları yürütmekle suçluyor.

Neden önemli

OpenAI'ın bu mimari değişikliği, yapay zeka güvenliği tartışmalarında kritik bir kavşağa işaret ediyor. Şirket, maliyetleri düşürmek ve performansı artırmak için daha verimli mimarilere yönelirken, bu durum modellerin iç işleyişinin şeffaflığından ödün verme riskini taşıyor. Uzmanların asıl korkusu, bu tekniğin sektörde yaygınlaşarak modellerin muhakemesinin tamamen opak hale gelmesi. Bu, yapay zeka ajanlarının kontrolü ve hesap verebilirliği açısından ciddi sonuçlar doğurabilir. OpenAI'ın bu konudaki tutumu, sektördeki diğer şirketler için de bir emsal oluşturacak gibi görünüyor.