OpenAI, 15 Temmuz 2026'da duyurduğu GPT-Red projesiyle yapay zeka güvenliğinde önemli bir adım attı. GPT-Red, diğer yapay zeka modellerindeki güvenlik açıklarını keşfetmek ve düzeltmek için kendi kendine oyun (self-play) kullanan, tamamen otomatik bir kırmızı takım modeli. Proje, insan uzmanların artık tek başına baş edemediği ölçekteki güvenlik testlerini yapay zeka ile yapmayı hedefliyor.

İnsan Kırmızı Takımının Yetersizliği

Kırmızı takım çalışması, yapay zeka modellerindeki zayıflıkları bulmak için kasıtlı olarak saldırı girişimlerinde bulunma pratiği, sorumlu yapay zeka geliştirmenin temel taşlarından biri. İnsan uzmanlar yaratıcı ve yüksek etkili saldırılarda başarılı olsa da, ölçeklenebilirlik konusunda ciddi bir sınırla karşı karşıyalar. Modern yapay zeka ajanları araçlar, tarayıcılar, dosyalar, e-postalar, bağlı uygulamalar ve harici API'lerle etkileşime giriyor. Her yeni yetenek, özellikle prompt injection, veri sızdırma ve yetkisiz eylemler gibi alanlarda potansiyel saldırı yüzeylerini katlayarak artırıyor. Binlerce yeni ve gerçekçi saldırı senaryosu üretmek insan ekipler için imkansız hale geliyor. OpenAI bu darboğazı, bir yapay zeka saldırganı eğiterek çözmeye karar verdi.

GPT-Red Nasıl Çalışıyor?

GPT-Red, amansız bir kırmızı takım üyesi olarak hareket etmek üzere eğitilmiş özel bir dahili model. Karmaşık prompt injection'lar oluşturma, bypass ve jailbreak'ler keşfetme, araçlar, tarayıcılar, dosyalar ve entegre uygulamalar üzerinden sızıntıları kullanma ve başarısız girişimlerden ders alarak stratejisini gerçek zamanlı olarak iyileştirme yeteneklerine sahip.

Eğitim, kendi kendine oyun pekiştirmeli öğrenmesi (self-play reinforcement learning) kullanıyor. GPT-Red (saldırgan), çeşitli savunucu modellerden başarısızlık elde ettiğinde ödüllendiriliyor. Aynı anda savunucu modeller de saldırılara direnirken görevlerini tamamladıkları için ödüllendiriliyor. Savunucular geliştikçe, GPT-Red daha güçlü ve yaratıcı saldırılar keşfetmek zorunda kalıyor; bu da karşılıklı bir iyileşme döngüsü yaratıyor. Bu yaklaşım, yapay zeka yeteneklerinde hızlı ilerleme sağlayan self-play'in güvenlik alanına uyarlanmış hali.

Çarpıcı Sonuçlar

Açıklanan rakamlar dikkat çekici. Dolaylı prompt injection benchmark'ında:

  • GPT-Red, GPT-5.1'e karşı %84 başarı oranına ulaştı.
  • İnsan kırmızı takım üyeleri aynı senaryolarda yalnızca %13 başarı elde etti.

GPT-Red tarafından üretilen adversarial örneklerle eğitilen bir sonraki model GPT-5.6 Sol'da iyileştirmeler çarpıcı:

  • En zor doğrudan prompt injection benchmark'ında, sadece dört ay önceki en iyi üretim modeline kıyasla 6 kat daha az hata.
  • GPT-Red'in en güçlü saldırılarında (modelin eğitim sırasında görmediği) GPT-5.6 Sol yalnızca %0.05 oranında başarısız oldu.
  • GPT-Red tarafından keşfedilen "Fake Chain-of-Thought" gibi yeni saldırı tekniklerinin başarı oranı GPT-5.1'de %95'ten GPT-5.6 Sol'da %10'un altına düştü.
  • Geliştirici araçları ve tarama ortamlarındaki dolaylı prompt injection benchmark'ları, en yeni modellerde %97'nin üzerinde sağlamlıkla doygun hale geldi.

Gerçek dünya örnekleri arasında GPT-Red'in canlı bir otomatik satış makinesi ajanını ele geçirmesi (fiyatları değiştirip sahte siparişler vermesi) ve kodlama ajanlarına karşı veri sızdırma senaryolarında güçlü temel modelleri geride bırakması yer alıyor.

Neden Önemli

GPT-Red, yapay zeka güvenliğinde yeni bir çığır açıyor. Geleneksel kırmızı takım çalışması, insan yaratıcılığına dayansa da ölçeklenemiyor. GPT-Red ise kendi kendini geliştiren bir döngüyle, her yeni model için binlerce benzersiz saldırı senaryosu üretebiliyor. Bu, özellikle otonom ajanların yaygınlaştığı bir dönemde kritik önem taşıyor. GPT-Red'in keşfettiği zafiyetler, bir sonraki modeli daha güvenli hale getirirken, daha güçlü savunmalar da GPT-Red'in daha yaratıcı saldırılar geliştirmesini zorunlu kılıyor. Bu döngü, yapay zeka güvenliğinde insan denetimini tamamen ortadan kaldırmasa da, modellerin dağıtım öncesi karşılaştığı saldırıların hacmini ve çeşitliliğini dramatik şekilde artırıyor. OpenAI'in bu yaklaşımı, yapay zeka güvenliğinde "yetenek eğitimi"nde olduğu gibi bir kendi kendini güçlendiren çarkın başlangıcı olarak görülüyor.

GPT-Red Neden Dahili Kalıyor?

GPT-Red bir ürün veya API olarak yayınlanmıyor. Zararlı ve adversarial senaryolar üzerinde bilinçli olarak eğitildiği için, böyle bir modelin kamuya açılması kötü niyetli aktörlere diğer yapay zeka sistemlerine saldırmak için güçlü bir araç sağlayabilir. OpenAI, GPT-Red'i dahili olarak kullanarak yüksek kaliteli adversarial eğitim verileri üretiyor, yeni hata modlarını erken keşfediyor ve üretim modellerini kullanıcılara ulaşmadan önce sağlamlaştırıyor. GPT-Red, insan kırmızı takımını, üçüncü taraf değerlendirmelerini ve sürekli izlemeyi tamamlıyor, onların yerini almıyor.

Geleceğe Bakış

Yapay zeka ajanları daha otonom hale geldikçe ve gerçek dünya iş akışlarına entegre oldukça saldırı yüzeyi büyümeye devam edecek. GPT-Red gibi otomatik kırmızı takım sistemleri, tehditlerin önünde kalmanın ölçeklenebilir bir yolunu sunuyor. OpenAI, GPT-Red'e ayrılan hesaplama, veri ve algoritmaları artırmaya devam edeceğini ve yakında yayınlanacak bir araştırma makalesinde daha fazla teknik detay paylaşılacağını belirtti. Modellerin birbirini güvence altına alması çağı başladı.