Anthropic, 14 Ağustos 2026'da yaptığı açıklamayla, gelecekteki Claude modellerinin ürettiği metinlere filigran ekleyeceğini duyurdu. Bu filigran, bir metnin Claude tarafından yazılmış olma olasılığını belirlemeye yarıyor. Şirket, bu değişikliği AB Yapay Zeka Yasası'na (EU AI Act) uyum sağlamak amacıyla, diğer büyük yapay zeka sağlayıcılarıyla birlikte hayata geçiriyor.
Filigran yöntemi, büyük dil modellerinin (LLM) kelime seçimindeki rastgeleliği kullanıyor. Model her kelimeyi seçerken, önceki metne göre en olası adaylar arasından bir seçim yapıyor. Örneğin, "Hava bugün soğuk ve..." cümlesinden sonra "şekerli" gelme olasılığı çok düşükken, "kapalı" veya "gri" gibi kelimeler oldukça olası. Bu tür düşük riskli seçimlerde, model genellikle rastgele bir sayı üreteci kullanarak karar veriyor. Filigran ise bu rastgeleliğin kaynağını değiştiriyor: kelime seçimleri artık bir anahtar ve önceki kelimeler kullanılarak belirleniyor. Böylece, metindeki kelime dizilimi, anahtara sahip olanlar tarafından kontrol edilebiliyor ve Claude'un metni üretip üretmediğine dair bir olasılık hesaplanabiliyor.
Anthropic, filigranın çıktı kalitesini etkilemediğini vurguluyor. İç testlerde, filigranlı ve filigransız metinler arasında içerik, yaratıcılık veya okunabilirlik açısından bir fark görülmemiş. Google DeepMind'ın SynthID-Text makalesinde de, filigranlı modelin Gemini trafiğinde kullanıldığında, kullanıcı geri bildirimlerinde istatistiksel olarak anlamlı bir fark bulunmadığı belirtiliyor. Ayrıca, insan değerlendiricilerin yaptığı kontrollü bir çalışmada da filigranlı ve filigransız yanıtlar arasında kalite farkı algılanmamış.
Filigran, metne hiçbir şey eklemiyor; gizli karakterler veya ekstra token'lar yok. Bu nedenle modelin hızını etkilemiyor ve maliyeti artırmıyor. Ayrıca, filigran hiçbir kişisel veya kurumsal bilgi içermiyor; kullanıcıyı, kuruluşu veya sohbetleri tanımlamıyor.
Anthropic'in kullandığı yöntem, Google DeepMind'ın 2024'te Nature'da yayımlanan SynthID-Text yaklaşımının bir versiyonu. Bu yöntem, Scott Aaronson'ın 2022'deki önerisine dayanan bir aileye ait. Filigranın etkinliği bazı durumlarda sınırlı. Örneğin, "Isaac Newton'un en ünlü eseri Principia..." cümlesinde olduğu gibi, doğru cevabın tek olduğu durumlarda filigran uygulanamıyor. Benzer şekilde, kod üretiminde de, kodun doğru çalışması için belirli terimlerin kullanılması gerektiğinden filigran daha az uygulanıyor. Ancak kod içindeki yorumlar gibi keyfi seçimlerin olduğu yerlerde filigran kullanılabiliyor.
Filigran, yalnızca Claude'un seçtiği kelimelere uygulanıyor. İnsan yazısını düzenleyen Claude, çoğunlukla insanın kelimelerini koruduğu için, filigranın tespit edilebilmesi için yeterli değişiklik olmayabilir. Çevirilerde ise her kelime Claude tarafından seçildiği için filigran uygulanıyor.
Anthropic, filigran tespiti için yakında bir API sunacağını açıkladı. Ayrıca, Claude'un ürettiği görseller ve diğer dosyalar için C2PA standardında içerik kimlik bilgisi ekleyecek. Bu, dosyanın metadata'sına kriptografik olarak imzalanmış küçük bir not eklenmesi anlamına geliyor; dosyanın kendisi değişmiyor.
Neden önemli
Bu filigran yöntemi, yapay zeka tarafından üretilen içeriğin şeffaflığı konusunda önemli bir adım. EU AI Act'in getirdiği yükümlülükler, büyük model sağlayıcılarını ortak bir standarda yönlendiriyor. Filigranın kaliteyi etkilememesi ve maliyeti artırmaması, kullanıcı deneyimini bozmadan uyumluluğu sağlıyor. Ancak filigranın sınırlamaları da var: küçük metinlerde veya yoğun düzenleme yapılmış metinlerde tespit zorlaşabiliyor. Bu durum, yapay zeka içeriğinin tespitinin her zaman mümkün olmayacağını gösteriyor. Yine de, filigran tespit API'sinin yakında sunulacak olması, içerik doğrulama süreçlerini kolaylaştırabilir ve yapay zeka kaynaklı içeriğin yaygınlaştığı bir ortamda güvenilirlik açısından önemli bir araç haline gelebilir.