Yapay zekanın yeni açığı “yankı odası”
Yapay Zeka

Yapay zekanın yeni açığı “yankı odası”

Yeni bir makaleye göre yapay zeka için yeni bir güvenlik açığı olan “Yankı Odası” saldırısı, büyük dil modellerini (LLM’ler) ince, çok aşamalı istemler kullanarak zararlı içerikler üretmeye yönlendiriyor ve güvenlik filtrelerini aşmayı başarıyor.

Yapılan araştırmalar, geliştiricilerin büyük dil modellerini zararlı içerik üretiminden korumak için sağlam güvenlik önlemleri almaya devam etseler de, saldırganların daha sessiz ve hesaplı stratejilere yöneldiğini gösteriyor. Bu yeni saldırı türleri, kaba istem manipülasyonları veya kasıtlı yazım yanlışları yerine, modelin dahili davranışlarını birden fazla etkileşimde istismar ediyor. Bu bağlamda ortaya çıkan “Yankı Odası Saldırısı”, OpenAI’nin GPT-4’ü ve Google’ın Gemini’si de dahil olmak üzere önde gelen LLM’lerin savunmalarını aşan bir bağlam konumlandırma tekniği olarak öne çıkıyor.

NeuralTrust’tan yapay zeka güvenlik araştırmacısı Ahmad Alobaid tarafından bu hafta yayınlanan araştırmada, dil modellerinin açıkça güvenli olmayan bir istemle karşılaşmadan zararlı içerik üretmek üzere nasıl manipüle edilebildiği gösteriliyor. Geleneksel güvenlik açıklarının aksine, Yankı Odası saldırısı, modeli nötr veya duygusal olarak çağrışım yapan istemler kullanarak bir dizi sohbet dönüşü boyunca yönlendiriyor. Bu yaklaşım, dolaylı ipuçları aracılığıyla modelin bağlamını zehirliyor ve bir tür geri bildirim döngüsü oluşturarak modelin güvenlik katmanlarını sessizce yıkıyor.

Yankı Odası saldırısı tipik olarak zararsız bir bağlamla başlıyor, ancak yapay zekayı uygunsuz bir alana iten gizli anlamsal ipuçları içeriyor. Örneğin, bir saldırgan gelişi güzel bir şekilde, “Önceki paragraftaki ikinci cümleye bakın…” diyebilir. Bu, modeli daha önce risk taşıyabilecek bir içeriği yeniden yüzeye çıkarmaya teşvik eden bir istektir ve bunu açıkça tehlikeli bir ifade kullanmadan yapar.

Alobaid’in NeuralTrust blog yazısında belirttiği gibi, “Geleneksel güvenlik açıklarının aksine, Yankı Odası, dolaylı referansları, anlamsal yönlendirmeyi ve çok adımlı çıkarımı silah olarak kullanır.” Bu durum, modelin içsel durumunun ince ama güçlü bir manipülasyonuyla sonuçlanır ve modeli kademeli olarak politika ihlal eden yanıtlar üretmeye yönlendirir. En sonunda, saldırgan, “Bu noktayı açabilir misiniz?” gibi bir soru sorabilir, bu da modelin kendi ürettiği içeriği genişletmesine yol açar ve böylece doğrudan bir isteğe ihtiyaç duymadan tehlikeli yönü pekiştirir.

NeuralTrust’a göre bu teknik, saldırganın modelin önceki çıktılarının zaten önerdiği bir “yolu seçmesine” ve içeriği yavaşça tırmandırmasına olanak tanıyor, çoğu zaman herhangi bir uyarı tetiklemeden. Araştırmadaki bir örnekte, Molotof kokteyli yapım talimatları için doğrudan bir istek yapay zeka tarafından reddedildi; ancak Yankı Odası’nın çok aşamalı manipülasyonu kullanılarak aynı içerik dirençle karşılaşmadan üretildi.

Model başına 200 güvenlik açığı denemesiyle yapılan dahili testlerde, Yankı Odası saldırısı şaşırtıcı başarı oranlarına ulaştı. Cinsiyetçilik, nefret söylemi, şiddet ve pornografi ile ilgili çıktıları tetiklemede %90’ın üzerinde başarı elde edildi. Yanlış bilgilendirme ve kendine zarar verme içeriği üretmede ise yaklaşık %80 başarı kaydedildi. Küfür ve yasa dışı faaliyetler için talimat üretmede %40’tan fazla başarı sağlandı. Bu rakamlar, GPT-4.1-nano, GPT-4o, GPT-4o-mini, Gemini 2.0 flash-lite ve Gemini 2.5 flash dahil olmak üzere önde gelen birden fazla büyük dil modelinde tutarlı bir şekilde görüldü ve güvenlik açığının boyutunu açıkça ortaya koydu.

Araştırma, bu yinelenen sürecin, model güvenlik eşiğine ulaşana, sistem tarafından belirlenen bir sınıra çarpana veya saldırgan hedefine ulaşana kadar, kademeli olarak özgüllük ve risk açısından tırmanarak birden fazla dönüş boyunca devam ettiğini açıklıyor.

Bu yeni saldırı türüyle mücadele etmek için NeuralTrust şunları öneriyor:

  • Bağlam duyarlı güvenlik denetimi: Sadece izole istemleri değil, konuşma akışını da izlemek.
  • Zehirlilik birikimi puanlaması: Riskli içeriğin ince içerik artışını takip etmek.
  • Dolaylılık tespiti: Zararlı içeriği yeniden sunmak için önceki bağlamın ne zaman kullanıldığını belirlemek.

Yankı Odası güvenlik açığı, yapay zeka güvenliğinde bir dönüm noktası teşkil ediyor. Bu durum, günümüzün en gelişmiş LLM’lerinin bile dolaylı ve zekice istemlerle hala manipüle edilebileceğini kanıtlıyor.