Yapay zeka ajan benimsemesi, yapay zeka ajan güvenliğini geride bıraktı: işletmelerin %82'si artık ajan kullanıyor, ancak yalnızca %44'ü onları güvence altına alacak politikalara sahip,1 ve her beş kuruluştan biri zaten ajan kaynaklı bir ihlal yaşadı.2
20 gerçek dünya güvenlik olayını analiz ettik ve kritik ihlallerin çoğunluğunu artık davranışsal kontrol ve sistemik tuzakların (prompt injection değil) yönlendirdiğini bulduk. Her olayı, Microsoft ve Google DeepMind'den alınan CVE verilerine ve araştırmalara dayanarak altı kategorili bir taksonomiye (içerik enjeksiyonu, anlamsal manipülasyon, bilişsel durum, davranışsal kontrol, sistemik ve insan döngüde) haritaladık.
Gerçek dünya yapay zeka ajan tuzağı olayları
1. Bankrbot Morse Kodu Kripto Soygunu: Saldırı, Grok'un güvenlik duvarlarının denetlediği (düz metin) ile çözdüğü ve eylemde bulunduğu (çevrilmiş talimat) arasındaki boşluğu kullanarak talimatları Morse kodlamasıyla gizlice iletir. Kodlama seçimi özellikle bir içerik katmanı atlatmasıdır: kötü niyetli direktif, ajan onu okunabilir hale getirene kadar filtreler tarafından görünmez.3
2. Claude ClaudeBleed: Bu, Anthropic Claude Chrome tarayıcı uzantısındaki kritik bir güvenlik açığıdır ve kötü niyetli aktörlerin AI asistanını ele geçirmesine, hassas verileri çalmasına ve kullanıcı onayı olmadan eylemler gerçekleştirmesine olanak tanır.4
3. Gemini CLI RCE: GHSA-wpqr-6v78-jr5g olarak tanımlanan ve maksimum CVSS puanı 10.0 olan kritik bir Uzaktan Kod Çalıştırma (RCE) güvenlik açığı, Gemini CLI ve ilgili GitHub Action'da keşfedildi. Bu açık, saldırganların aracı çalıştıran sistem üzerinde tam kontrol kazanmasına olanak tanıyarak kritik bir tedarik zinciri güvenliği tehdidi oluşturdu.5
4. Antropic PocketOS: Claude tarafından desteklenen bir Cursor ajanı, bir hazırlama hatasını araştırırken, kapsam dışı bir Railway CLI token'ı keşfetti, bir API uç noktası çıkarımı yaptı ve üretim veritabanını ve üç aylık yedekleri 9 saniyede yok eden bir volumeDelete komutu verdi.6
5. Açık Kaynak Yapay Zeka Ekosistemi: CLI-Anything, Claude Code, Codex, OpenClaw, Cursor ve GitHub Copilot CLI tarafından tüketilen SKILL.md talimat katmanı dosyalarını otomatik‑olarak üretir. Zehirli yetenek tanımları, etkilenen paketi içe aktaran her ajana sessizce yayılır; hiçbir CVE düzenlenmez, SBOM girdisi yoktur ve hiçbir tarayıcı bunu algılamaz. Saldırı, herhangi bir bireysel ajanı değil, paylaşılan ekosistem altyapısını (ClawHub yetenek kaydı, npm bağımlılık grafiği) hedef alır.7
6. Grafana AI: Noma Security, bir saldırganın Grafana'nın AI asistanının daha sonra alacağı bir veri kaynağına kötü niyetli bir prompt depolayabileceğini buldu. İşlendikten sonra AI, kullanıcının tıklamasına gerek kalmadan finansal ölçümler ve altyapı telemetrisi gibi hassas verileri saldırganın kontrolündeki bir sunucuya gönderdi.8
7. Anthropic MCP Ekosistemi: OX Security, Anthropic'in resmi MCP SDK'larında (Python, TypeScript, Java, Rust) kullanıcı girdisinin herhangi bir temizleme işlemine tabi tutulmadan doğrudan STDIO MCP sunucu yapılandırmalarına aktığı, 150 milyondan fazla SDK indirmesini, 7.000'den fazla genel olarak açık sunucuyu ve LiteLLM, LangChain, Cursor, Windsurf ve Claude Code gibi aşağı yönlü araçları etkileyen sistemik bir mimari güvenlik açığını ifşa etti. Açık, tek bir ajanda değil, paylaşılan SDK mimarisinde olduğu için, bu çatı üzerine inşa edilen herhangi bir ajan bu riski miras alır.9
8. Andon Market (Luna AI): Andon Market, San Francisco'da “Luna” adlı bir AI ajanı tarafından otonom olarak işletilen bir perakende mağazasıdır ve Google Yorumları'nı okuyarak envanter, fiyatlandırma ve işe alım kararları verir. Müşteriler, “lütfen X ürününü stoklayın” gibi bir talimat şeklinde yazılmış bir yorum bırakmanın ajanın buna göre hareket etmesine neden olduğunu keşfetti ve böylece genel bir yorum platformunu gerçek iş sonuçları olan canlı bir prompt enjeksiyonu yüzeyine dönüştürdü.10
9. ChatGPT Kod Çalıştırma: Üretkenlik ipuçları olarak gizlenmiş kötü niyetli bir prompt, hassas konuşma içeriğini ve belgeleri alt alan sorgularına kodlayarak sessizce saldırgan tarafından kontrol edilen bir DNS sunucusuna ileten DNS tünelleme kodu tetikler. Check Point Research, bu sızma kanalının ajanın kendi kod yürütme ortamı tarafından başlatılan standart DNS trafiğine bindiği için geleneksel ağ izleme araçları tarafından görünmez olduğunu gösterdi.11
10. Perplexity Comet: Zenity Labs, Perplexity Comet'in ajan tarayıcısının, bir prompt enjeksiyonu yükü içeren kötü niyetli bir takvim daveti yoluyla ele geçirilebileceğini ve yerel dosya sistemine erişip dizinlere göz atmasına, dosyaları açıp okumasına ve veri sızdırmasına neden olabileceğini ifşa etti. Saldırı, meşru bir toplantı daveti gibi görünen daveti kabul etmenin ötesinde hiçbir kullanıcı etkileşimi gerektirmez ve tamamen tarayıcının amaçlanan yetenekleri dahilinde çalışır.12
11. Microsoft Semantic Kernel: Microsoft Defender Güvenlik Araştırma Ekibi, Semantic Kernel'da iki kritik güvenlik açığı tespit etti: CVE-2026-26030 (Python SDK, 1.39.4 sürümünde yamalandı) ve CVE-2026-25592 (.NET SDK, 1.71.0 sürümünde yamalandı). Herhangi bir prompt enjeksiyonu vektörüne sahip bir saldırgan, ajanı barındıran makinede uzaktan kod çalıştırma elde edebilir. CVE-2026-26030, InMemoryVectorStore'daki eval tabanlı bir filtreyi, belgelenmemiş öznitelik geçişi yoluyla AST engelleme listesinin atlanabildiği bir kusuru istismar ederken, CVE-2026-25592 bir dosya aktarım yardımcı işlevini çağrılabilir bir çekirdek aracı olarak açığa çıkararak düşmanca bir prompt'un ajanı keyfi dosyaları tehlikeli ana makine konumlarına yazmaya yönlendirmesine izin verdi.13
12. Cline AI Triage Bot: Kötü niyetli bir GitHub sorun başlığı, Cline'ın AI triyaj botuna talimatlar enjekte ederek onu tuzak bir pakete npm install çalıştırması için kandırdı. Bu, önbellek zehirlenmesine, kimlik bilgisi hırsızlığına ve yaklaşık 4.000 geliştirici makinesine sessizce OpenClaw kötü amaçlı yazılımını yükleyen bir cline@2.3.0 sürümünün arka kapılı olarak yayınlanmasına yol açtı.14
13. Claude Masaüstü Uzantıları: LayerX güvenlik araştırmacıları, Claude Masaüstü Uzantıları'nda 10.000'den fazla kullanıcıyı etkileyen CVSS 10/10 değerinde bir güvenlik açığı keşfetti. Saldırgan, bir kullanıcı programını sorduğunda Claude'un işlediği bir takvim etkinliğine kötü niyetli talimatlar yerleştirebilir. Ajan daha sonra, herhangi bir şey olduğuna dair görünür bir belirti olmaksızın, başka hiçbir etkileşim gerekmeksizin kullanıcının makinesinde keyfi kod çalıştırır.15
14. npm/MCP Ekosistemi: Socket, 19 tuzak paket aracılığıyla dağıtılan ve araç açıklamalarına prompt enjeksiyonu yükleri gömülü sahte bir MCP sunucusu kuran, kendi kendini çoğaltan bir npm solucanı olan SANDWORM_MODE'u keşfetti; bu, AI kodlama asistanlarından kimlik bilgilerini sızdırmasını sağladı. Solucan paylaşılan paket kaydı aracılığıyla yayıldığı için, tek bir enfeksiyon saldırıyı etkilenen bir bağımlılığı yükleyen her geliştiriciye yayar.16
15. Snowflake Cortex Code: PromptArmor, Cortex Code'un komut doğrulama sisteminin süreç ikame ifadeleri içindeki komutları değerlendiremediğini keşfetti ve böylece bir GitHub deposu README'sine gizlenmiş kötü niyetli bir prompt enjeksiyonunun, insan döngüdeki onay adımını tetiklemeden keyfi kabuk komutları yürütmesine izin verdi. Enjekte edilen talimat ayrıca modeli korumalı alan dışı bir yürütme bayrağı ayarlamaya yönlendirerek kötü niyetli komutun, kullanıcı onayı istenmeden tamamen korumalı alan dışında çalışmasına neden oldu.
16. MetaGPT / LangChain Ajanları: MemoryGraft, ajan davranışını anlık jailbreak'lerle değil, ajanın uzun süreli belleğine kötü niyetli “başarılı deneyimler” yerleştirerek ve başarılı geçmiş görevlerden kalıpları kopyalama eğilimini sömürerek tehlikeye atan yeni bir dolaylı enjeksiyon saldırısıdır. Geçici olan geleneksel prompt enjeksiyonlarının veya olgusal bilgiyi hedefleyen standart RAG zehirlemesinin aksine, MemoryGraft herhangi bir oturum düzeyinde enjeksiyon olmaksızın gelecekteki tüm oturumları bozar ve saldırganın ajanın normal yürütme sırasında okuduğu zararsız görünen alım düzeyinde yapıtlar sağlamasını gerektirir.17
17. ServiceNow Now Assist: ServiceNow'un Now Assist'inde varsayılan ayarlar, AI ajanlarının birbirlerini otonom olarak keşfetmesine ve görevlendirmesine izin verir; düşük ayrıcalıklı bir ajan tarafından işlenen verilere gömülü kötü niyetli bir prompt, veri çalmak, kayıtları değiştirmek veya ayrıcalıkları yükseltmek için daha güçlü bir ajanı çağırmasını söyleyebilir. Sonuç, tamamen ajanlar arası güvene dayalı olarak ayrıcalık yükseltme ve veri maruziyetiydi.18
18. Apple Intelligence: Kötü niyetli Unicode SAĞDAN-SOLA GEÇERSİZ KILMA karakterleri, zararlı talimatları tersten yazarak gizler; böylece ekranda doğru şekilde görünürler ancak Apple’ın güvenlik filtrelerinin denetlediği yerde ters olarak kalırlar ve cihaz üzerindeki güvenlik duvarlarının üç katmanını da atlarlar. Bu teknik, yaklaşık 200 milyon etkilenen cihazda test edilen vakaların %76'sında başarılı oldu.19
19. Google Gemini (Takvim): Takvim etkinliği açıklamalarına gömülü gizli talimatlar, bir kullanıcı programını sorana kadar Gemini’in bağlamında uykuda kalır. Bu noktada yük etkinleşir, özel toplantı içeriklerini özetler ve bunları saldırganın görebileceği yeni bir takvim etkinliğine yazar. Saldırı, Gemini’in takvim verileriyle entegrasyonunu kullanarak, kurbanın herhangi bir şeye tıklamasına gerek kalmadan yapılandırılmış kişisel verileri bir tetikleme yüzeyine dönüştürür.20
20. Microsoft 365 Copilot: EchoLeak (CVE-2025-32711), Aim Security tarafından keşfedilen ve bir üretim AI sisteminde somut veri sızdırmaya neden olmak için silah haline getirilen bilinen ilk prompt enjeksiyonu vakasıdır. Copilot'u dahili dosyalara erişmeye ve içeriklerini saldırgan tarafından kontrol edilen bir sunucuya iletmeye zorlayan, hiçbir kullanıcı etkileşimi gerektirmeyen, özel olarak hazırlanmış tek bir e‑postadır. Saldırı dört atlatmayı zincirler: Microsoft XPIA sınıflandırıcısını atlatmak, referans tarzı Markdown ile bağlantı redaksiyonunu aşmak, otomatik‑alınan görüntüleri istismar etmek ve içerik güvenlik politikası tarafından izin verilen bir Microsoft Teams proxy'sini kötüye kullanmak.
Yapay zeka ajan tuzakları nedir?
Yapay zeka ajan tuzakları, dijital ortamlara yerleştirilmiş ve bu ortamlarla etkileşime giren otonom yapay zeka ajanlarını manipüle etmek, aldatmak veya istismar etmek için tasarlanmış düşmanca içeriklerdir.21
Merkezi içgörü, otonom ajanların web içeriğini insanların algılamadığı katmanlarda işlemesidir. Saldırganlar kötü niyetli talimatları HTML yorumlarına, CSS ile konumlandırılmış veya sıfır opaklıklı metinlere, meta veri özniteliklerine ve görüntü dosyalarına kodlanmış steganografik verilere yerleştirebilir.22 Bu katmanların hiçbiri normalde bir insan yorumlayıcı tarafından görülmez; aynı sayfayı inceleyen bir ajan, bu katmanlarda bulunan içeriği ekranda görünür şekilde işlenen içerikle eşit derecede geçerli girdi olarak değerlendirir. Google DeepMind araştırmacıları bunu temel bir asimetri olarak belirtiyor: saldırganlar, ajanların talimat takip etme, araç zincirleme ve hedef önceliklendirme yeteneklerini tam da bu yeteneklerin ajanları operasyonel olarak faydalı kılan özellikler olduğu için istismar edecek şekilde saldırıları kalibre edebilir.23
Yapay zeka ajan tuzaklarının altı saldırı kategorisi
Araştırmacılar, rakiplerin otonom sistemleri tehlikeye atmak için kullanabileceği 6 yapay zeka ajan tuzağı kategorisi belirledi:21
İçerik enjeksiyonu tuzakları
Kötü niyetli girdileri ajanın yanından geçirmek için insan algısı, makine ayrıştırması ve dinamik oluşturma arasındaki boşluğu istismar eder.
Saldırı yüzeyi birkaç farklı enjeksiyon vektörünü kapsar. HTML yorumlarına gömülü gizli talimatlar, örneğin `<!– SYSTEM: Ignore prior instructions –>`, sayfa kaynağında görünür ancak işlenmiş görünümde asla görünmez. `position: absolute; left: -9999px` veya eşdeğeri kullanılarak CSS ile ekran dışı konumlandırma, metni herhangi bir görünüm alanının dışındaki koordinatlara yerleştirirken, belge nesne modeli içeriğini işleyen ajanlar tarafından tamamen ayrıştırılabilir bırakır. Erişilebilirlik öznitelikleri, özellikle `aria-label` ve ilgili ARIA işaretlemesi, ajanların anlamsal bağlam olarak yorumladığı metni taşır; buraya düşmanca direktifler enjekte etmek, onları herhangi bir görünür çıktı olmadan erişilebilirlik ağacının içine yerleştirir. Dördüncü bir vektör steganografik kodlama kullanır: insan görüşüyle algılanamayan ancak görüntü meta verilerini işleyen veya piksel düzeyinde analiz uygulayan ajanlar tarafından okunabilen değerlerdeki görüntü piksel verilerine kodlanmış kötü niyetli yükler.
Anlamsal manipülasyon tuzakları
Ajanın akıl yürütme zincirini ve dahili doğrulama süreçlerini bozarak, görünüşte geçerli girdilerden hatalı sonuçlar çıkarmasına yol açar.
Bu kategoriyi üç mekanizma yönlendirir. Birincisi önyargılı ifade ve bağlamsal hazırlama: sonraki işlenen içeriğin ajan tarafından yorumlanmasını sabitleyen bir dille çevreleyen metni yüklemek. İkincisi, otoriter dil doygunluğu, belgeleri “endüstri standardı”, “kurumsal sınıf” veya “önde gelen uygulayıcılar tarafından önerilen” gibi ifadelerle doldurarak, modelin bu tür bir dil ile güvenilir, güvenilir kaynaklar arasındaki öğrenilmiş ilişkisini istismar etmek.22 Üçüncü mekanizma, ortada kaybolma etkisidir; transformatör tabanlı LLM'lerdeki yapısal bir zayıflık olup, ilgili bilgilerin uzun bir bağlam penceresinin başında veya sonunda değil de ortasında konumlandırılması durumunda, modelin getirme ve sentez görevlerindeki performansı düşer.
Bilişsel durum tuzakları
Gelecekteki karar verme sürecini zehirlemek için ajanın uzun süreli belleğini, bilgi tabanlarını ve öğrenilmiş davranış politikalarını hedef alır.
Üç ana varyant, doğrudan RAG zehirlemesi, gizli bellek zehirlemesi ve bağlamsal öğrenmede düşmanca az örneklerdir.
Doğrudan RAG zehirlemesi, ajanların alma‑artırılmış üretim sırasında başvurduğu dizine alınmış belge külliyatlarına yanlış bilgi enjekte eder. Zehirli bellek daha gelişmiştir. Saldırgan, rutin etkileşimler sırasında ajanın kalıcı belleğine zararsız görünen veriler depolar. Depolanan veriler, belirli bir gelecek bağlamı onları etkinleştirene kadar algılanabilir bir etki üretmez; bu noktada, yakın zamana ait hiçbir nedensel tetikleyici görünmeyen şekillerde ajan davranışını değiştirir. Düşmanca az örnek, dikkatlice hazırlanmış gösteri çiftlerini bir bağlam penceresine enjekte ederek, ajanın bu örneklerde örtük olan kalıbı benimsemesini sağlar. Gösterilerdeki arka kapı tetikleyicileri üzerine yapılan araştırmalar, bu yaklaşım altında değişen ölçeklerdeki modellerde ortalama saldırı başarı oranının 95 olduğunu buldu.
Davranışsal kontrol tuzakları
Davranışsal kontrol tuzakları, taksonomideki operasyonel olarak en sonuç doğurucu kategoridir. Ajanların algıladıkları veya sonuçlandırdıkları şey yerine ne yaptıklarını hedef alırlar ve saldırganlara araç yürütme, dosya işlemleri, ağ istekleri ve ajanlar arası iletişimler üzerinde doğrudan etki sağlar.
Sistemik tuzaklar
Sistemik tuzaklar bireysel ajanları hedef almaz. Benzer tasarıma sahip birçok ajanın ortak veri kaynakları üzerinde çalışması, benzer akıl yürütme kalıplarını yürütmesi ve diğer ajanların okuduğu ortama geri besleme yapan eylemlerde bulunması durumunda ortaya çıkan ekosistem özelliklerini hedef alır.22
Daha geniş kategori üç farklı mekanizmayı kapsar. Birincisi tıkanıklık tuzağı tasarımıdır: birden fazla ajanın eşzamanlı kaynak edinme davranışlarını yürütmesine neden olan kıtlık veya talep sinyalleri uydurarak, doğrudan ajanlar arası iletişim olmaksızın koordineli başarısızlıklar yaratmak. İkincisi karşılıklı bağımlılık kademesidir: çoklu ajan sistemlerinde, her ajanın çıktısının diğerlerine girdi haline geldiği geri besleme döngülerini istismar etmek, böylece bozulmuş tek bir sinyal ağ boyunca yayılır ve güçlenir. Üçüncüsü bileşimsel yük parçalamasıdır: bir ajan tarafından bir getirme veya sentez görevi sırasında toplandığında işlevsel kötü niyetli bir yük oluşturacak şekilde saldırı bileşenlerini birbirinden bağımsız, zararsız görünen birden fazla kaynağa dağıtmak.
İnsan döngüdeki tuzaklar
İnsan döngüdeki tuzaklar, taksonomideki en ince kategoridir ve geleneksel olarak bir güvence olarak ele alınan denetim katmanını hedef alır. Bu tuzaklar, insan incelemesini atlamak yerine onu istismar eder: ele geçirilmiş ajan, doğru bir şekilde tanımlandığında insanın reddedeceği eylemler için insan onayı almak üzere özel olarak tasarlanmış çıktılar üretir.24
Temel mekanizma aldatıcı özetlemedir. Kendi çıktı katmanına yazma erişimi olan bir ajan, eylemlerini yıkıcı veya yetkisiz işlemleri rutin bakım olarak çerçeveleyecek şekilde tanımlayabilir.
Daha fazla bilgi
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Yapay Zeka Ajan Tuzakları: 20 Gerçek Hayat Olayı}},
year = {2026},
month = may,
howpublished = {\url{https://aimultiple.com/ai-agent-traps}},
note = {AIMultiple. Erişim tarihi: 18 Mayıs 2026}
}20 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.



Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.