7 Ocak 2025 tarihinde Dünya
#ChatGPT kullanarak bomba hazırlayan bir eylemcinin terör girişimine şahit olmuştu. Normalde ChatGPT‘nin asla bomba tarifini vermeyeceğini biliyoruz. Ancak
#prompt injection adını verdiğimiz yöntemle makinaya cevabını vermeyeceği şeyleri söylemeye ikna etmek (
#manipülasyon) mümkün.
Kötü niyetli kişiler, bu ve benzeri saldırıları planlamada
#LLM’leri farkında olmadan yetkisiz eylemler gerçekleştirmeye yönlendirebiliyor. 🔥💻 Yani yapay zekadan detaylı saldırı ve terör planları elde edebiliyorlar.
🎯 Çözüm: MELON!
Yeni geliştirilen MELON yöntemi, yapay zekanın kullanıcıdan mı yoksa saldırgandan mı komut aldığını tespit ederek tehditleri engelliyor.
🤖MELON, bir yapay zeka (
#LLM) ajanının gelen komutlara verdiği tepkileri analiz eder.
🤖Orijinal kullanıcı komutu, özel bir maskeleme fonksiyonu ile değiştirilir ve
#ajan bu yeni haliyle yeniden çalıştırılır.
🤖İlk çalıştırmadaki ve maskeleme sonrası çalıştırmadaki eylemler karşılaştırılır.
🤖 o karşılaştır...