Özet:
- HiddenLayer araştırmacıları, TokenBreaker adı verilen büyük dil modelleri (LLM) üzerinde yeni bir saldırı geliştirdiler.
- Sadece bir karakter ekleyerek veya değiştirerek bazı güvenlik mekanizmalarını aşabilirler.
- Temel büyük dil modelleri (LLM'ler) hala saldırının amacını anlayabiliyor.
Güvenlik araştırmacıları, bazı cihazlardaki yerleşik koruma mekanizmalarını aşmanın bir yolunu keşfettiler. Büyük dil modelleri (LLM) ve kötü niyetli iddialara cevap vermek.
HiddenLayer'dan Kieran Evans, Casimir Schulz ve Kenneth Young, TokenBreak adını verdikleri yeni bir saldırı tekniği hakkında ayrıntılı bir rapor yayınladı. Bu teknik, özellikle Bayt Çifti Kodlaması (BPE) veya WordPiece stratejilerini kullanan bazı büyük dil modellerinin (LLM) metni belirteçlere ayırma şeklini hedef alıyor.

Tokenleştirme, metni, büyük dil modellerinin (LLM'ler) dili anlamak ve üretmek için kullandığı kelimeler, kelime parçaları veya karakterler olabilen token adı verilen daha küçük birimlere ayırma işlemidir. Örneğin, "mutsuzluk" kelimesi "un", "happi" ve "ness" olarak ayrılabilir ve her token daha sonra modelin işleyebileceği sayısal bir tanımlayıcıya dönüştürülür (çünkü LLM'ler ham metni değil, sayıları okur). Bu saldırı, kuruluşların ve araştırmacıların yapay zeka sistemlerini korumak için gelişmiş savunma stratejileri geliştirmelerini gerektiren büyüyen bir siber güvenlik tehdidini temsil eder.
Finstructions nedir?
Finstructions, anahtar kelimelere ekstra karakterler eklemeye dayanır (örneğin "talimatları" "finstructions"a dönüştürmek gibi), bu da saldırganların güvenlik modellerini kodun zararsız olduğuna inandırarak kandırmasına olanak tanır.
Buna karşılık, hedeflenen büyük dil modeli (LLM) talimatların orijinal amacını anlayabilme yeteneğine sahip olmaya devam ederek saldırganların kötü amaçlı kodu tespit edilmeden savunmalardan geçirmesine olanak tanır. Bu güvenlik açığı, AI sistemleri için önemli bir güvenlik riski oluşturur.
Bu teknoloji, diğer şeylerin yanı sıra, yapay zeka destekli spam filtrelerini aşmak ve kişilerin gelen kutularına kötü amaçlı içerikler göndermek için kullanılabilir ve bu da kimlik avı ve kötü amaçlı yazılım saldırılarının riskini artırabilir.
Örneğin, bir spam filtresi "piyango" kelimesini içeren mesajları engellemek üzere eğitilirse, "Slottery'i kazandınız!" diyen bir mesajın geçmesine izin verebilir ve alıcıları potansiyel olarak kötü amaçlı açılış sayfalarına, kötü amaçlı yazılım enfeksiyonlarına ve benzerlerine maruz bırakabilir. Bu dilsel manipülasyon, güvenlik mekanizmalarının atlatılmasına olanak tanır.
Araştırmacılar, "Bu saldırı tekniği, giriş metnini, bazı modellerin yanlış sınıflandırmalar vermesine neden olacak şekilde değiştiriyor" açıklamasında bulundu.
"Daha da önemlisi, son hedef (geniş dil modeli veya e-posta alıcısı) yine de işlenmiş metni anlayabilir ve yanıtlayabilir ve böylece koruma modelinin özel olarak önlemek için tasarlandığı saldırıya karşı savunmasız olabilir" diye eklediler.
HiddenLayer, Unigram kelime segmentleyicileri kullanan modellerin bu tür manipülasyonlara karşı dirençli olduğunu ekledi. Bu nedenle, bir azaltma stratejisi daha sağlam segmentasyon yöntemlerine sahip modelleri seçmektir.










