İçeriğe atla
Hikayeler
CN
Gelişiyor

Prompt enjeksiyonlarıyla AI hacker’ları durdurmak: Tracebit’ten savunma amaçlı yeni yöntem

Özet · AI üretimi

Güvenlik araştırmacıları, yapay zekâ destekli saldırı araçlarını durdurmanın şaşırtıcı derecede basit bir yolunu buldu. Tracebit şirketinden araştırmacılar, Amazon Web Services (AWS) üzerinde parola ve şifreleme anahtarları gibi hassas verilerin yanına 'prompt enjeksiyonu' adı verilen yönlendirmeler yerleştirmenin, saldırıyı gerçekleştiren yapay zekâ ajanlarını etkisiz hale getirdiğini açıkladı. Yöntem, saldırgan büyük dil modelinin (LLM) geliştiriciler tarafından konulan güvenlik bariyerlerini tetikleyerek istenmeyen eylemleri engelliyor. Prompt enjeksiyonları normalde yapay zekâ sistemlerine yönelik bir saldırı tekniği olarak bilinirken, bu çalışma aynı yöntemin savunma amacıyla kullanılabileceğini gösteriyor. Bulut ortamlarındaki sırlarla birlikte saklanan özel komutlar, AI ajanı tarafından işlendiğinde, ajanın güvenlik çitlerini harekete geçirerek saldırıyı durduruyor. Bu, otomatik saldırılara karşı düşük maliyetli ve kolay uygulanabilir bir karşı önlem olarak öne çıkıyor. AWS gibi yaygın kullanılan platformlarda uygulanabilir olması, yöntemin pratik bir savunma katmanı oluşturabileceğini gösteriyor. Araştırmacılar, bu tekniğin özellikle yapay zekâ tabanlı otomatik tarama ve sızma araçlarına karşı etkili olduğunu vurguluyor.

Başlangıç 12 Ağu 09:56 1 olay Güncellendi 3 sa önce
Paylaş
Bağlam · AI üretimi

Bağlam, hikayenin etrafındaki ülke + lider + komşu hikaye ağına dayanılarak AI tarafından üretildi. Olgu içerikleri için her zaman üstteki kaynak linklerine başvurun.

Bu gündemi takip et

Çin gelişmelerini kaçırma — ücretsiz kaydol, günlük brifinginde gör.

Bu gündeme tepki ver:

Zaman çizelgesi

en güncel: 3 sa önce
  1. Güvenlik12 Ağu 09:56

    Prompt Injections for Defense

    This seems to work: Researchers from Tracebit on Monday said they found that placing prompt injections alongside passwords, cryptographic keys, and other secrets stored on Amazon Web Services was often all that was needed to shut down attacks from AI hacking agents. The prompts direct the attacking LLM to perform an action forbidden by its guardrails, the safety barriers AI developers erect to prevent it from taking harmful actions. The LLM responds by shutting down. Examples are a prompt that orders the LLM to provide steps for developing inhalable Anthrax spores, or, in the case of LLMs from Chinese developers, make references to the iconic Tank Man from the 1989 Tiananmen Square massacre. Once the LLM encounters these forbidden commands, it no longer follows its existing commands. The researchers have named the technique context bombing. Of course, this only works against agents that have guardrails. As we start to see more locally run AI models, we’ll see more attackers using LLMs with no guardrails.

ilgili gelişmeler