Wiki Kunskapslexikon Angreppsteknik Jailbreak-Prompting (LLM Jailbreaking)
Angreppsteknik

Jailbreak-Prompting (LLM Jailbreaking)

🔍 Kategori: technique 🏷️ Alias: LLM Jailbreak, DAN Prompt, Jailbreak Prompting, Model Alignment Bypass ⚖️ Forensisk standard
Jailbreak-Prompting (LLM Jailbreaking)
Metoder för att kringgå en AI-modells inbyggda etiska filter och säkerhetsspärrar (alignment) genom hypotetiska scenarier, rollspel eller flerspråkig kodning för att producera otillåtet innehåll.

🔬 Forensisk Betydelse & Utredningsmetodik

Används forensiskt för att undersöka interna prompt-loggar och påvisa uppsåt när användare eller angripare tvingat språkmodeller att generera skadlig kod, desinformation eller överträtt policys.

⚙️ Tekniska Parametrar & Verktygsstöd

  • Forensiska verktyg:
    Garak Promptfoo PyRIT
  • MITRE ATT&CK: AML.T0054 ↗
  • Standarder: NIST AI Risk Management Framework 1.0

📚 Källor & Fördjupning

Alla begrepp Sök incidenter i Intelligence