ai-deepfake • arXiv cs.CR

Metode, BASIS, håndterer sikkerhedstruslen fra promptinjektioner i LLM-applikationer ved at reducere unødvendig

En ny metode, BASIS, håndterer sikkerhedstruslen fra promptinjektioner i LLM-applikationer ved at reducere unødvendig afvisning af sikre instruktioner. Ved at analysere Attention Competition Ratio (ρ) og anvende to lineære prober, kan metoden afgøre, om en instruktion kan behandles sikkert, hvilket forbedrer både sikkerhed og funktionalitet.

#prompt injection detection#LLM security assessment#attention mechanism analysis#cascaded gating defense#robustness-aware shielding
Metode, BASIS, håndterer sikkerhedstruslen fra promptinjektioner i LLM-applikationer ved at reducere unødvendig

Promptinjektioner udgør en alvorlig sikkerhedstrussel mod applikationer baseret på store sprogmodeller (LLM), hvor angribere kan manipulere modellens adfærd ved at indsætte skadelige instruktioner i brugerdata eller eksterne kilder. Traditionelle forsvarsmekanismer opdager kun tilstedeværelsen af en injektion og afviser herefter al videre behandling, hvilket fører til omfattende unødvendig afvisning af sikre instruktioner. Denne overafvisning resulterer i nedsat funktionalitet og brugeroplevelse, især i robuste LLM-implementeringer, der kan håndtere mange injektioner korrekt.

Forskere fra redacted] har udviklet [BASIS (Breach-Aware Selective Prompt Injection Shielding), en ny metode, der adresserer denne udfordring gennem en flertrins forsvarsstrategi. Metoden anvender Attention Competition Ratio (ρ) som en nøglefaktor til at træne to sparsomme lineære prober: en eksistensprobe og en brudprobe. Eksistensproben afgør, hvorvidt en prompt indeholder en potentiel injektion, mens brudproben forudsiger, hvorvidt modellen ville kunne modstå en sådan injektion baseret på dens robusthed.

BASIS anvender en kaskadert gating-mekanisme, der kun afviser en prompt, når modellen faktisk risikerer at blive kompromitteret. Ved at integrere disse prober i en online-kaskade reducerer metoden betydeligt antallet af fejlagtige afvisninger af sikre instruktioner, hvilket forbedrer både sikkerhed og funktionalitet. Eksperimenter gennemført på fire forskellige opgaver og seks open-source LLM’er viser, at BASIS opretholder næsten perfekt detektion af injektioner samtidig med, at det reducerer overafvisning med op til 50 % på sikre angrebsprøver.

Den tekniske kerne i BASIS ligger i brugen af Attention Competition Ratio (ρ), som måler konkurrencen mellem forskellige opmærksomhedsretninger i LLM’ens transformerarkitektur. Ved at analysere denne ratio kan metoden identificere mønstre, der indikerer en potentiel injektion, selv når instruktionerne er velformulerede og vanskelige at opdage med traditionelle metoder.

For digitale efterforskere og sikkerhedseksperter repræsenterer BASIS en vigtig udvikling inden for LLM-sikkerhed. Metoden muliggør mere præcise og kontekstbevidste beslutninger om, hvorvidt en prompt skal behandles eller afvises, hvilket reducerer risikoen for falske positive og forbedrer sporbarheden under hændelsesundersøgelser. Derudover kan teknikken integreres i eksisterende sikkerhedsrammeværker for at styrke beskyttelsen mod sofistikerede angreb rettet mod LLM-baserede systemer.

Praktiske anvendelser af BASIS inkluderer sikre chatbot-tjenester, automatiserede kundeservice-systemer og LLM-drevne analyseværktøjer inden for juridiske og medicinske domæner. Ved at reducere overafvisning kan organisationer opretholde høj sikkerhed uden at gå på kompromis med brugervenligheden, hvilket er afgørende for at opretholde tilliden til LLM-baserede tjenester.

For at implementere BASIS kræves en indledende træningsfase, hvor proberne kalibreres mod specifikke LLM-modeller og opgaver. Denne fase omfatter indsamling af data fra både sikre og skadelige instruktioner, efterfulgt af træning af proberne for at identificere mønstre, der adskiller sikre instruktioner fra potentielle trusler. Denne proces kan automatiseres og integreres i eksisterende sikkerhedsprotokoller.

Samlet set repræsenterer BASIS et betydeligt fremskridt inden for sikkerheden for LLM-applikationer. Ved at kombinere avanceret analyse af opmærksomhedsmekanismer med en kaskadert gating-strategi tilbyder metoden en robust og skalerbar løsning til at håndtere truslen fra promptinjektioner, samtidig med at negative effekter på funktionaliteten minimeres.

Konklusioner & forslag til handlinger

  • Forensisk fokus: Gennemgå systemlogger, undersøg centrale artefakter og verificer beviskæden.
  • Kildegrundlag: Verificeret teknisk briefing baseret på rapporter fra arXiv cs.CR.
  • Handling: Omedelbar kontroll och säkring av telemetri krävs för att förhindra bevisförlust.

Kilder og referencer

← Alle nyheder Værktøjer