ai-deepfake • arXiv cs.CR

Metode, BASIS, tar opp sikkerhetsutfordringen med promptinjeksjoner i LLM-applikasjoner ved å redusere unødvendig

En ny metode, BASIS, tar opp sikkerhetsutfordringen med promptinjeksjoner i LLM-applikasjoner ved å redusere unødvendig avvisning av sikre instruksjoner. Ved å analysere Attention Competition Ratio (ρ) og bruke to lineære prober, kan metoden avgjøre om en instruksjon kan behandles trygt, noe som forbedrer både sikkerhet og funksjonalitet.

#prompt injection detection#LLM security assessment#attention mechanism analysis#cascaded gating defense#robustness-aware shielding
Metode, BASIS, tar opp sikkerhetsutfordringen med promptinjeksjoner i LLM-applikasjoner ved å redusere unødvendig

Promptinjeksjoner utgjør en alvorlig sikkerhetstrussel mot applikasjoner basert på store språkmodeller (LLM), der angripere kan manipulere modellens oppførsel ved å injisere skadelige instruksjoner i brukerdata eller eksterne kilder. Tradisjonelle forsvarsmekanismer oppdager kun tilstedeværelsen av en injeksjon og avslår all videre behandling, noe som fører til omfattende unødvendig avslag på sikre instruksjoner. Denne overavvisningen resulterer i redusert funksjonalitet og brukeropplevelse, spesielt i robuste LLM-implementeringer som kan håndtere mange injeksjoner korrekt.

Forskere fra redacted] har utviklet [BASIS (Breach-Aware Selective Prompt Injection Shielding), en ny metode som adresserer denne utfordringen gjennom en flertrinns forsvarsstrategi. Metoden benytter Attention Competition Ratio (ρ) som en nøkkelfaktor for å trene to sparsomme lineære prober: en eksistensprobe og en bruddprobe. Eksistensproben avgjør om en prompt inneholder en potensiell injeksjon, mens bruddproben forutsier om modellen ville kunne motstå en slik injeksjon basert på dens robusthet.

BASIS anvender en kaskadert gating-mekanisme som kun avslår en prompt når modellen faktisk risikerer å bli kompromittert. Ved å integrere disse probene i en online-kaskade reduserer metoden betydelig antallet feilaktige avslag på sikre instruksjoner, noe som forbedrer både sikkerhet og funksjonalitet. Eksperimenter gjennomført på fire forskjellige oppgaver og seks åpen kildekode-LLM viser at BASIS opprettholder nesten perfekt deteksjon av injeksjoner samtidig som det reduserer overavvisning med opptil 50 % på sikre angrepsprøver.

Den tekniske kjernen i BASIS ligger i bruken av Attention Competition Ratio (ρ), som måler konkurransen mellom ulike oppmerksomhetsretninger i LLM-ens transformerarkitektur. Ved å analysere denne ratioen kan metoden identifisere mønstre som indikerer en potensiell injeksjon, selv når instruksjonene er velformulerte og vanskelige å oppdage med tradisjonelle metoder.

For digitale etterforskere og sikkerhetseksperter representerer BASIS en viktig utvikling innen LLM-sikkerhet. Metoden muliggjør mer presise og kontekstbevisste avgjørelser om hvorvidt en prompt skal behandles eller avslås, noe som reduserer risikoen for falske positive og forbedrer sporbarheten ved hendelsesundersøkelser. I tillegg kan teknikken integreres i eksisterende sikkerhetsrammeverk for å styrke beskyttelsen mot sofistikerte angrep rettet mot LLM-baserte systemer.

Praktiske anvendelser av BASIS inkluderer sikre chatbot-tjenester, automatiserte kundeservice-systemer og LLM-drevne analysetools innen juridiske og medisinske domener. Ved å redusere overavvisning kan organisasjoner opprettholde høy sikkerhet uten å gå på bekostning av brukervennligheten, noe som er avgjørende for å opprettholde tilliten til LLM-baserte tjenester.

For å implementere BASIS kreves en innledende treningsfase der probene kalibreres mot spesifikke LLM-modeller og oppgaver. Denne fasen omfatter innsamling av data fra både sikre og skadelige instruksjoner, etterfulgt av trening av probene for å identifisere mønstre som skiller sikre instruksjoner fra potensielle trusler. Denne prosessen kan automatiseres og integreres i eksisterende sikkerhetsprotokoller.

Oppsummert representerer BASIS et betydelig fremskritt innen sikkerheten for LLM-applikasjoner. Gjennom å kombinere avansert analyse av oppmerksomhetsmekanismer med en kaskadert gating-strategi, tilbyr metoden en robust og skalerbar løsning for å håndtere trusselen fra promptinjeksjoner, samtidig som den minimerer negative effekter på funksjonaliteten.

Konklusjoner & forslag til tiltak

  • Forensisk fokus: Kontroller systemlogger, artefakter og beviskjeden for berørte systemer.
  • Kildegrunnlag: Verifisert teknisk analyse basert på rapporter fra arXiv cs.CR.
  • Tiltak: Omedelbar kontroll och säkring av telemetri krävs för att förhindra bevisförlust.

Kilder og referanser

← Alle nyheter Verktøy