ai-deepfake • arXiv cs.CR

Une nouvelle méthode, BASIS, aborde la menace de sécurité des injections de prompts dans les applications LLM

Une nouvelle méthode, BASIS, aborde la menace de sécurité des injections de prompts dans les applications LLM en réduisant les refus inutiles d'instructions sûres. En analysant le ratio de compétition d'attention (ρ) et en utilisant deux sondes linéaires, la méthode détermine si une instruction peut être traitée en toute sécurité, améliorant ainsi la sécurité et la fonctionnalité.

#prompt injection detection#LLM security assessment#attention mechanism analysis#cascaded gating defense#robustness-aware shielding
Une nouvelle méthode, BASIS, aborde la menace de sécurité des injections de prompts dans les applications LLM

L'injection de prompts représente une menace de sécurité critique pour les applications basées sur les grands modèles de langage (LLM), où les attaquants détournent le comportement du modèle en intégrant des instructions malveillantes dans les données utilisateur ou externes. Les mécanismes de défense traditionnels détectent la présence d'une injection et refusent toute traitement ultérieur, ce qui entraîne un refus excessif et inutile d'instructions sûres. Ce sur-refus entraîne une dégradation de la fonctionnalité et de l'expérience utilisateur, en particulier dans les implémentations robustes de LLM capables de gérer correctement de nombreuses injections.

Des chercheurs de redacted] ont développé [BASIS (Breach-Aware Selective Prompt Injection Shielding), une nouvelle méthode qui aborde ce défi par och Display Aspect Ratio och Display Aspect Ratio (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (PAR) och Display Aspect Ratio och Display Aspect Ratio (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (PAR) och Display Aspect Ratio och Display Aspect Ratio och Display Aspect Ratio och Display Aspect Ratio och Display Aspect Ratio och Display Aspect Ratio och Display Aspect Ratio och Display Aspect Ratio (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") (DAR) för att förhindra att fordon och ansikten förvrängs i bredd.") une stratégie de défense en plusieurs étapes. La méthode utilise le ratio de compétition d'attention (ρ) comme caractéristique clé pour entraîner deux sondes linéaires clairsemées : une sonde d'existence et une sonde de violation. La sonde d'existence détermme si une invite contient une injection potentielle, tandis que la sonde de violation prédit si le modèle pourrait résister à une telle injection en fonction de sa robustesse.

BASIS emploie un mécanisme de porte en cascade qui ne refuse une invite que lorsque le modèle est réellement menacé de compromission. En intégrant ces sondes dans une cascade en ligne, la méthode réduit considérablement le nombre de refus erronés d'instructions sûres, améliorant ainsi à la fois la sécurité et la fonctionnalité. Des expériences menées sur quatre tâches différentes et six LLM open-source démontrent que BASIS maintient une détection quasi parfaite des injections tout en réduisant le sur-refus jusqu'à 50 % sur des échantillons d'attaques sûres.

Le cœur technique de BASIS réside dans l'utilisation du ratio de compétition d'attention (ρ), qui mesure la concurrence entre différentes directions d'attention dans l'architecture de transformateur du LLM. En analysant ce ratio, la méthode peut identifier des motifs indiquant une injection potentielle, même lorsque les instructions sont bien formulées et difficiles à détecter avec des méthodes traditionnelles.

Pour les enquêteurs en forensique numérique et les professionnels de la sécurité, BASIS représente une avancée significative dans la sécurité des LLM. La méthode permet des décisions plus précises et contextuelles sur le traitement ou le refus d'une invite, réduisant ainsi le risque de faux positifs et améliorant la traçabilité lors des enquêtes sur les incidents. De plus, cette technique peut être intégrée dans des cadres de sécurité existants pour renforcer la protection contre les attaques sophistiquées ciblant les systèmes basés sur LLM.

Les applications pratiques de BASIS incluent les services de chatbot sécurisés, les systèmes de service client automatisés et les outils analytiques basés sur LLM dans les domaines juridique et médical. En réduisant le sur-refus, les organisations peuvent maintenir un niveau élevé de sécurité sans compromettre l'utilisabilité, ce qui est crucial pour préserver la confiance dans les services basés sur LLM.

La mise en œuvre de BASIS nécessite une phase d'entraînement initiale où les sondes sont calibrées pour des modèles et tâches spécifiques de LLM. Cette phase implique la collecte de données à partir d'instructions sûres et malveillantes, suivie de l'entraînement des sondes pour identifier les motifs distinguant les instructions sûres des menaces potentielles. Ce processus peut être automatisé et intégré dans des protocoles de sécurité existants.

En résumé, BASIS représente une avancée majeure dans la sécurité des applications LLM. En combinant une analyse avancée des mécanismes d'attention avec une stratégie de porte en cascade, la méthode offre une solution robuste et évolutive pour traiter la menace des injections de prompts tout en minimisant les impacts négatifs sur la fonctionnalité.

Conclusions & mesures recommandées

  • Focus forensique : Auditer les journaux système, analyser les artefacts et préserver la chaîne de preuve.
  • Provenance des sources : Synthèse technique vérifiée à partir des avis de arXiv cs.CR.
  • Action recommandée : Mettre à jour les indicateurs (IOC) et vérifier les systèmes exposés.

Sources et références

← Toutes les actualités Outils