Entrées et sorties du modèle
Protéger les données sensibles utilisées par un agent IA
Hermes dispose de plus d'informations que ce que le modèle a besoin de lire : historique, mémoire, résultats d'outils, documents. Chaque envoi au LLM et chaque réponse restituée franchit une frontière de données.
Le contexte d'un agent est une frontière de données.
Par Sécurité Agentique · Publié le
01
Le contexte brut n'a pas à devenir le prompt
L'agent assemble le prompt à partir de sources multiples. Chacune peut contenir plus que nécessaire pour la tâche en cours.
- Données utilisateur
- Profil, préférences, identifiants.
- Documents récupérés
- Extraits complets là où un passage suffit.
- Mémoire
- Informations d'échanges antérieurs, parfois d'autres tâches.
- Résultats RAG
- Candidats non filtrés.
- Résultats d'API
- Objets entiers là où deux champs suffisent.
- Secrets et historique
- Tokens dans des logs, conversation complète.
Minimiser avant d'inspecter : un champ jamais ajouté au prompt n'a pas besoin d'être détecté ensuite.
02
Input guardrails
Le guardrail d'entrée inspecte le prompt final, tel qu'il part vers le modèle, y compris ce que l'agent a ajouté lui-même.
- PII
- PHI lorsque applicable
- secrets
- credentials
- données classifiées
- motifs interdits
- prompt injection
AccuKnox est un exemple de prompt firewall appliqué aux entrées et sorties LLM. Le guardrail peut bloquer, masquer, remplacer par un jeton ou journaliser. Il détecte aussi les tentatives de prompt injection, y compris celles arrivées par un document.
03
Output guardrails
La réponse du modèle est non fiable par défaut, surtout lorsqu'elle alimente une action. Elle peut contenir ce qu'il a lu, ou ce qu'un contenu injecté lui a fait écrire.
- PII et secrets
- Restitués depuis le contexte.
- Données internes
- Qui ne doivent pas sortir vers cet utilisateur ou ce canal.
- Contenu inattendu
- Hors du format ou du sujet attendus.
- Code dangereux
- Quand la réponse doit être exécutée.
- Instructions downstream
- Texte destiné à piloter un outil ou un autre agent.
04
La DLP ne remplace pas l'autorisation
Alice n'a pas accès au salaire de Bob. Une architecture qui compte sur un guardrail pour repérer le salaire après retrieval a déjà laissé la donnée entrer dans le contexte, et dépend d'un motif qu'un salaire ne présente pas toujours.
Le contrôle attendu se place en amont : un PEP devant le RAG écarte le document avant qu'il n'atteigne le modèle. Le mécanisme est décrit dans sécuriser le RAG d'un agent IA, et la décision elle-même dans autorisation fine. La protection LLM reste une couche supplémentaire, pour ce que l'autorisation ne voit pas : secrets égarés, PII dans un document autorisé, injection.
05
Hermes et le document confidentiel
- Input Guard
- Secret collé par l'utilisateur, injection directe.
- Autorisation
- Le document confidentiel n'est restitué que si l'utilisateur y a droit.
- LLM Guard
- PII et secrets dans le contexte assemblé, injection indirecte.
- Output Guard
- Donnée interne ou secret restitué par le modèle.
06
Données corporate et modèles externes
Une entreprise utilise souvent plusieurs modèles : un service externe, un modèle hébergé en interne, un modèle spécialisé. La question devient une politique à quatre dimensions :
- Quel modèle
- Service externe, modèle hébergé en interne, modèle spécialisé.
- Quelle destination
- Région d'hébergement, fournisseur, tenant.
- Quelle classe de donnée
- Publique, interne, confidentielle, personnelle.
- Quel environnement
- Développement, test, production.
Aucune règle universelle ne fixe ces associations : elles dépendent de vos obligations, contrats et classification. L'architecture doit simplement permettre de les appliquer, par exemple en routant ou bloquant l'appel selon la classe de donnée détectée. Les autres frontières de Hermes sont dans l'architecture complète.
FAQ
Questions fréquentes
Peut-on envoyer des données personnelles à un LLM ?
Cela dépend de la base légale du traitement, du modèle utilisé, de son hébergement, des engagements contractuels du fournisseur et de la politique interne. Techniquement, l'architecture doit permettre de décider, par classe de donnée, quel modèle peut la recevoir, et de masquer ou bloquer le reste avant l'envoi.
Comment détecter des secrets dans un prompt ?
Par un guardrail d'entrée qui combine motifs connus (formats de clés, tokens, clés privées), entropie et contexte, appliqué avant l'envoi au modèle. Le contrôle doit porter sur le prompt final assemblé par l'agent, pas seulement sur la saisie de l'utilisateur.
Qu'est-ce qu'un LLM firewall ?
Un composant placé entre l'application ou l'agent et le modèle, qui inspecte les prompts et les réponses : données sensibles, secrets, prompt injection, contenus interdits. Il peut bloquer, masquer, transformer ou journaliser. Il ne décide pas des droits d'accès aux données.
Comment filtrer la réponse d'un LLM ?
Par un guardrail de sortie qui inspecte la réponse avant qu'elle n'atteigne l'utilisateur ou un composant suivant : PII, secrets, données internes, code, instructions destinées à un outil. La réponse est traitée comme non fiable tant qu'elle n'a pas été contrôlée.
Quelle différence entre DLP et autorisation ?
La DLP reconnaît un type de contenu sensible et contrôle sa circulation. L'autorisation décide qui peut accéder à quelle ressource. Un salaire n'a pas de motif DLP universel ; c'est l'autorisation qui doit empêcher qu'il soit récupéré pour quelqu'un qui n'y a pas droit.
Comment empêcher une fuite via un agent IA ?
En réduisant ce que l'agent récupère (autorisation en amont), ce qu'il transmet au modèle (minimisation et guardrail d'entrée), ce qui ressort (guardrail de sortie) et les destinations vers lesquelles il peut envoyer des données (politique sur les outils et le réseau).
Un LLM privé supprime-t-il tous les risques de fuite ?
Non. Il change le risque lié au fournisseur, pas les autres : un utilisateur peut toujours obtenir une donnée qu'il ne devait pas voir, un secret peut ressortir dans une réponse, et une injection peut pousser l'agent à transmettre des données par un outil.
Continuer l'exploration
Où votre agent peut-il réellement agir ?
Cartographions ses modèles, données, outils, API, identités et effets pour identifier les contrôles utiles.