Entrées et sorties du modèle

Protéger les données sensibles utilisées par un agent IA

Hermes dispose de plus d'informations que ce que le modèle a besoin de lire : historique, mémoire, résultats d'outils, documents. Chaque envoi au LLM et chaque réponse restituée franchit une frontière de données.

Le contexte d'un agent est une frontière de données.

Par Sécurité Agentique · Publié le

01

Le contexte brut n'a pas à devenir le prompt

L'agent assemble le prompt à partir de sources multiples. Chacune peut contenir plus que nécessaire pour la tâche en cours.

Données utilisateur
Profil, préférences, identifiants.
Documents récupérés
Extraits complets là où un passage suffit.
Mémoire
Informations d'échanges antérieurs, parfois d'autres tâches.
Résultats RAG
Candidats non filtrés.
Résultats d'API
Objets entiers là où deux champs suffisent.
Secrets et historique
Tokens dans des logs, conversation complète.

Minimiser avant d'inspecter : un champ jamais ajouté au prompt n'a pas besoin d'être détecté ensuite.

02

Input guardrails

Le guardrail d'entrée inspecte le prompt final, tel qu'il part vers le modèle, y compris ce que l'agent a ajouté lui-même.

  • PII
  • PHI lorsque applicable
  • secrets
  • credentials
  • données classifiées
  • motifs interdits
  • prompt injection

AccuKnox est un exemple de prompt firewall appliqué aux entrées et sorties LLM. Le guardrail peut bloquer, masquer, remplacer par un jeton ou journaliser. Il détecte aussi les tentatives de prompt injection, y compris celles arrivées par un document.

03

Output guardrails

La réponse du modèle est non fiable par défaut, surtout lorsqu'elle alimente une action. Elle peut contenir ce qu'il a lu, ou ce qu'un contenu injecté lui a fait écrire.

PII et secrets
Restitués depuis le contexte.
Données internes
Qui ne doivent pas sortir vers cet utilisateur ou ce canal.
Contenu inattendu
Hors du format ou du sujet attendus.
Code dangereux
Quand la réponse doit être exécutée.
Instructions downstream
Texte destiné à piloter un outil ou un autre agent.

04

La DLP ne remplace pas l'autorisation

Alice n'a pas accès au salaire de Bob. Une architecture qui compte sur un guardrail pour repérer le salaire après retrieval a déjà laissé la donnée entrer dans le contexte, et dépend d'un motif qu'un salaire ne présente pas toujours.

Le contrôle attendu se place en amont : un PEP devant le RAG écarte le document avant qu'il n'atteigne le modèle. Le mécanisme est décrit dans sécuriser le RAG d'un agent IA, et la décision elle-même dans autorisation fine. La protection LLM reste une couche supplémentaire, pour ce que l'autorisation ne voit pas : secrets égarés, PII dans un document autorisé, injection.

05

Hermes et le document confidentiel

UtilisateurGuardrailsentrée / sortieHermesagentRAG + PEPautorisationLLM GuardcontexteLLM1. demande2. Input Guard : inspectée3. recherche4. extraits autorisés seuls5. contexte minimisé6. PII masquées7. réponse8. réponse inspectée9. réponse finale10. Output Guard : contrôlée
1. Utilisateur vers Guardrails : demande. 2. Guardrails vers Hermes : Input Guard : inspectée. 3. Hermes vers RAG + PEP : recherche. 4. RAG + PEP vers Hermes : extraits autorisés seuls. 5. Hermes vers LLM Guard : contexte minimisé. 6. LLM Guard vers LLM : PII masquées. 7. LLM vers LLM Guard : réponse. 8. LLM Guard vers Hermes : réponse inspectée. 9. Hermes vers Guardrails : réponse finale. 10. Guardrails vers Utilisateur : Output Guard : contrôlée.
Input Guard
Secret collé par l'utilisateur, injection directe.
Autorisation
Le document confidentiel n'est restitué que si l'utilisateur y a droit.
LLM Guard
PII et secrets dans le contexte assemblé, injection indirecte.
Output Guard
Donnée interne ou secret restitué par le modèle.

06

Données corporate et modèles externes

Une entreprise utilise souvent plusieurs modèles : un service externe, un modèle hébergé en interne, un modèle spécialisé. La question devient une politique à quatre dimensions :

Quel modèle
Service externe, modèle hébergé en interne, modèle spécialisé.
Quelle destination
Région d'hébergement, fournisseur, tenant.
Quelle classe de donnée
Publique, interne, confidentielle, personnelle.
Quel environnement
Développement, test, production.

Aucune règle universelle ne fixe ces associations : elles dépendent de vos obligations, contrats et classification. L'architecture doit simplement permettre de les appliquer, par exemple en routant ou bloquant l'appel selon la classe de donnée détectée. Les autres frontières de Hermes sont dans l'architecture complète.

FAQ

Questions fréquentes

Peut-on envoyer des données personnelles à un LLM ?

Cela dépend de la base légale du traitement, du modèle utilisé, de son hébergement, des engagements contractuels du fournisseur et de la politique interne. Techniquement, l'architecture doit permettre de décider, par classe de donnée, quel modèle peut la recevoir, et de masquer ou bloquer le reste avant l'envoi.

Comment détecter des secrets dans un prompt ?

Par un guardrail d'entrée qui combine motifs connus (formats de clés, tokens, clés privées), entropie et contexte, appliqué avant l'envoi au modèle. Le contrôle doit porter sur le prompt final assemblé par l'agent, pas seulement sur la saisie de l'utilisateur.

Qu'est-ce qu'un LLM firewall ?

Un composant placé entre l'application ou l'agent et le modèle, qui inspecte les prompts et les réponses : données sensibles, secrets, prompt injection, contenus interdits. Il peut bloquer, masquer, transformer ou journaliser. Il ne décide pas des droits d'accès aux données.

Comment filtrer la réponse d'un LLM ?

Par un guardrail de sortie qui inspecte la réponse avant qu'elle n'atteigne l'utilisateur ou un composant suivant : PII, secrets, données internes, code, instructions destinées à un outil. La réponse est traitée comme non fiable tant qu'elle n'a pas été contrôlée.

Quelle différence entre DLP et autorisation ?

La DLP reconnaît un type de contenu sensible et contrôle sa circulation. L'autorisation décide qui peut accéder à quelle ressource. Un salaire n'a pas de motif DLP universel ; c'est l'autorisation qui doit empêcher qu'il soit récupéré pour quelqu'un qui n'y a pas droit.

Comment empêcher une fuite via un agent IA ?

En réduisant ce que l'agent récupère (autorisation en amont), ce qu'il transmet au modèle (minimisation et guardrail d'entrée), ce qui ressort (guardrail de sortie) et les destinations vers lesquelles il peut envoyer des données (politique sur les outils et le réseau).

Un LLM privé supprime-t-il tous les risques de fuite ?

Non. Il change le risque lié au fournisseur, pas les autres : un utilisateur peut toujours obtenir une donnée qu'il ne devait pas voir, un secret peut ressortir dans une réponse, et une injection peut pousser l'agent à transmettre des données par un outil.

Continuer l'exploration

Où votre agent peut-il réellement agir ?

Cartographions ses modèles, données, outils, API, identités et effets pour identifier les contrôles utiles.