Bonnes pratiques pour le moteur AI

Prev Next

Vue d'ensemble

Les contrôles de sécurité AI sont les plus efficaces lorsqu'ils sont déployés de manière à produire des détections précises, compréhensibles et opérationnellement utiles. Le moteur de sécurité AI de Cato aide les administrateurs en analysant en temps réel les invites des utilisateurs, les réponses LLM et les appels d'outils agentiques pour identifier les contenus sensibles, les activités risquées et l'utilisation non sûre de l'AI.

Cet article explique comment déployer et régler le moteur en utilisant des conseils pratiques de sécurité AI. Il aide les administrateurs à déployer le moteur de manière à améliorer la qualité des détections, à minimiser les faux positifs et à rendre le comportement des politiques plus facile à comprendre et à valider. Cet article explique également comment construire une couverture progressivement, afin que les équipes puissent renforcer les contrôles de sécurité AI sans créer de perturbations inutiles pour les utilisateurs ou de surcharge opérationnelle.

Pour plus d'informations, consultez Configuring AI Security Engine Profiles.

Commencer par des objectifs de protection clairs

Définissez un objectif clair de sécurité AI, car il détermine ce que le moteur doit détecter et protéger. Les profils de moteur regroupent les détecteurs pertinents autour d'un résultat de protection spécifique, facilitant ainsi l'ajustement, la validation et la maintenance de la logique des politiques. Les détecteurs identifient les types de données spécifiques, les catégories de contenu et les comportements risqués que le moteur doit inspecter, offrant aux administrateurs un contrôle plus précis sur ce que le profil est destiné à capturer.

Utilisez les familles de détecteurs qui soutiennent les objectifs de protection et opérationnels. Certains détecteurs sont conçus pour identifier des données sensibles telles que des informations personnelles ou du contenu commercial confidentiel, tandis que d'autres se concentrent sur le code, les secrets ou les activités AI non sûres telles que les tentatives de jailbreak et l'injection de prompt. Lorsque ces objectifs sont mélangés ensemble sans un but clair, le comportement du profil devient plus difficile à interpréter et à ajuster.

Une approche meilleure consiste à mapper chaque profil à un cas d'utilisation de protection spécifique. Par exemple, un profil pourrait se concentrer sur les données personnelles et réglementées, un autre sur les secrets techniques et le code source, et un autre sur les usages risqués de l'AI. Cette structure facilite la validation et aide les administrateurs à comprendre pourquoi une interaction spécifique a été signalée.

Construisez des profils ciblés

Les profils de moteur ciblés rendent les détections plus faciles à interpréter et à ajuster, car ils isolent la logique associée à un cas d'utilisation de protection étroit. Cela offre aux administrateurs une visibilité plus claire sur la raison pour laquelle une interaction a été signalée et facilite la validation du comportement des profils à travers différents types de détecteurs, y compris les entités et le contenu.

Les profils peuvent combiner des détecteurs avec une logique ET, OU et EXCLU, ce qui permet aux administrateurs de construire un comportement de détection plus précis. Cette logique est la plus efficace lorsque chaque profil est étroitement ciblé sur un résultat spécifique de protection. Par exemple, un profil axé sur les secrets techniques devrait être réglé indépendamment d'un profil axé sur les informations commerciales sensibles ou les prompts non sûrs.

Il est également important d'ajuster différemment la détection d'entités et la détection de contenu. La détection d'entité identifie d'ordinaire des éléments spécifiques dans l'interaction, tels que les informations d'identification, les identifiants de compte ou d'autres données structurées. La détection de contenu évalue la signification ou le contexte plus large de l'interaction, ce qui nécessite souvent un examen et un ajustement plus soigneux. Considérer ces types de détection comme interchangeables peut rendre les résultats du profil plus difficiles à interpréter. Par exemple, cela peut tromper les administrateurs sur la manière de réviser les détections dans l'Explorateur de session et comment interpréter pourquoi un profil a été apparié.

Pour réduire les faux positifs tout en maintenant une couverture de détection solide, ajoutez des exclusions au profil. Lorsqu'un modèle sûr connu est apparié à plusieurs reprises, excluez le modèle pour préserver l'efficacité globale de la logique de détection. D'autres approches rendent souvent le profil global moins efficace pour détecter de véritables risques.

Régler pour la précision

Un réglage précis aide les administrateurs à améliorer la qualité des détections en réduisant les faux positifs sans rendre le profil moins efficace pour détecter de véritables risques. Lorsque les paramètres de confiance et la logique du profil sont réglés avec soin, le moteur produit des résultats plus exploitables et facilite la révision des détections, l'affinement des politiques et le maintien d'une couverture utile au fil du temps.

Définissez le niveau de confiance selon le degré de certitude requis par les administrateurs avant que le moteur ne signale une interaction, et équilibrez ce choix avec le volume de révision qu'ils sont prêts à accepter.

  • Un niveau de confiance élevé nécessite des preuves plus solides, ce qui améliore la précision et réduit les faux positifs.

  • Un niveau de confiance faible étend le filet, ce qui peut augmenter la couverture mais aussi augmenter la charge de révision.

La qualité de détection devrait être évaluée en utilisant le volume de trafic réaliste et le pourcentage d'interactions signalées, pas juste le nombre total de détections. Un petit nombre de faux positifs peut être acceptable dans un ensemble de trafic volumineux, alors que le même nombre pourrait être significatif dans un petit échantillon. Les administrateurs doivent réviser la fréquence à laquelle les profils se déclenchent par rapport à l'utilisation totale de l'AI et évaluer si le signal résultant est opérationnellement utile.

Un processus de dépannage et de réglage contrôlé facilite la compréhension des ajustements qui ont amélioré ou dégradé les résultats. Avant de changer plusieurs paramètres à la fois, vérifiez la logique du profil, confirmez que les détecteurs sont activés, et révisez les paramètres de confiance sélectionnés.

Testez avec des interactions AI réalistes

Tester de manière réaliste aide les administrateurs à comprendre comment les profils se comportent dans des interactions AI semblables à la production avant que ces profils ne soient utilisés pour l'application ou la révision. Utilisez des invites représentatives, des documents, du code et des formats de secrets réalistes pour les applications AI tierces et les outils AI internes.

Des exemples simplistes peuvent produire des conclusions trompeuses car ils ne reflètent pas comment les utilisateurs interagissent réellement avec des outils AI. Si une invitation de test est trop artificielle, le résultat peut ne pas représenter fidèlement le comportement du moteur en trafic réel. Le moteur de sécurité AI est entraîné sur des données du monde réel, ce qui produit les meilleurs résultats pour les invites d'utilisateur réelles. Validez les profils avec des cas de test qui reflètent des flux de travail réels, des modèles de contenu réalistes, et les interactions AI typiques pour votre organisation.

Les interactions AI sur plusieurs interactions doivent également être incluses dans la validation, car le moteur utilise le contexte de la conversation lors de l'évaluation du risque. Certaines préoccupations de sécurité AI ne deviennent claires qu'à travers plusieurs messages, comme la divulgation graduelle d'informations sensibles, des invites de suivi qui modifient le sens du contenu antérieur, ou des tentatives d'injection de prompts en étapes. Tester uniquement des invites isolées ne montre pas pleinement comment le moteur fonctionnera dans des sessions conversationnelles réelles.

Utilisez le Playground pour une validation itérative

The Playground est la référence pour comprendre comment le moteur détecte les invites dans une session. Il offre aux administrateurs un moyen contrôlé de valider le comportement des profils, de comparer les résultats attendus, et de développer la confiance que la détection fonctionne comme prévu avant de revoir le même comportement dans le trafic AI en direct.

Utilisez le Playground pour tester un profil à la fois avec des invites représentatives et le contexte de la session. Lorsqu'une invite est détectée dans le Playground, le même profil doit détecter cette même invite dans les mêmes conditions. Si l'invite est détectée dans le Playground mais pas dans un chat AI, le problème pourrait ne pas résider dans la logique de détection elle-même. Cela peut indiquer un problème de configuration des règles dans la politique d'Interaction avec l'Utilisateur ou d'Interaction avec les Gardiens.

  1. Commencez par confirmer que le profil détecte le contenu prévu dans le Playground.

  2. Réviser les faux positifs attendus et valider les risques réels détectés.

  3. Après avoir modifié un profil ou un détecteur, répétez les étapes 1 et 2.

Ce processus facilite la séparation du comportement des profils des problèmes de configuration des règles et aide à comprendre quel ajustement a changé le résultat.

Écrire des détecteurs personnalisés soigneusement

Des détecteurs personnalisés bien définis aident les administrateurs à étendre la couverture de sécurité AI à du contenu spécifique à l'entreprise que les détecteurs intégrés peuvent ne pas traiter pleinement. Lorsqu'un détecteur personnalisé est étroitement ciblé sur un besoin clair, il est plus facile à valider, plus facile à régler et moins susceptible de générer des nuisances inutiles.

Regex et les détecteurs de sujet et d'intention personnalisés servent des objectifs différents.

  • Regex est le meilleur pour le contenu qui suit un modèle défini.

  • Le sujet et l'intention personnalisés sont meilleurs pour décrire un type de contenu spécifique, un contexte commercial ou un scénario de risque qui ne peut pas être capturé de manière fiable avec le seul appariement de modèles.

    Note : Le sujet et l'intention personnalisés pour les détecteurs personnalisés seront bientôt disponibles.

Définissez chaque détecteur personnalisé pour un cas d'utilisation clair de protection. Évitez les définitions larges qui tentent de couvrir trop de types de contenu ou de scénarios commerciaux à la fois. Une logique de détecteur étroite offre aux administrateurs un meilleur contrôle sur ce que le profil est conçu pour capturer et rend les détections plus faciles à interpréter et à valider.

Construisez une base pratique et élargissez progressivement

Une base pratique aide les administrateurs à lancer la couverture de sécurité AI plus rapidement sans essayer de résoudre chaque cas d'utilisation en même temps. En commençant par un ensemble ciblé de protections de haute valeur, le déploiement initial est plus facile à valider, à régler et à étendre au fur et à mesure que l'utilisation de l'AI se développe. Dans la plupart des environnements, la base devrait couvrir les risques de sécurité AI et de gouvernance les plus courants. Cela inclut généralement:

  • Données personnelles, secrets et informations d'identification

  • Code source et identifiants techniques

  • Informations commerciales sensibles

  • Pour la sécurité AI pour les applications - Activité AI non sûre, telles que les tentatives de jailbreak, l'injection de prompt, et d'autres modèles de contenu nuisibles

    Note : Ces risques s'appliquent parfois aussi à la sécurité AI pour les utilisateurs

Élargir la couverture par phases après la validation de la base.

  1. Commencez par les objectifs de protection les plus importants.

  2. Confirmez que les profils se comportent comme prévu.

  3. Ajoutez de nouveaux cas d'utilisation à mesure que l'utilisation de l'AI arrive à maturité dans l'organisation.

Cette approche par phases est généralement plus efficace que l'activation d'une couverture étendue d'un coup et aide à réduire le bruit opérationnel et les perturbations inutiles des utilisateurs lors d'un déploiement précoce. Cela donne aux administrateurs le temps de raffiner la logique du profil en fonction des modèles de consommation réels, et garde l'ensemble du profil plus simple à comprendre à mesure que la couverture s'étend.