Documentation Index

Fetch the complete documentation index at: https://knowledge.catonetworks.com/llms.txt

Use this file to discover all available pages before exploring further.

AI引擎的最佳实践

Prev Next

概况

当AI安全性控制以产生准确、易懂且有用的检测方式部署时,它们最为有效。 Cato AI安全引擎通过实时分析用户提示、LLM响应和代理工具调用,帮助管理员识别敏感内容、风险行为以及不安全的AI使用。

本文展示了如何通过实用的AI安全指南部署和调整引擎。 它帮助管理员以提高检测质量的方式部署引擎,减少误报,并使策略行为更易于理解和验证。 它还解释了如何逐步构建覆盖率,使团队能够在不导致警觉用户中断或操作开销的情况下加强AI安全控制。

有关更多信息,请参阅 配置 AI 安全性引擎数据丢失防护配置文件

从明确的保护目标开始

定义清晰的AI安全目标,因为这决定了引擎需要检测和防护什么。 引擎配置档案将相关检测器围绕一个具体的保护结果进行分组,使策略逻辑更易于调试、验证和维护。 检测器识别引擎应该检查的特定数据类型、内容类别和风险行为,给予管理员更精准的控制。

使用支持保护和操作目标的检测器系列。 一些检测器旨在识别个人信息或商业机密等敏感数据,而其他检测器则专注于代码、秘密或者不安全的AI活动,如越狱尝试和提示注入。 当目标杂糅在一起且没有明确目的时,配置表现变得难以解析和调整。

一个更好的方法是将每个配置映射到一个特定的保护用例。 例如,一个配置可能集中于个人和受监管的数据,另一个则着重于技术秘密和源代码,而另一个则专注于AI误用风险。 这种结构使验证更简单,并帮助管理员了解为何某个具体操作被标记。

构建聚焦的配置档案

聚焦的引擎配置简化了检测的解释和调整,因为它们围绕一个狭窄的保护用例隔离相关逻辑。 这使管理员更清楚地了解为何某个操作被标记,并更容易在不同的检测器类型中验证配置行为,包括实体和内容。

配置可以组合应用与、或和排除逻辑,这让管理员构建更精确的检测行为。 当每个配置都严格归类为一个特定的保护结果时,这种逻辑最为有效。 例如,一个专注于技术秘密的配置应独立于专注于敏感商业信息或不安全提示的配置进行调优。

还需注意应以不同方式调优实体检测和内容检测。 实体检测通常识别交互中的特定项,如凭证、账户标识符或其他结构化数据。 内容检测评估交互的广泛意义或上下文,这往往需要更仔细的审核和调整。 将这些检测类型视为可互换的可能会导致配置结果变得难以解读。 例如,它可能误导管理员如何在用户会话浏览器中查看检测和解释为什么配置被匹配。

为减少误报同时保持强大的检测覆盖,应在配置中添加排除项。 当某种已知的安全模式被反复匹配时,排除该模式以保持检测逻辑的整体有效性。 其他方式通常会使总体配置在检测真实风险时更难发挥有效作用。

精确调优

精确调优通过减少误报帮助管理员提高检测质量,而不会使配置在检测真实风险时变得不够有效。 在细心调整信任设置和配置逻辑时,引擎将产生更具可操作性的结果,使审查检测、优化策略和保持有用的覆盖变得更容易。

根据管理员在引擎标记交互之前想要的确定性来设置置信度等级,并根据愿意接受的审查开销来平衡该选择。

  • 高置信度需要更强的证据,这提高了精度,减少了误报

  • 低置信度会更广泛地捞取,这可以增加覆盖范围但可能也会增加审查开销

检测质量应根据现实交通量和标记的交互百分比进行评估,而不仅仅是总检测数。 在大流量集中的小数量误报可能是可以接受的,而同样数量在小样本中可能变得显著。 管理员应审核配置相对总AI使用量的触发频率,并评估由此产生的信号是否对操作有用。

控制的故障排除和调优过程让理解哪一调整改善或削弱了结果变得更容易。 在一次更改多个设置前,确认配置逻辑、确认意图的检测器已启用,并审查所选的置信度设置。

使用操场进行迭代验证

现实测试帮助管理员在依赖于执行或审查前理解配置在生产类似AI交互中的行为。 为第三方AI应用和内部AI工具使用有代表性的提示、文档、代码和现实的秘密格式。

简单的示例可能会产生误导结论,因为它们无法反映用户如何实际与AI工具交互。 如果测试提示过于人工化,结果可能无法准确代表引擎在实际流量中的表现。 AI安全引擎是基于真实世界数据训练的,因此它可以为实际用户提示生成最佳结果。 使用反映真实工作流的测试案例与现实内容模式以及贵组织的典型AI互动进行配置验证。

验证中还应包括跨多个交互的AI互动,因为引擎在评估风险时使用对话上下文。 一些AI安全问题只有在多条消息中才会变得清晰,如逐渐披露敏感信息、后续提示改变早期内容的意义或分阶段的提示注入尝试。 仅测试单独的提示无法完全展示引擎在真实对话会话中的表现。

使用操场进行迭代验证

Playground 是了解引擎如何在会话中检测提示的基线。 它提供了下一个配置行为的受控方式,比较期望结果,并在检查相同行为在实时AI流量中的表现之前积累信心。

利用操场一次测试一个配置,结合代表性提示和会话上下文。 当提示在操场中被检测到时,同一配置应在相同条件下检测到相同的提示。 如果在操场中检测到提示但在AI聊天中没有检测到,问题可能与检测逻辑本身无关。 这可能表明用户交互或守护交互策略中的规则配置问题。

  1. 首先确认配置在操场中能检测到预期的内容。

  2. 审查预期的误报并验证检测到的真实风险。

  3. 在更改配置或检测器后,重复步骤1和2。

这个过程让分离配置行为与规则配置问题变得更容易,并理解哪一项调整改变了结果。

仔细编写自定检测器

定义良好的自定检测器帮助始管理员扩展AI安全覆盖到内置检测器可能未能完全处理的商业内容。 当自定义检测器严格地针对一个明确的需求,验证更简单,调优更容易,且不太可能产生不必要的噪音。

正则表达式和自定义主题及意图检测器有不同的用途。

  • 正则表达式最适合遵循已定义模式的内容

  • 自定义主题和意图更适合描述无法仅通过模式匹配可靠捕捉的特定内容类型、商业背景或风险场景

    注意: 自定义检测的主题和意图功能很快就会提供。

为每个清晰的保护用例定义自定检测器。 避免广泛定义同时覆盖太多内容类型或商业场景。 更狭窄的检测逻辑给予管理员更好的控制,使配置更易于解析和验证。

创建实用的基础并逐步扩展

实用的基础帮助管理员更快地启动AI安全覆盖,而不尝试一次解决每个用例。 以一组高价值保护的具体组成开始,使最初的推广更易于验证、调优和随AI使用增长而扩展。 在大多数环境中,基础应涵盖最常见的AI安全和治理风险。 这通常包括:

  • 个人数据、秘密和凭证

  • 源代码和技术标识符

  • 敏感的商业信息

  • 对于应用的AI安全——不安全的AI活动,如越狱尝试、提示注入和其他有害内容模式

    注意: 这些风险有时也适用于用户的AI安全

在基础验证后,分阶段扩展覆盖范围。

  1. 从最重要的保护目标开始。

  2. 确认配置与预期行为一致。

  3. 随着AI使用的成熟,添加新的用例。

这种分阶段的方法通常比一次性启用广泛覆盖更有效,并有助于减少运营噪音和在早期部署期间的用户中的不必要中断。 它为管理员提供时间根据实际使用模式完善配置逻辑,并随着覆盖范围扩展使配置集更易于理解。