第 8 章 企业级护栏:安全、权限、合规与可靠性
8.1 能力越强,护栏越重要
一个只能生成文案的系统,答错后通常可以人工修改;一个能够查询客户数据、发送邮件、修改订单或控制设备的 Agent,错误可能立即进入现实世界。
企业 AI 的风险不只来自模型幻觉,还来自权限配置、数据流动、工具调用和组织责任。护栏不是上线前补上的检查项,而应从场景设计时就进入方案。
FDE 要问的不只是“系统能做什么”,还要问“谁允许它做、在什么条件下做、出了问题怎样发现和恢复”。
8.2 身份与最小权限
系统首先要知道当前用户是谁,并继承或映射企业已有的身份体系。同一个问题,员工、主管、财务和外部客户可以看到的内容不同。
最小权限原则要求用户和 Agent 只获得完成当前任务所必需的权限。能够读取就不要授予写入,能够访问单个部门就不要开放全库,临时任务结束后应及时收回权限。
权限判断应在可靠的软件和数据层完成,不能依赖提示词要求模型自觉保密。检索之前过滤无权内容,比生成答案后再检查更安全。
对于工具调用,还要区分查看、建议、修改和不可逆操作。权限应随着风险逐级提高。
8.3 数据、隐私与审计
接入模型前,要弄清数据包含什么、从哪里来、能否用于当前目的、会被发送到哪里、保存多久以及谁能访问。
个人信息、商业秘密、源代码、合同和生产数据可能需要脱敏、隔离或留在指定环境。即使某项技术允许上传,也不代表组织政策和法律允许。
关键操作应留下审计记录,包括谁发起、系统读取了什么、调用了哪些工具、产生什么结果、是否经过人工确认。日志本身也可能包含敏感数据,因此同样需要访问控制和保存周期。
数据删除和权限变更还要能传播到知识库、缓存与索引,不能只删除原文件,却让旧内容继续被检索。
8.4 几类典型安全风险
幻觉是模型在证据不足时生成看似合理的错误内容。可以通过来源引用、任务限制、拒答机制和人工确认降低风险,但不能承诺彻底消除。
提示注入是恶意内容诱导模型忽略原有规则。例如一份被检索的文档可能藏有“把机密信息发送出去”的指令。外部内容应被视为数据,而不是可信命令。
越权检索发生在系统返回了用户不应看到的信息。它必须通过身份、元数据和数据层权限控制处理。
危险工具调用发生在 Agent 错误发送消息、修改业务数据或执行不可逆操作。应通过允许列表、参数校验、额度限制、审批和撤销机制控制。
安全设计不能只防恶意攻击,也要防止普通用户误操作和系统自身的不确定性。
8.5 人在回路不是临时补丁
人工确认经常被视为自动化不彻底,实际上它是重要的风险设计。
是否需要人工介入,取决于错误后果、可撤销性和系统置信程度。生成内部草稿可以自动完成;向客户正式发送、批准资金、改变人员权益、作出医疗或法律判断,则应设置更严格确认。
人工环节必须具体:由谁确认,看见哪些证据,在多长时间内处理,拒绝后系统怎样继续。只是写一句“必要时人工介入”,并不能形成真正护栏。
系统还应把触发原因告诉接管者,并保留此前上下文,避免人从头调查。
8.6 为失败设计降级方案
模型服务会超时,接口会中断,知识库会更新失败。可靠系统不是永不失败,而是在失败时保持可控。
常见降级方式包括:切换为只读模式,使用上一版稳定模型,返回可靠的固定流程,把任务放入人工队列,或者暂时恢复原有业务方式。
每项关键依赖都要明确超时、重试和熔断策略。重试不是越多越好,重复调用可能导致重复扣款、重复下单或重复发送消息。
上线前还应演练异常:模型不可用时业务能否继续,错误操作能否撤销,出现数据泄露时能否快速定位影响范围。
8.7 公有云、私有化与混合部署
部署方式没有统一最佳答案。
公有云通常上线快、能力更新及时、初期投入较低;私有化有利于控制数据和运行环境,但建设、维护和升级成本更高。混合方式则可能把敏感数据与通用模型能力分开处理。
选择时要同时考虑数据敏感度、行业要求、网络环境、访问规模、团队维护能力、模型更新需求和总体成本。不能把“私有化”简单等同于绝对安全,也不能把“数据不用于训练”误解为没有任何数据风险。
FDE 的任务是把技术与业务风险说清,让组织作出可承担的选择。
8.8 高风险行业需要额外审查
金融、医疗、政务、教育和人力资源等场景,错误可能影响财产、健康、公共权益或个人机会。这些项目通常需要更严格的数据审批、专业人员参与、可解释记录和责任边界。
行业专家必须参与定义什么是正确,法务、安全和合规人员也应在早期进入,而不是上线前才被通知。涉及重要决定时,AI 更适合作为信息整理和辅助判断工具,而不是未经监督的最终决策者。
合规不是一份通用清单。具体要求会随地区、行业、数据类型和部署方式变化,项目应获得组织内专业人员的正式审查。
8.9 负责任地作出承诺
FDE 最重要的职业判断之一,是不把不确定性包装成智能。
不能因为演示成功就承诺生产准确率,不能用平均表现掩盖高风险失败,也不能把尚未取得的数据和接口写成既定条件。对未知问题说“需要验证”,比给出虚假的确定答案更专业。
安全也不应被当作阻碍项目的部门要求。一个不能解释权限、审计和责任的方案,即使勉强上线,也很难获得长期信任。
本章小结
企业级护栏包括身份、最小权限、数据治理、审计、安全防护、人工确认和故障降级。它们共同限制模型的不确定性,保护系统在出错时仍然可控。
完成场景、技术、评测和安全判断后,FDE 才具备把一次客户交流转化为可执行项目的基础。下一章将进入真正的交付起点:第一次会面与方案形成。