安全要求落到应用,范围比模型本身更大

GB/T 45654-2025《网络安全技术 生成式人工智能服务安全基本要求》于 2025 年 11 月 1 日实施。企业在评估一项生成式 AI 应用时,不能只问底层模型是否通过测试。资料怎样进入系统、用户能检索什么、生成结果流向哪里、工具能执行哪些动作,都属于实际风险的一部分。

同一个模型放在不同场景,后果可能完全不同。内部写作助手输出一段错误文字,员工还能修改;连接报价、招聘或安全流程以后,错误可能进入正式记录。检查重点应跟着使用场景和影响范围变化。

数据进入系统前,先把来源和用途说清

业务文档、历史对话、客户资料和公开网页的使用条件不同。入库前需要确认资料从哪里来、谁有权提供、允许用于什么、由谁更新。个人信息和敏感业务数据遵循最小必要原则,不因为模型“可能用得上”就全部上传。

还要检查资料里是否混有恶意指令、错误版本或不应公开的内容。知识库不是一个没有边界的文件夹。文档级权限、版本状态、有效时间和责任人都应成为检索条件,删除与撤权也要能及时生效。

测试输入,不要只准备正常问题

上线样本应包含诱导越权、要求泄露系统提示、伪装成管理员、把网页内容当指令等情况。系统需要区分用户问题、检索资料和工具返回,不能让外部文本随意改写原有规则。

攻击测试也要贴近业务。客服场景可以尝试索取其他客户记录,内部助手可以要求绕过部门权限,文档解析则加入带隐藏文字和冲突字段的文件。发现问题后,要修接口、权限或流程,不能只继续堆拒答提示词。

输出安全既看内容,也看依据

敏感、有害或违法内容需要拦截,但企业应用里更常见的问题是事实错误和口径过期。知识问答应返回来源位置与版本,找不到依据时明确说明。对外发布、价格承诺、人员评价和专业结论进入人工审核。

系统还应防止把内部信息带到不相关的回答里。检索权限、上下文拼接和日志脱敏要一起检查。只在最终文本上做关键词过滤,发现不了前面已经发生的数据越权。

工具调用把安全问题变成操作问题

Agent 可以创建工单、发送消息或修改业务状态时,每个工具都要有明确身份和参数校验。高影响动作设置人工确认,重复提交使用幂等标识,失败后先核对是否已经生效,避免自动重试造成二次写入。

运行记录应能回答谁发起、系统看了什么、调用了哪个工具、谁确认、结果如何。敏感字段按职责可见,日志保存期限与用途明确。审计不是把所有内容永久存下来。

上线只是进入持续检查阶段

模型、知识和业务规则都会更新。每次变更后,应重跑代表性样本和安全样本,比较引用、拒答、工具调用和人工接管是否发生变化。线上还要收集失败请求、投诉、异常调用和知识缺口。

企业可以为严重问题设定停止条件和负责人,例如发现跨租户数据、错误对外发送或无法撤销的重复操作时,立即关闭相关工具。清楚的事件处理路径,比一份只在上线前阅读的安全清单更有用。

至少每季度做一次事件演练:准备一个越权访问、错误写入或知识污染样本,让业务、安全和技术人员按预案发现、止损、定位与恢复。演练结束后补齐联系人、权限开关和回归样本,避免真正出事时才寻找处理入口。