SafeMind 是怎么工作的
——用开放模型构建自适应 agentic 安全系统
CrowdStrike 与 NVIDIA 合作的核心,不是"把大模型接进安全产品",而是让红蓝双方的 agent 在一个闭环里互相逼迫、持续进化。以下按七张原理图拆解整套机制。
01 · 整体架构:红蓝对抗的闭环
系统由两组 agent 构成。Red Tempest(红队)负责写漏洞利用,内部按 RECON 侦察、ASSAULT 攻击、LOOT 窃取三个模块协作;Blue Solano(蓝队)负责加固检测。双方在中间的 Agent Cyber Environment(agent 网络靶场)中交手。
红队向环境投放攻击模式,蓝队从环境读取遥测并回写检测逻辑与修复方案——这条回路持续运转,就是所谓的"攻防协同演化"。底层由四类数据源供给:CrowdStrike 平台与 MDR 数据、威胁情报、客户提供的数据,以及开源数据源。

- 蓝队内部用 Nemotron 3 Ultra 做编排器,配合遥测分析模块
- 检测规则由定制版 Nemotron 3 Super 生成,这是整套系统里唯一被深度定制的模型
02 · 把通用 agent harness 改造成检测工程专用
一个默认的 agent harness(上下文 → 观察 → 推理 → 行动 的循环)直接拿来写检测规则是不够用的。团队加了六道领域与质量机制,把泛用循环收敛成能产出可用规则的流水线。

- 01 知识库:查表式提供 Falcon 事件 schema、字段名与查询语法 —— 防止模型编造不存在的字段
- 02 接地(Grounding):攻击真值、Falcon 遥测、告警上下文共享同一份任务状态 —— 防止错误关联
- 03 专家工具:需要写或修规则时才调用专用模型 —— 加速专家逻辑
- 04 Lint:检查语法、环境绑定、脆弱字符串与可移植性 —— 拦截脆弱规则
- 05 回放(Replay):拿已捕获的遥测回测,零有效命中即判失败 —— 拦截不触发的规则
- 06 独立 QA:由无共享上下文的"新鲜视角"评审行为与盲区 —— 捕捉语义缺口
03 · 职责分离:编排归 Ultra,写规则归 Super
这是架构上最关键的一个设计决策。Nemotron 3 Ultra 拥有整条防御工作流:重建攻击序列 → 规划检测工程步骤 → 调用工具与受限专家 → 检查结果并迭代。它不直接写规则。
只有当确实需要撰写或修复一条检测规则时,才调用 CrowdStrike 定制的 Nemotron 3 Super 作为"受限专家工具",产出可执行的 CQL 规则及理由,然后交回 Ultra。候选规则再依次通过 Lint、Replay、独立 QA 三道质量门;任一门未过,由 Ultra 负责修正。

04 · Super 的三段式后训练
定制版 Super 从一个基于 Nemotron 3 Super 的 NL2LogScale 模型出发,经过 CPT → SFT → RLVR 三个阶段。

- CPT(持续预训练):灌入额外的网络安全知识库,补齐领域知识
- SFT(监督微调):9,349 条训练样本,分两类任务 —— CRT 撰写 4,559 条(48.8%)、CRT 修复 4,790 条(51.2%)。撰写样本由 1,520 条源规则经 Super 扩展成三种请求风格;修复样本来自 59 种程序化生成的错误类型,配合 LogScale 返回的真实引擎报错
- RLVR(可验证奖励强化学习):用 NeMo Gym 在 LogScale 中真实执行生成的 CQL,以可验证结果给奖励
05 · 奖励设计:只认查询结果,不认语法正确
RLVR 的关键在于奖励信号怎么定义。这里的做法是:语法校验只是一道门,不是最终奖励。
策略模型生成或修复 CQL 后,NeMo Gym 在 LogScale 中校验。若语法报错,把查询和引擎错误一起回传给策略,最多重试 5 轮;5 轮仍未修好则奖励为 0。若语法通过,则把生成查询与黄金查询同时执行,用两者返回事件集合的 F1 重叠度作为可验证奖励,最后由 NeMo RL 中的 GRPO 更新策略权重。

06 · 回测结果:调优整条开放流水线,检测率提升 2.5×
衡量指标是"生成的规则中能检出该次录制攻击的平均比例"。仅用 Nemotron 3 Ultra 加基础 harness 时为 16.5%;换成"Ultra + 调优后的 harness + 定制 Super"的完整开放流水线后升至 41.9%。

07 · 实弹验证:规则质量比规则数量更重要
把回测命中的规则原样部署,对同一场景族的 8 次全新攻击做实弹测试。开放流水线部署了 11 条规则,商用前沿系统部署了 35 条。

- 至少检出一次新攻击:开放流水线 5/11(45%) vs. 前沿系统 10/35(29%)
- 保持静默(无误报):4 条 vs. 9 条
- 黄金规则(检出新攻击 + 保持静默 + 通过独立行为评审):开放流水线 3 条,前沿系统 0 条
- 每条部署规则平均检出的新攻击数:2.6 vs. 1.1
- 黄金规则覆盖的攻击:8/8 vs. 0/8
核心结论
- 闭环比单点更重要:红蓝 agent 在靶场里持续对抗,检测能力才能跟上攻击演化
- 分工优于全能:通用推理(Ultra)与领域撰写(Super)解耦,各自可独立优化
- 奖励要可验证:让规则在真实查询引擎里跑出结果来评分,而不是让模型自己判断对错
- 开放模型的实际价值:能用自有威胁数据做 CPT/SFT/RLVR、能针对自身环境定制、能检视 agentic 执行轨迹 —— 这三件事闭源模型都做不到
- 少而精胜过多而杂:11 条规则里的 3 条黄金规则覆盖全部 8 次攻击,35 条规则里一条黄金都没有
评论