Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence
TTP-R1 是一个两阶段框架,结合检索增强的监督微调和基于可验证奖励的强化学习,用于从网络威胁情报文本中提取 MITRE ATT&CK 攻击技术。混合检索器将大型标签空间缩小为候选集,微调后的 LLM 学习选择正确的技术,并使用组相对策略优化和分解奖励来直接监督精度和召回率。
发展脉络
- 首次出现Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat IntelligencearXiv cs.CL
- 当前判断该研究针对网络安全领域,将 CTI 文本自动映射到 MITRE ATT&CK 技术,有助于结构化威胁分析。手动标注成本高且不可扩展,自动化方法可提高效率。TTP-R1 结合了检索增强和强化学习,可能推动安全运营中心(SOC)的自动化威胁情报分析。Agent Pulse · 分析
TTP-R1 提出了一种从网络威胁情报(CTI)文本中提取 MITRE ATT&CK 攻击技术的新方法。现有方法存在不足:多标签分类器面临严重的类别不平衡和大型标签空间,而基于 LLM 的方法(检索管道和微调生成器)优化 token 级目标,将技术注释视为序列生成而非集合预测,缺乏对预测技术集合正确性和完整性的直接监督。TTP-R1 通过两阶段框架解决此问题:首先使用混合检索器缩小候选技术集,然后微调 LLM 选择正确技术,最后应用组相对策略优化(GRPO)和分解奖励,直接监督精度、召回率等指标。该方法在 arXiv 上发布,属于研究论文。
TTP-R1 的核心创新在于将技术提取视为集合预测问题,并通过强化学习直接优化集合级指标。分解奖励分别监督精度和召回率,这比传统的 token 级目标更直接。混合检索器结合了多种检索方法,有效缩小了标签空间,降低了分类难度。这种检索约束的策略优化方法可能适用于其他大型标签空间下的信息提取任务。
该研究针对网络安全领域,将 CTI 文本自动映射到 MITRE ATT&CK 技术,有助于结构化威胁分析。手动标注成本高且不可扩展,自动化方法可提高效率。TTP-R1 结合了检索增强和强化学习,可能推动安全运营中心(SOC)的自动化威胁情报分析。
对于安全厂商,TTP-R1 可降低威胁情报分析的人力成本,提高响应速度。对于企业安全团队,自动化提取技术可增强威胁狩猎和事件响应能力。该方法的开源或商业化可能影响安全分析工具市场。
下一步可验证的信号包括:TTP-R1 在公开基准上的性能对比结果,以及是否被集成到实际安全产品中。此外,该方法是否扩展到其他 ATT&CK 战术或相关领域(如恶意软件家族分类)值得关注。