摘要:红队测试对保障大语言模型(Large Language Model,LLM)的实际应用安全至关重要。然而,现有自动化红队方法忽视了对攻击样本泛化性的提高,且通常仅依赖单一的越狱策略,缺乏对多策略集成和协同机制的探索,难以满足实际的需要。为此,提出一种集成多种越狱策略的LLM自动化红队测试框架。该框架不仅可以使用攻击模型生成语义多样的测试样本,还以模块化方式集成了22种越狱策略,并支持组合加工与动态扩展,从而实现对目标模型的高强度测试;同时,还可基于红队测试过程产生的数据进一步提升目标模型的安防能力。实验表明,该框架生成的测试样本在违规类别覆盖度与文本相似度上均表现优异,攻击成功率达94.29%,较当前最优方法提升17.37个百分点。经对齐优化后,攻击成功率大幅下降至14.00%,充分验证了所提框架在红队测试与模型优化双重目标上的有效性与实用价值。
摘要:知识图谱的引入有效缓解了推荐系统面临的数据稀疏与冷启动问题。然而,现实场景中的协同知识图谱普遍存在长尾分布与交互噪声,传统的图对比学习增强策略多依赖启发式的随机拓扑扰动,容易破坏原有的协同网络结构。为此,本文提出一种面向知识图谱推荐的SVD(Singular Value Decomposition)视图与残差对比学习框架(SVRCL)。该框架在谱空间对全量表征矩阵执行奇异值分解,通过在奇异值分布上直接注入自适应高斯噪声并重构全局对比视图,在保留核心拓扑连通性的前提下缓解长尾交互噪声对表征学习的干扰。此外,针对传统排序优化中梯度信号稀疏的问题,本文设计了基于Sigmoid难度的残差重加权BPR损失,通过动态量化负样本困难度精准分配梯度权重,优化了推荐系统的判别边界。在Last-FM和Book-Crossing两个公开数据集上的实验表明,SVRCL在多项核心性能指标上均优于现有主流基线模型。在高度稀疏的Book-Crossing数据集上,相较于表现次优的LightKG模型,SVRCL的Recall@10、NDCG@10和MRR@10分别提升了12.39%、7.26%和5.71%,且具有更低的时间与显存开销,实现了稀疏场景下推荐鲁棒性与计算高效性的有效平衡。