产品派
返回

蚂蚁发布SingProbe:大模型安全检测开销低于0.5%

AI雷锋网2026/9/14 21:22:00
AI 导读

大模型已广泛用于问答、办公和客服等场景,应用既要保证响应速度,也要避免不安全内容与虚构信息及时发现。如何在不明显影响体验的情况下完成安全审核,成为大模型落地的重要问题。

在国家网络安全宣传周期间,蚂蚁AI安全实验室发布内生式安全护栏SingProbe,把安全检测嵌入模型生成流程。它可以在AI输出回答的同时持续给出风险提示,例如识别不当用药建议、虚构文献或不存在的事实,并帮助系统选择中止生成、重新回答等处理方式。

当前常见做法是部署独立的外置护栏模型,对输入或完整输出进行审核。该方案虽然通用,但会增加额外的计算和部署成本;若等回答生成完毕再检测,风险内容可能已经展示给用户,而提高检测频率又会进一步增加运行负担。

SingProbe复用了大模型推理时已经产生的内部信息,通过轻量化模块持续计算风险分数,使安全判断与文本生成同步进行。应用系统可以依据这些信号及时发出告警、终止生成或触发重试,从而减少风险内容暴露时间。

研发团队在Ling-3.0-flash生产环境中的测试显示,SingProbe在解码阶段带来的额外开销低于0.5%。评测结果表明,该模型在回答安全分类和流式安全检测任务上优于选定的公开基线,在幻觉检测任务上与参考基线基本持平。

面向流式输出场景,团队同步推出评测基准SingStreamBench。它重点考察模型从正常回答转向风险内容的具体时刻,既评估护栏能否发现风险,也关注是否过早触发以及发现是否足够及时,以更贴近实际部署需求。

团队还在医疗生成场景中提出SingProbe-Med,持续监测生成过程中的医疗风险,仅在达到触发条件时对局部高风险内容进行解码干预。在AntAngelMed-100B医疗评测中,完整干预纠正了基线模型25.03%原本错误的回答,显示出内生风险信号用于生成控制的应用潜力。

目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并支持SGLang和vLLM推理框架。相关代码、模型与评测基准已同步开源,后续还将扩大对更多开源模型的支持。

大模型安全AI安全开源模型推理

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文