蚂蚁开源大模型“安全护栏”SingProbe,边生成边识别风险

作者:大河财立方 发布时间:2026-09-15 06:19:46 浏览:6
蚂蚁集团开源大模型内生式安全护栏SingProbe,复用模型隐藏状态实现边生成边识别风险,额外开销不足0.5%,已适配29个主流模型。

9月14日,蚂蚁集团AI安全实验室开源大模型内生式安全护栏SingProbe,它复用基座模型推理中的隐藏状态,通过轻量探针逐token实时输出风险信号,额外开销不足0.5%。

主流外挂护栏需在模型前后各做一次完整推理,导致双倍计算成本,且风险内容可能在生成后已被用户看到,其模型容量也远小于基座模型,复杂内容下理解与纠错能力不匹配。

SingProbe直接读取模型内部隐藏态,由仅数百万参数的探针同步完成意图分类、内容安全与幻觉风险判定,实现“边生成边识别”,可在风险内容完整输出前介入拦截。

外挂式仍是行业主流,而SingProbe是首个由大型科技公司开源、适配29个主流模型的完整内生式方案,其token级流式检测也契合蚂蚁正加速布局的医疗大模型等高风险场景的实时监测需求。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自m.toutiao.com,作者大河财立方

有问题,请联系客服!http://www.rongyeyun.com/kefu/