9月14日,蚂蚁集团AI安全实验室开源大模型内生式安全护栏SingProbe,它复用基座模型推理中的隐藏状态,通过轻量探针逐token实时输出风险信号,额外开销不足0.5%。
主流外挂护栏需在模型前后各做一次完整推理,导致双倍计算成本,且风险内容可能在生成后已被用户看到,其模型容量也远小于基座模型,复杂内容下理解与纠错能力不匹配。
SingProbe直接读取模型内部隐藏态,由仅数百万参数的探针同步完成意图分类、内容安全与幻觉风险判定,实现“边生成边识别”,可在风险内容完整输出前介入拦截。
外挂式仍是行业主流,而SingProbe是首个由大型科技公司开源、适配29个主流模型的完整内生式方案,其token级流式检测也契合蚂蚁正加速布局的医疗大模型等高风险场景的实时监测需求。
