蚂蚁集团旗下AI安全实验室宣布,其自主研发的内生式大模型安全防护技术SingProbe正式面向全球开发者开源。这项突破性技术通过深度整合大模型底层推理机制,在保障模型性能的同时构建起实时安全防线,为人工智能安全领域提供了全新解决方案。
与传统依赖外部审核模块的安全方案不同,SingProbe创新性地采用内生式防护架构。该技术通过复用基座模型推理过程中的中间层特征,以不到0.5%的额外算力消耗,实现对每个生成token的毫秒级风险评估。这种嵌入式设计不仅避免了外挂式审核带来的延迟问题,更能同步完成意图理解、安全检测和事实核查三重任务,特别适用于医疗咨询、金融决策等高风险应用场景。
技术测试数据显示,SingProbe在保持模型响应速度的前提下,可将有害内容拦截率提升至98.7%,同时将事实性错误识别准确率提高42%。其独特的token级评估机制能够精准定位风险点,在内容生成过程中即时触发阻断机制,有效防止违规信息的传播。该方案已成功适配Llama、GPT、Baichuan等29个主流开源大模型,展现出良好的跨平台兼容性。
作为首个由科技企业完整开源的内生式安全技术体系,SingProbe此次同步开放了核心代码库和预训练检查模型。开发者可通过GitHub平台获取完整技术文档,快速集成到现有大模型架构中。这种开放协作模式有望推动AI安全标准的统一建立,为人工智能技术的可信应用奠定基础。