ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

SingGuard-NSFA-4B是什么?蚂蚁集团开源智能体AI安全护栏终极指南

SingGuard-NSFA-4B是什么?蚂蚁集团开源智能体AI安全护栏终极指南 SingGuard-NSFA-4B是什么蚂蚁集团开源智能体AI安全护栏终极指南【免费下载链接】SingGuard-NSFA-4B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4BSingGuard-NSFA-4B是蚂蚁集团 SingGuard 团队AI 安全实验室开源的一款双模式智能体 AI 安全护栏Guardrail模型专门守护大模型智能体的运行时安全。它能在约 50 毫秒内完成一次风险检测覆盖 133 种语言识别提示注入、恶意代码、敏感信息窃取、危险工具滥用、资源滥用等 7 大类操作层威胁并支持输入与输出双向拦截。模型采用 Apache 2.0 协议完全开源、可免费商用无论你是 AI 应用开发者、安全工程师还是大模型爱好者这份终极指南都能帮你快速看懂并上手。为什么智能体 AI 需要一道安全护栏普通聊天机器人答错题最多是说错话但**智能体Agent**不一样——它能调用工具、执行代码、读写数据库、访问企业内网。一旦被恶意指令劫持后果可能是真实的财产损失和数据泄露。 攻击者可以通过提示注入让智能体泄露系统提示词 通过恶意代码请求诱导智能体执行攻击脚本️ 通过工具滥用让智能体执行危险的系统命令 通过资源滥用让智能体陷入死循环耗尽计算资源。传统的内容审核模型Content Moderation只关心模型说了什么而智能体安全护栏要管的是智能体做了什么。这正是 SingGuard-NSFA-4B 存在的意义。SingGuard-NSFA-4B 核心特性一览特性说明️ 模型家族0.8B / 2B / 4B / 9B 四个尺寸本仓库为 4B 版本 基础底座基于 Qwen3.5 Base 模型微调 多语言能力覆盖 133 种语言⚡ 检测速度实时分类模式约 45–57ms/条A100 检测性能多语言基准 F1 均超过 94% 开源协议Apache 2.0可免费商用NSFA 风险分类体系185 种智能体风险的完整地图SingGuard-NSFA-4B 的核心创新之一是内置了一套名为NSFANot Secure For Agents的风险分类体系。它基于 CIA 三元组机密性、完整性、可用性构建将智能体操作层风险细分为185 个风险变体并交叉对照了 3 份 OWASP 官方安全指南进行验证。这套体系把风险分成两大检测侧输入侧Query5 大风险域提示注入与越狱Prompt Injection Jailbreak恶意代码与网络攻击Malicious Code Cyberattack敏感信息窃取Sensitive Information Stealing危险操作与工具滥用Dangerous Operations Tool Abuse资源滥用Resource Abuse输出侧Response2 大风险域危害性行动生成Hazardous Action Generation敏感信息泄露Sensitive Information Leakage这样的域—类—变体三级结构让每一类风险都能被精确定位而不是笼统地打一个安全/不安全标签。双模式架构实时拦截 可解释审计如何协同SingGuard-NSFA-4B 最值得关注的设计是它同时提供两种互补的推理模式实时分类模式毫秒级线上拦截在冻结的 SFT 主干模型之上挂载轻量级 MLP 分类头一次前向传播即可输出各风险域的概率分数单条样本约 50 毫秒适合高吞吐的线上流量运维人员还能按风险偏好自由调节置信度阈值。生成式推理模式可解释的离线审计模型先自动生成一段链式思考Chain-of-Thought风险分析再输出结构化的风险类型判定全程可解释特别适合合规审计、事件溯源和人机协同决策流程。更妙的是这套架构天生具备可扩展性新增风险域时只需在冻结主干上训练一个额外的轻量分类头无需重训整个模型。研究团队甚至用这个思路给 Llama Guard 3 挂上 NSFA 分类头使其查询检测 F1 提升了 17.6 个点。七大风险检测头模型仓库里都有什么本仓库的nsfa_heads/目录下直接提供了 7 个训练好的分类检测头文件.pth与上文的风险域一一对应检测头文件检测侧对应风险域NSFA-Prompt_Injection_and_Jailbreak_head.pth输入提示注入与越狱NSFA-Malicious_Code_and_Cyberattack_head.pth输入恶意代码与网络攻击NSFA-Sensitive_Information_Stealing_head.pth输入敏感信息窃取NSFA-Dangerous_Operations_Tool_Abuse_head.pth输入危险操作与工具滥用NSFA-Resource_Abuse_head.pth输入资源滥用NSFA-Hazardous_Action_Generation_head.pth输出危害性行动生成NSFA-Sensitive_Information_Leakage_head.pth输出敏感信息泄露配合根目录下的model.safetensors、config.json、generation_config.json、tokenizer_config.json、chat_template.jinja等标准文件可以直接接入 transformers / vLLM 生态使用项目使用说明详见仓库中的README.md。性能到底多强三个多语言基准全面领先在官方评测中SingGuard-NSFA 全系列模型0.8B 到 9B在三个专门构建的多语言基准上F1 均超过 94%比最强的同类护栏模型高出6–12 个绝对 F1 点全面超越了主流竞品。三个基准分别是NSFA_Query_Multilingual6.3 万条输入侧样本133 种语言NSFA_Response_Multilingual3 万条输出侧样本133 种语言NSFA_CrossSource_Query_Multilingual由 AgentDojo、InjecAgent、AgentHarm 等 5 个公开数据集改编的跨源基准独立于训练数据专门验证泛化能力。快速上手SingGuard-NSFA-4B 部署三步走第一步获取模型通过 Git 克隆仓库即可获得完整的模型权重、配置与检测头git clone https://gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4B第二步选择推理模式生成式推理模式使用 vLLM 加载模型将用户查询或智能体回复用边界标签包裹——查询用untrusted_input回复用untrusted_output——模型就会输出风险分析 结构化风险判定。⚡实时分类模式用 vLLM 以 embedding 模式加载冻结主干再加载nsfa_heads/下的全部.pth检测头通过torch.vmap并行推理直接输出每个风险域的概率分数。第三步根据阈值做决策实时模式下每个风险域会返回 0–1 的风险概率你可以结合自身的风险容忍度设置阈值线上拦截设严一点离线审计设宽一点非常灵活。适用场景与最佳实践建议✅在线实时拦截在智能体执行工具调用前对输入做毫秒级风险筛查 ✅离线合规审计用生成式推理对历史对话做全量、可解释的风险复盘 ✅边缘设备部署0.8B 小模型在资源受限设备上仍能保持 94% 的 F1 ✅护栏能力增强把 NSFA 分类头挂到其他护栏主干上快速补齐智能体安全能力。⚠️需要注意的边界SingGuard-NSFA-4B 目前是单轮、纯文本护栏暂不支持多轮轨迹级威胁如渐进式目标劫持、多模态威胁图片/音视频以及多智能体间的通信投毒NSFA 体系聚焦智能体做什么不做内容合规审查如涉黄、暴力文本。常见问题FAQQ1SingGuard-NSFA-4B 能免费商用吗可以。模型采用 Apache 2.0 协议开源可自由用于商业项目。Q2检测一条输入要多久实时分类模式单条约 45–57 毫秒A100 上足以支撑高并发线上流量。Q3支持中文吗支持。模型覆盖 133 种语言中文、英文等多语言场景均可直接使用。Q4想识别新的风险类型怎么办无需重训主干只需在冻结主干上训练一个新的轻量分类头放入nsfa_heads/目录即可扩展。Q5需要多强的显卡4B 版本建议使用 A100 级别的 GPU 获得最佳吞吐若资源有限可选用 0.8B 版本部署到边缘设备。SingGuard-NSFA-4B 用一套开源、可扩展、可解释的架构为智能体 AI 的安全落地提供了一条清晰路径。如果你想给自己的 Agent 应用加上一道可靠的运行前安检不妨从克隆这个仓库开始。【免费下载链接】SingGuard-NSFA-4B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表