随著AI代理开始接触企业资料、呼叫工具并自行埀行任务,资安事件也不再只是单一模型的漏洞。适逢年度Black Hat大会在美国拉斯维加斯登场,Linux Foundation针对共享AI发现交换机制(Shared AI Findings Exchange,SAFE)发布征求意见书,希望建立一套跨企业通报与共享机制,让个别AI代理发生的资安事件,能转化为整个产业共同使用的防护经验。
SAFE目前由开放安全AI联盟(Open Secure AI Alliance)工作小组起草,参与成员包括NVIDIA、思科、CrowdStrike、Hugging Face及Red Hat等业者。联盟规模目前已超过120个组织,SAFE则仍处于提案及征求意见阶段,尚未成为正式标准。
依照初步构想,SAFE将以保密方式搜集及分析AI资安事件与未遂事件,并建立受影响对象通知机制,同时找出反复发生的控制失效,进一步提出以实际证据为基础的防护建议。核心目标是让企业不必各自面对相同攻击,也能在兼顾机密资讯的前提下,分享威胁情报与防御方法。
这套指引锁定的并不只是AI模型。AI代理还涉及身分与权限、代理协调框架(harness)、外部工具、执行环境、操作纪录及安全评估;只要其中一个环节失守,便可能出现提示词注入、工具投毒、权限滥用或资料外泄。因此,代理型AI的防护不能只靠传统漏洞扫描,而要从代理取得权限、执行任务到留下纪录,全程建立可追踪及可稽核的控制机制。
NVIDIA此次提供的工具横跨代理安全堆叠。其中,NVIDIA Labs Object-Oriented Agent(NOOA)研究框架,可用于测试、追踪及稽核代理行为;NVIDIA OpenShell则从执行环境限制代理可以查看、存取及操作的内容。NVIDIA也针对开放代理技能加入提示词注入与工具投毒扫描、密码学签署及技能卡,让使用者能确认技能来源、功能及发布后是否遭到修改。
模型安全方面,NVIDIA提供NeMo Guardrails、NeMo Anonymizer及NeMo Safe Synthesizer,分别协助企业落实安全政策、保护敏感资料及建立符合隐私要求的合成资料;开源大型语言模型漏洞扫描器Garak,则可在模型发布前检查资料外泄、提示词注入及越狱风险。
联盟其他成员则从不同环节补上防护缺口。Amazon提供代理开发工具Strands Agents及存取控制语言Cedar;微软开源PyRIT、RAMPART及Assert,用于自动化红队测试、重现资安事件及执行安全评估;Red Hat的asago则能将NIST、OWASP及欧盟人工智慧法案等治理要求,直接连结至代理在执行阶段可以采取的行动。
企业实际导入的规模也逐渐放大。CrowdStrike以NVIDIA Nemotron Nano模型进行资安防御微调,内部测试显示,在Falcon LogScale产生调查查询的准确度达96%;Uber开源的代理型AI侦测与回应系统(ADR),目前每日可处理超过20万个代理工作阶段、涵盖3万个端点,并能重建从提示词、推理、工具呼叫到执行结果的完整因果链。
SAFE目前虽仍在征求意见,但业界推动方向已相当明确:当AI代理从提供答案走向直接执行任务,资安机制也必须从单点防护,进一步走向跨企业通报、事件重现及集体防御。
如没特殊注明,文章均来源于互联网,版权归原创作者所有,如有侵权,请联系我们处理!

