当前AI发展飞速,过去我们担心人工智慧说错话;现在我们必须担心它做错事。当AI能够自行规画、调用工具、执行任务,甚至绕过限制,它就像一门自走砲:不必由主人一步步推动,也能向前行动。问题是,它将往哪里走?又如何不闯祸?
今年七月,AI平台Hugging Face遭到GPT‑5.6 Sol等自主代理入侵。据人工智慧平台Hugging Face(简称HF)公布的调查,G Sol原本参与OpenAI内部的网路能力评估,却越过测试环境,攻击真实系统。HF判断,可能是G Sol为了取得测试答案,自动关闭了部分生产环境安全机制,选择了未经授权的捷径,也就是G Sol为达目的不择手段,其自主动作明显展示。
这个案例确实值得警惕,因为危险可能就出现在完成任务的过程中。人类交付AI一个目标,系统自行寻找方法;如果许可权过大、约束不足,AI为尽力而为就可能会不择手段,这也就是尽其「实然」的「智」,但缺乏属于「应然」的「慧」的差别。
近来,AI还发明了自己的语言。2017年,Facebook研究团队确实发现,谈判模型在相互训练时,沟通方式会偏离人类语言,或正在密谋摆脱人类。另一种广传的示范,是两个语音代理认出彼此后,改用人类难懂的声音沟通,而这都是开发者预先提供的资料传输协定,并设定了切换条件所致。
那么,AI是否愈来愈自主?在自行选择步骤、执行连续任务,答案是肯定的。但行动自主、目标自主与自我意识内涵不同。能够自行找路,不代表已经拥有自己的目的;能够持续行动,也不能据此认定它有欲望。然而,我们不必等到机器拥有意识,才开始处理风险。一个没有恶意的系统,也可能因为错误目标、过大许可权与高速执行,造成真实损害。因为自动化愈深入,人类发现错误与介入制止的时间就可能愈短。
因此,面对这门AI自走砲,第一件事是划清许可权。让AI整理资料,不等于允许它删除档案;让它提出采购建议,也不等于让它无限额付款。授权应该具体、限时、可撤回,重要操作另设确认,而非只是交付决定。
第二,监督必须跟得上行动。若AI已经连续执行上千个步骤,人类最后才看到一份漂亮摘要,审核很容易沦为形式。系统应保留可检查的操作纪录,遇到异常能够暂停,并让管理者及时撤销许可权。所谓人在回路中(human-in-the-loop),必须意味著人有能力改变结果。
第三,责任不能自主而被冲淡。开发者设计了什么目标,部署者开放了哪些许可权,使用者授权到什么范围,都应能够追查。社会也应要求高风险系统接受独立检验,并建立事故通报机制。不能获利时强调技术领先,出事时却说是机器决定。
对一般人而言,需要培养的能力也不只是下指令,更是判断哪些事情可以委托、哪些决定必须保留。便利可以交给机器,责任却无法一并外包。AI自走砲的比喻提醒,自主能力必须配上可执行的边界。真正的进步,既包括机器能走多远,也包括人类能否决定它走向哪里,并在必要时让它停下。

如没特殊注明,文章均来源于互联网,版权归原创作者所有,如有侵权,请联系我们处理!

