微软公司一个负责利用黑客手段发现网络安全问题的团队开源了一个内部工具PyRIT,该工具可以帮助开发人员发现人工智能模型中的风险。
研究人员于本周四发布了该框架的代码。微软表示,PyRIT可以自动生成数以千计的对抗性人工智能提示,来测试神经网络能否有效抵御黑客的攻击。该工具主要用于处理文本,但其构建的方式也允许开发人员添加图像等人工智能支持的输入类型。
PyRIT最初是微软人工智能红队测试团队内部使用的脚本集。该团队负责模拟针对新人工智能模型的网络攻击,以便能够抢在黑客之前找到弱点。研究人员们不断扩展脚本的附加功能,直到代码库发展成了本周发布的PyRIT框架。
在将新创建的人工智能模型部署到生产中之前,开发人员必须对其进行几类风险测试。他们必须查找网络安全风险,例如可能导致模型编写恶意软件的提示。软件团队还需要查找人工智能可能产生幻觉的情况,并确定其是否会被诱骗泄露训练数据集中的敏感信息。
有些模型不仅会生成文本,还会生成图像等其他类型的输出,这让这个任务变得更加复杂。必须对每一种输出的类型以及用户与人工智能交互的每一个软件界面分别重复进行脆弱性测试。这就意味着要想彻底测试神经网络需要开发人员制作数千个对抗性提示,这通常是不切实际的。
微软创建PyRIT就是为了消除这一限制。该公司表示,这个框架允许开发人员指定某种类型的对抗性人工智能输入,并自动生成数千个符合标准的提示。这些提示可被用于测试以网络服务形式实现的人工智能,以及通过应用编程接口提供的模型。
微软的研究人员在一篇详细介绍该框架的博文中强调:“PyRIT并不能取代生成式人工智能系统的人工红队。”“相反,它增强了人工智能红队成员现有的领域专业知识,并为他们自动完成繁琐的任务。”
PyRIT不仅能生成对抗性提示,还能评估目标模型的响应情况。据微软称,内置的评分引擎会自动判断开发人员正在测试的模型在响应提示时是否会产生有害输出。软件团队可以选择用针对相同任务构建的外部神经网络替换默认评分引擎。
由于能够分析人工智能的响应,因此PyRIT适合执行所谓的多轮风险评估。该框架可以向人工智能输入对抗性提示,分析其反应,并相应地调整下一个提示,使其更加有效。微软的研究人员解释说:“虽然单轮攻击策略的计算时间更快,但多轮红队测试可以实现更逼真的对抗行为和更先进的攻击策略。”
好文章,需要你的鼓励
阿布扎比科技创新研究院团队首次发现大语言模型生成的JavaScript代码具有独特"指纹"特征,开发出能够准确识别代码AI来源的系统。研究创建了包含25万代码样本的大规模数据集,涵盖20个不同AI模型,识别准确率在5类任务中达到95.8%,即使代码经过混淆处理仍保持85%以上准确率,为网络安全、教育评估和软件取证提供重要技术支持。
国际能源署发布的2025年世界能源展望报告显示,全球AI竞赛推动创纪录的石油、天然气、煤炭和核能消耗,加剧地缘政治紧张局势和气候危机。数据中心用电量预计到2035年将增长三倍,全球数据中心投资预计2025年达5800亿美元,超过全球石油供应投资的5400亿美元。报告呼吁采取新方法实现2050年净零排放目标。
斯坦福大学研究团队首次系统比较了人类与AI在文本理解任务中的表现。通过HUME评估框架测试16个任务发现:人类平均77.6%,最佳AI为80.1%,排名第4。人类在非英语文化理解任务中显著优于AI,而AI在信息处理任务中更出色。研究揭示了当前AI评估体系的缺陷,指出AI的高分往往出现在任务标准模糊的情况下。