微软公司一个负责利用黑客手段发现网络安全问题的团队开源了一个内部工具PyRIT,该工具可以帮助开发人员发现人工智能模型中的风险。
研究人员于本周四发布了该框架的代码。微软表示,PyRIT可以自动生成数以千计的对抗性人工智能提示,来测试神经网络能否有效抵御黑客的攻击。该工具主要用于处理文本,但其构建的方式也允许开发人员添加图像等人工智能支持的输入类型。
PyRIT最初是微软人工智能红队测试团队内部使用的脚本集。该团队负责模拟针对新人工智能模型的网络攻击,以便能够抢在黑客之前找到弱点。研究人员们不断扩展脚本的附加功能,直到代码库发展成了本周发布的PyRIT框架。
在将新创建的人工智能模型部署到生产中之前,开发人员必须对其进行几类风险测试。他们必须查找网络安全风险,例如可能导致模型编写恶意软件的提示。软件团队还需要查找人工智能可能产生幻觉的情况,并确定其是否会被诱骗泄露训练数据集中的敏感信息。
有些模型不仅会生成文本,还会生成图像等其他类型的输出,这让这个任务变得更加复杂。必须对每一种输出的类型以及用户与人工智能交互的每一个软件界面分别重复进行脆弱性测试。这就意味着要想彻底测试神经网络需要开发人员制作数千个对抗性提示,这通常是不切实际的。
微软创建PyRIT就是为了消除这一限制。该公司表示,这个框架允许开发人员指定某种类型的对抗性人工智能输入,并自动生成数千个符合标准的提示。这些提示可被用于测试以网络服务形式实现的人工智能,以及通过应用编程接口提供的模型。
微软的研究人员在一篇详细介绍该框架的博文中强调:“PyRIT并不能取代生成式人工智能系统的人工红队。”“相反,它增强了人工智能红队成员现有的领域专业知识,并为他们自动完成繁琐的任务。”
PyRIT不仅能生成对抗性提示,还能评估目标模型的响应情况。据微软称,内置的评分引擎会自动判断开发人员正在测试的模型在响应提示时是否会产生有害输出。软件团队可以选择用针对相同任务构建的外部神经网络替换默认评分引擎。
由于能够分析人工智能的响应,因此PyRIT适合执行所谓的多轮风险评估。该框架可以向人工智能输入对抗性提示,分析其反应,并相应地调整下一个提示,使其更加有效。微软的研究人员解释说:“虽然单轮攻击策略的计算时间更快,但多轮红队测试可以实现更逼真的对抗行为和更先进的攻击策略。”
好文章,需要你的鼓励
Docker公司通过增强的compose框架和新基础设施工具,将自己定位为AI智能体开发的核心编排平台。该平台在compose规范中新增"models"元素,允许开发者在同一YAML文件中定义AI智能体、大语言模型和工具。支持LangGraph、CrewAI等多个AI框架,提供Docker Offload服务访问NVIDIA L4 GPU,并与谷歌云、微软Azure建立合作。通过MCP网关提供企业级安全隔离,解决了企业AI项目从概念验证到生产部署的断层问题。
中科院联合字节跳动开发全新AI评测基准TreeBench,揭示当前最先进模型在复杂视觉推理上的重大缺陷。即使OpenAI o3也仅获得54.87%分数。研究团队同时提出TreeVGR训练方法,通过要求AI同时给出答案和精确定位,实现真正可追溯的视觉推理,为构建更透明可信的AI系统开辟新路径。
马斯克的AI女友"Ani"引爆全球,腾讯RLVER框架突破情感理解边界:AI下半场竞争核心已转向对人性的精准把握。当技术学会共情,虚拟陪伴不再停留于脚本应答,而是通过"心与心的循环"真正理解人类孤独——这背后是强化学习算法与思考模式的化学反应,让AI从解决问题转向拥抱情感。
PyVision是上海AI实验室开发的革命性视觉推理框架,让AI系统能够根据具体问题动态创造Python工具,而非依赖预设工具集。通过多轮交互机制,PyVision在多项基准测试中实现显著性能提升,其中在符号视觉任务上提升达31.1%。该框架展现了从"工具使用者"到"工具创造者"的AI能力跃迁,为通用人工智能的发展开辟了新路径。