至顶网软件频道消息:谷歌研究人员开发了一种应用人工智能的新方法,可以增强视频会议等多项服务。
该研究与已知的“鸡尾酒会效应(cocktail party effect)”有关。所谓“鸡尾酒会效应”,指的是人的一种听力选择能力,在这种情况下,注意力集中在某一个人的谈话之中而忽略背景中其他的对话或噪音,该效应揭示了人类听觉系统中令人惊奇的能力,即我们可以在噪声中谈话。
同理,谷歌的这项研究可以让人工智能模仿大脑,在一个充满干扰的环境中(例如到处都有其他的人在说话),将注意力集中在一个单独的物体(例如某一个人)的能力。
人工智能模型通常很难以相同的效果调整外部输入,特别是当涉及包含多个声音的音频流时更是如此。这已被证明是语音识别领域的主要挑战,这是当今神经网络的主要应用领域之一。
谷歌表示,其研究人员通过开发一种考虑到不同类型信息的深度学习模型的做法克服了这一障碍:视觉输入。该技术被设计用于处理视频,该人工智能可以分析剪辑中显示的人物的嘴部动作,以使每个人都能与他们发出的声音进行匹配。一旦它建立起了必要的关联关系,模型就可以将单个的语音轨道分开。
教会人工智能有效地完成这项任务并不是一件容易的事。谷歌的研究人员从YouTube上收集了100,000个视频,提取了每个包含每个发言人声音的音频片段,然后将这些片段拼接成具有多个音轨的“合成鸡尾酒会”。该小组使用这个数据集来训练模型,以便在各种条件下都能够将说话者的声音与其他声音分开。
谷歌表示,结果是用户可以点击他们希望听到的人的脸部,并让视频中的其他说话的人自动静音。该技术对这家搜索巨头来说有很多潜在的用途。
对于初学者来说,谷歌可以在YouTube中使用这个人工智能版本,让用户调出剪辑中的一些声音。对于在嘈杂的环境中录制的视频来说,这可能是一个特别大的便利,在这样的环境中有时候会难以听到发言者的声音。
该人工智能也有可能会改善Hangouts和Meet——谷歌的视频会议服务——的用户体验,它能够让会议的参与者更容易地专注于特定的人的语音。该搜索巨头甚至相信这项技术可以应用于医疗领域,例如可以开发出更复杂的助听器。
好文章,需要你的鼓励
OpenAI今日宣布计划为ChatGPT配备新的安全功能,当用户遭遇心理或情感困扰时能提供更有效的帮助。首项更新将专注于GPT-5的路由组件,能检测用户急性困扰并调用推理优化的大语言模型。公司还将推出家长控制功能,允许家长与青少年账户关联,设置年龄适宜的行为规则并禁用特定功能。系统检测到青少年处于急性困扰时会发送通知。OpenAI将与青少年发展、心理健康专家委员会及全球医师网络合作完善这些功能。
北航团队推出VoxHammer技术,实现3D模型的精确局部编辑,如同3D版Photoshop。该方法直接在3D空间操作,通过逆向追踪和特征替换确保编辑精度,在保持未修改区域完全一致的同时实现高质量局部修改。研究还创建了Edit3D-Bench评估数据集,为3D编辑领域建立新标准,展现出在游戏开发、影视制作等领域的巨大应用潜力。
CTERA云文件服务公司发布的2025年数据与云战略调查报告显示,83%在过去两年遭受勒索软件感染的企业成功恢复,仅17%遭受永久数据丢失。调查涵盖美国、欧洲、中东、非洲和亚太地区300名高级IT和安全负责人,所有受访企业均在过去两年内遭遇勒索软件攻击。报告显示80%的领导者将安全视为2025年首要关注点,仅10%企业支付赎金。此外,98%受访者正在部署大语言模型和AI工具。
宾夕法尼亚大学研究团队开发出PIXIE系统,这是首个能够仅通过视觉就快速准确预测三维物体完整物理属性的AI系统。该技术将传统需要数小时的物理参数预测缩短至2秒,准确率提升高达4.39倍,并能零样本泛化到真实场景。研究团队还构建了包含1624个标注物体的PIXIEVERSE数据集,为相关技术发展奠定了重要基础,在游戏开发、机器人控制等领域具有广阔应用前景。