至顶网软件频道消息:谷歌研究人员开发了一种应用人工智能的新方法,可以增强视频会议等多项服务。
该研究与已知的“鸡尾酒会效应(cocktail party effect)”有关。所谓“鸡尾酒会效应”,指的是人的一种听力选择能力,在这种情况下,注意力集中在某一个人的谈话之中而忽略背景中其他的对话或噪音,该效应揭示了人类听觉系统中令人惊奇的能力,即我们可以在噪声中谈话。
同理,谷歌的这项研究可以让人工智能模仿大脑,在一个充满干扰的环境中(例如到处都有其他的人在说话),将注意力集中在一个单独的物体(例如某一个人)的能力。
人工智能模型通常很难以相同的效果调整外部输入,特别是当涉及包含多个声音的音频流时更是如此。这已被证明是语音识别领域的主要挑战,这是当今神经网络的主要应用领域之一。
谷歌表示,其研究人员通过开发一种考虑到不同类型信息的深度学习模型的做法克服了这一障碍:视觉输入。该技术被设计用于处理视频,该人工智能可以分析剪辑中显示的人物的嘴部动作,以使每个人都能与他们发出的声音进行匹配。一旦它建立起了必要的关联关系,模型就可以将单个的语音轨道分开。
教会人工智能有效地完成这项任务并不是一件容易的事。谷歌的研究人员从YouTube上收集了100,000个视频,提取了每个包含每个发言人声音的音频片段,然后将这些片段拼接成具有多个音轨的“合成鸡尾酒会”。该小组使用这个数据集来训练模型,以便在各种条件下都能够将说话者的声音与其他声音分开。
谷歌表示,结果是用户可以点击他们希望听到的人的脸部,并让视频中的其他说话的人自动静音。该技术对这家搜索巨头来说有很多潜在的用途。
对于初学者来说,谷歌可以在YouTube中使用这个人工智能版本,让用户调出剪辑中的一些声音。对于在嘈杂的环境中录制的视频来说,这可能是一个特别大的便利,在这样的环境中有时候会难以听到发言者的声音。
该人工智能也有可能会改善Hangouts和Meet——谷歌的视频会议服务——的用户体验,它能够让会议的参与者更容易地专注于特定的人的语音。该搜索巨头甚至相信这项技术可以应用于医疗领域,例如可以开发出更复杂的助听器。
好文章,需要你的鼓励
Anthropic发布SCONE-bench智能合约漏洞利用基准测试,评估AI代理发现和利用区块链智能合约缺陷的能力。研究显示Claude Opus 4.5等模型可从漏洞中获得460万美元收益。测试2849个合约仅需3476美元成本,发现两个零日漏洞并创造3694美元利润。研究表明AI代理利用安全漏洞的能力快速提升,每1.3个月翻倍增长,强调需要主动采用AI防御技术应对AI攻击威胁。
NVIDIA联合多所高校开发的SpaceTools系统通过双重交互强化学习方法,让AI学会协调使用多种视觉工具进行复杂空间推理。该系统在空间理解基准测试中达到最先进性能,并在真实机器人操作中实现86%成功率,代表了AI从单一功能向工具协调专家的重要转变,为未来更智能实用的AI助手奠定基础。
Spotify年度总结功能回归,在去年AI播客功能遭遇批评后,今年重新专注于用户数据深度分析。新版本引入近十项新功能,包括首个实时多人互动体验"Wrapped Party",最多可邀请9位好友比较听歌数据。此外还新增热门歌曲播放次数显示、互动歌曲测验、听歌年龄分析和听歌俱乐部等功能,让年度总结更具互动性和个性化体验。
这项研究解决了现代智能机器人面临的"行动不稳定"问题,开发出名为TACO的决策优化系统。该系统让机器人在执行任务前生成多个候选方案,然后通过伪计数估计器选择最可靠的行动,就像为机器人配备智能顾问。实验显示,真实环境中机器人成功率平均提升16%,且系统可即插即用无需重新训练,为机器人智能化发展提供了新思路。