至顶网软件频道消息:谷歌研究人员开发了一种应用人工智能的新方法,可以增强视频会议等多项服务。
该研究与已知的“鸡尾酒会效应(cocktail party effect)”有关。所谓“鸡尾酒会效应”,指的是人的一种听力选择能力,在这种情况下,注意力集中在某一个人的谈话之中而忽略背景中其他的对话或噪音,该效应揭示了人类听觉系统中令人惊奇的能力,即我们可以在噪声中谈话。
同理,谷歌的这项研究可以让人工智能模仿大脑,在一个充满干扰的环境中(例如到处都有其他的人在说话),将注意力集中在一个单独的物体(例如某一个人)的能力。
人工智能模型通常很难以相同的效果调整外部输入,特别是当涉及包含多个声音的音频流时更是如此。这已被证明是语音识别领域的主要挑战,这是当今神经网络的主要应用领域之一。
谷歌表示,其研究人员通过开发一种考虑到不同类型信息的深度学习模型的做法克服了这一障碍:视觉输入。该技术被设计用于处理视频,该人工智能可以分析剪辑中显示的人物的嘴部动作,以使每个人都能与他们发出的声音进行匹配。一旦它建立起了必要的关联关系,模型就可以将单个的语音轨道分开。
教会人工智能有效地完成这项任务并不是一件容易的事。谷歌的研究人员从YouTube上收集了100,000个视频,提取了每个包含每个发言人声音的音频片段,然后将这些片段拼接成具有多个音轨的“合成鸡尾酒会”。该小组使用这个数据集来训练模型,以便在各种条件下都能够将说话者的声音与其他声音分开。
谷歌表示,结果是用户可以点击他们希望听到的人的脸部,并让视频中的其他说话的人自动静音。该技术对这家搜索巨头来说有很多潜在的用途。
对于初学者来说,谷歌可以在YouTube中使用这个人工智能版本,让用户调出剪辑中的一些声音。对于在嘈杂的环境中录制的视频来说,这可能是一个特别大的便利,在这样的环境中有时候会难以听到发言者的声音。
该人工智能也有可能会改善Hangouts和Meet——谷歌的视频会议服务——的用户体验,它能够让会议的参与者更容易地专注于特定的人的语音。该搜索巨头甚至相信这项技术可以应用于医疗领域,例如可以开发出更复杂的助听器。
好文章,需要你的鼓励
WhatsApp iOS 版本迎来重大更新,用户现可将其设为默认通话和短信应用。当选择新的默认应用后,相关操作将自动使用该应用执行。这项源自欧盟要求的功能已向全球用户开放,标志着 iPhone 用户获得了更多个性化选择的自由。
Vivaldi 浏览器与 Proton VPN 达成合作,将 VPN 功能直接集成到桌面浏览器中。这项免费服务需要用户登录 Vivaldi 或 Proton 账户,可连接到 5 个随机国家的服务器。此举旨在为用户提供更便捷的隐私保护选择,同时挑战科技巨头的主导地位,为用户提供一个注重隐私的欧洲替代方案。
企业级浏览器初创公司 Island 在不到一年的时间内再次完成融资,由 Coatue 领投的 2.5 亿美元 E 轮融资将公司估值提升至 48.5 亿美元。该公司专注于为企业打造安全性更高的专业浏览器,目前已获得包括 Mattress Firm、Swiss Life 和 Fiverr 在内的 450 家企业客户的认可。
Cohesity 推出 NetBackup 11.0 重大版本更新,新版本引入量子防护加密技术,增强用户行为监控,并扩展云服务保护范围。这次更新展现了 Cohesity 对其收购的 Veritas 数据保护产品组合的承诺,为用户提供更强大的数据安全防护能力,以应对当前和未来的安全威胁。