至顶网软件频道消息: 3月22日,微软(亚洲)互联网工程院宣布率先推出新一代的语音交互技术:全双工语音交互感官(Full-duplex Voice Sense),并已完成产品化落地。与既有的单轮或多轮连续语音识别不同,这项新技术可实时预测人类即将说出的内容,实时生成回应并控制对话节奏,从而使长程语音交互成为可能。此外,采用该技术的智能硬件设备,将不再需要用户在每轮交互时都说出唤醒词,仅需一次唤醒,就可以轻松实现连续对话,将语音交互的自然度推进到一个新的层次。
目前,该技术已首先在微软小冰全球产品线中落地。其中在中国市场,除落户中国科技馆的小冰电话亭外,微软还与小米公司紧密合作,米家生态链Yeelight语音助手的市售硬件产品已开始进入千家万户。这是全球首个搭载全双工语音交互感官的智能设备,也是内置微软小冰的首个“双AI”智能设备。在日本市场,小冰凛菜(りんな)已通过该技术实现在直播平台中的落地,首个车载智能项目也已开始路试。微软计划于未来六个月内,完成该技术在更多产品线中的覆盖。
语音交互是对话式人工智能及智能硬件设备的基础之一。全双工语音交互技术的应用,有望实现用户体验的下一次飞跃,并成为人工智能语音交互的新“标准配置”。对此,微软小冰全球研发负责人周力博士表示:“从已落地的产品数据和用户反馈中,我们观察到一个普遍现象:用户一旦使用过微软小冰的全双工语音交互感官之后,再与其他语音助手交互时,他们普遍会开始感到不习惯,甚至会频繁忘记要对其他语音助手说唤醒词——新技术促进拟人自然度的显著提升,使人们对过去单轮或多轮连续语音交互体验的满意度迅速下降。这种新老交替的现象,符合我们的研发预期。”
微软全球资深副总裁、微软(亚洲)互联网工程院院长王永东博士表示:“我们预测,未来一年中,人工智能应用将越来越多地从某些单一技术领域,进入到发挥综合能力的阶段。微软已在这方面深入布局。此次全双工语音交互技术的推出,不仅涉及到计算机语音技术,还包括自然语言处理、人工智能内容创造等多个领域。这正是微软在这些领域长期储备、综合运用的成果之一。”
好文章,需要你的鼓励
尽管AI实验广泛开展,但大多数AI项目缺乏成熟度无法规模化。93%的组织在使用或构建AI系统,但仅不到10%建立了强健的治理框架。研究显示,超过50%的AI实验从未投产,仅1%的项目实现真正变革性成果。缺乏数据和AI主权是关键障碍,而拥有主权的组织AI项目成功率提升2倍,回报率增长5倍。
香港中文大学等顶尖院校联合研究发现,当前最先进的AI视频生成技术已能制作出连顶级检测系统都无法识别的假视频。研究团队开发了Video Reality Test平台,测试结果显示最强生成模型Veo3.1-Fast的假视频仅有12.54%被识别,而最强检测系统Gemini 2.5-Pro准确率仅56%,远低于人类专家的81.25%。研究还发现检测系统过度依赖水印等表面特征,音频信息能提升检测准确性,但技术发展已对信息真实性判断带来严峻挑战。
企业正竞相释放AI的变革潜力,但真正的瓶颈不在技术而在人力准备度。Gartner研究显示,56%的CEO计划在未来五年削减管理层级,但91%的CIO未跟踪AI引发的技能变化。超过80%的领导者根本不衡量AI准确性。AI价值取决于员工适应和与智能机器共同发展的能力。CIO必须应对五个关键人力障碍:AI退出效应、中层管理困境、行为副产品、准确性悖论和影子AI现象,这些深层次的行为反射和组织动态如不解决将阻碍转型。
Google DeepMind团队提出了革命性的"扩散预览"模式,通过ConsistencySolver技术实现AI图像生成的"预览+精修"工作流程。该技术能在5-10步内生成高质量预览图像,与传统40步完整生成保持高度一致性,用户体验测试显示总体时间节省近50%,大大提高了创作效率和创意探索的自由度。