Wispr 的 Flow 语音转写软件现已可在 iPhone 上使用
Wispr 的 Flow 是一款创新的 iOS 语音输入软件,借助 AI 技术能将语音无缝转换为精美文字,每周免费 2000 字,支持 100 多种语言,并能实现多设备同步。
Wispr 的 Flow 是一款创新的 iOS 语音输入软件,借助 AI 技术能将语音无缝转换为精美文字,每周免费 2000 字,支持 100 多种语言,并能实现多设备同步。
Spotify 的 AI DJ 允许付费用户通过语音请求播放符合心情、艺术风格、流派或活动氛围的歌曲。该功能由 OpenAI 实时生成语音,旨在融合个性化推荐与传统电台体验,但初期版本仅支持英文请求。
Yelp 正在测试基于 AI 的语音代理,通过 OpenAI Realtime API 与企业数据整合,实现自动接听电话、管理预订、过滤垃圾信息和通话分析,疑难问题由人工跟进,助力客户服务。
亚马逊推出了一款名为 Nova Sonic 的 AI 语音模型,它不仅能理解语音内容,还能捕捉说话者的语气、犹豫等细微变化。这个模型整合了语音识别、回复生成和语音合成功能,能够实现更自然的对话交互。Nova Sonic ...
aiOla 推出了一款名为 Jargonic 的新型自动语音识别模型,专为企业使用而设计。这个模型能够处理专业术语、背景噪音和各种口音,无需大量再训练或微调。Jargonic 采用独特的关键词识别系统,可以零样本适应企业...
Observe.AI 正式推出 VoiceAI 智能语音助手,旨在自动化处理呼叫中心的日常客户交互。该解决方案集成了多项 AI 技术,包括语音识别、文本转语音和专有 AI 模型,可无缝对接企业现有系统。通过提供拟人化的语...
OpenAI 发布三款全新专有语音模型,包括 gpt-4o-transcribe、gpt-4o-mini-transcribe 和 gpt-4o-mini-tts。这些模型基于 GPT-4o 开发,提供更准确的转录和语音...
据报道,人工智能初创公司 Anthropic 正在为其 AI 聊天机器人 Claude 开发语音功能。公司首席产品官表示,计划推出允许用户与 AI 模型对话的体验。Anthropic 已进行内部原型开发,并与包括亚马逊在...
ElevenLabs是一家刚刚完成1.8亿美元融资的人工智能初创公司,主要以其音频生成能力而闻名。该公司通过推出首个独立的语音转文本模型Scribe,迈出了另一个技术方向。该初创公司估值为33亿美元,已帮助许多其他公司提...
美国第一国民银行 (FNBO) 与语音安全专家 Pindrop 合作,采用创新技术来识别和验证客户身份。通过结合云端欺诈检测和身份认证系统,FNBO 实现了无摩擦的客户验证,提高了安全性和用户体验。该银行还在测试新的深度...
在显示技术上,Orion采用了碳化硅镜片和先进的光波导技术,结合Micro LED投影仪,提供了70度的视场角,这在小型AR眼镜中是前所未有的,为用户提供了更为沉浸式的体验。
多模态AI系统,融合语音对话和音频分析功能,支持超过8种语言和方言,无需自动语音识别即可进行语音交互,提供音频信息分析和多语言支持。
国际顶级学术会议ACM SIGKDD(国际数据挖掘与知识发现大会,KDD)正于美国华盛顿召开。会上,火山语音多篇论文被KDD 2022 Research track接收并发表,创新性地提出基于语音合成来有效攻击语音识别系...