Gemini 3.1 Flash TTS:下一代富有表现力的AI语音合成模型
谷歌正式推出Gemini 3.1 Flash TTS,这是其最新文字转语音模型,在可控性、表现力和质量上全面提升。该模型在Artificial Analysis TTS排行榜上获得1211的Elo高分,并被列为"最具吸引...
谷歌正式推出Gemini 3.1 Flash TTS,这是其最新文字转语音模型,在可控性、表现力和质量上全面提升。该模型在Artificial Analysis TTS排行榜上获得1211的Elo高分,并被列为"最具吸引...
巴黎AI公司Mistral发布首个文本转语音模型Voxtral TTS,参数量仅40亿,可在消费级设备运行。该模型采用开源架构,支持英法德西等9种语言,仅需3秒音频即可实现声音克隆,能准确表达情感和语调变化。在自然度测试...
谷歌发布新AI音频模型Gemini 3.1 Flash Live,专为实时对话设计。该模型语音生成速度更快,语调更自然,在多项基准测试中表现出色。为防止AI语音被冒充为真人声音,谷歌为输出内容添加了SynthID水印。目...
游戏开发商Embark Studios的CEO承认,在语音质量方面,专业配音演员比AI技术更胜一筹。《弧光突袭者》在去年10月成功发布后,开发团队重新录制了游戏中部分AI生成的语音内容,改用真人配音演员。尽管游戏在Ste...
波兰AI语音公司ElevenLabs由两位30岁创始人Staniszewski和Dabkowski创立,其AI语音技术能够生成极其逼真的人声。公司在四年内从零发展到估值66亿美元,两位创始人均成为亿万富翁。该公司年收入1...
安全研究机构Group-IB详细分析了AI语音克隆诈骗的实施流程:攻击者首先收集目标人物仅需3秒的语音样本,利用AI语音合成引擎生成伪造语音,配合号码伪装技术发起诈骗电话。攻击可采用预录脚本或实时语音转换,冒充亲属、上司...
微软升级了Azure AI Speech服务,用户仅需几秒钟的语音样本即可快速生成逼真的语音复制品。该个人语音功能于2024年5月21日正式发布,采用名为"DragonV2.1Neural"的零样本文本转语音模型,支持1...
Groq 与 PlayAI 宣布合作,通过 Groq 的高速推理平台推出先进的文本转语音模型 Dialog。这一合作结合了 PlayAI 在语音 AI 方面的专业知识和 Groq 的专业处理基础设施,创造出了据称是目前最...
Google 宣布将其高清语音接口 Chirp 3 添加到 Vertex AI 开发平台。Chirp 3 支持 31 种语言的 8 种新声音,可用于构建语音助手、创建有声读物等。Google 强调 AI 发展是一场马拉松...
AI 公司 Sesame 开源了支持其逼真语音助手 Maya 的基础模型。这个名为 CSM-1B 的 10 亿参数模型采用 Apache 2.0 许可证,可用于商业用途。该模型能从文本和音频输入生成"RVQ 音频编码",...
消费者报告研究发现,六家提供人工智能语音克隆软件的公司中,有四家未能提供有效的防滥用措施。这项技术虽有合法用途,但也容易被滥用于欺诈等非法行为。报告呼吁企业加强安全保障,并建议加强监管以保护消费者权益。
一段令人惊叹又让人不安的AI语音演示在网上引发热议。2013年,斯派克·琼斯的电影《她》描绘了一个人们与AI语音助手建立情感联系的未来。近12年后,AI初创公司Sesame发布的新对话语音模型使这一虚构的设想更接近现实,...
Podcastle是一款播客录制和编辑平台,现已推出名为Asyncflow v1.0的AI文本转语音模型,并为开发者提供API接口,方便其在应用中直接集成该模型。新模型支持超过450种AI语音,能够为文本进行朗读。该公司...
人工智能初创公司Zyphra推出了两款开源文本转语音模型,声称只需5秒样本音频就能克隆声音。测试显示,使用不到30秒的录音即可生成逼真效果。这项技术虽然存在滥用风险,但也有积极应用前景,如帮助失声者重获声音。该模型采用开...
目前,虚拟制作行业发展已经从以CG、语音合成的计算机技术为主的阶段,经历5G、人工智能技术突破,到现在,进入高速发展的新阶段,虚拟制作的应用领域逐步拓宽,全方面渗透进入各个行业。