标签:音频
ElevenLabs 推出 v4 和 v4 Turbo 语音模型:支持 90 余种语言,10 秒素材即可克隆声音
9 月 29 日消息,ElevenLabs 于当地时间周一正式推出了两款全新语音模型,分别为 ElevenLabs v4 与 v4 Turbo。新版模型强化了情绪表达控制能力,降低了语音智...
快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成
9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、...
谷歌 Gemini 3.8 Live 虚拟人上线:实时唇形同步 + 自然表情,无缝切换 97 种语言
谷歌近日宣布,在上周推出 Gemini 3.8 Live 的基础上,正式推出带有 Live Avatar 功能的 Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。 ...
谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制
谷歌宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成从静态预设转变为动态创意工作室,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频...
阿里千问发布 Qwen-Audio-3.1 系列语音大模型,并下调全线产品价格
9 月 23 日消息,今天,千问正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别、语音合成和实时语音交互三大核心模型进行了全面进化,更重磅...
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进...
Snapchat 社交平台更新 Lens+ 订阅服务,新增“聊天消息转歌曲”等多项生成式 AI 功能
9 月 22 日消息,Snap 宣布为旗下 Snapchat 社交平台 Lens+ 订阅服务进行更新,新增多项生成式 AI 功能。 公开信息显示,Snapchat Lens+ 订阅服务于 2025 年...
SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型:错误率降低约一半,价格保持不变
SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型,在保持价格不变的前提下,错误率降低约一半。 官方表示,Grok Voice Transcribe 2.0 基于 Grok ...
腾讯升级元宝 App“AI 录音笔”功能:边录边拍、设备内录、WorkBuddy 快捷分享…
腾讯宣布升级旗下元宝 App 内置的“AI 录音笔”功能,主要新增“边录边拍”、“设备内录音”、“支持自定义编辑”等,同时打通 WorkBuddy、腾讯文档等产品快捷分享,...
阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元
9 月 18 日消息,阿里千问今日正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash,并已在千问 AI 平台提供。该模型可同时处理文本、图像、音频和视频输入,支...
津公网安备12011002023007号