标签:音频
谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制
谷歌宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成从静态预设转变为动态创意工作室,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频...
阿里千问发布 Qwen-Audio-3.1 系列语音大模型,并下调全线产品价格
9 月 23 日消息,今天,千问正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别、语音合成和实时语音交互三大核心模型进行了全面进化,更重磅...
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进...
Snapchat 社交平台更新 Lens+ 订阅服务,新增“聊天消息转歌曲”等多项生成式 AI 功能
9 月 22 日消息,Snap 宣布为旗下 Snapchat 社交平台 Lens+ 订阅服务进行更新,新增多项生成式 AI 功能。 公开信息显示,Snapchat Lens+ 订阅服务于 2025 年...
SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型:错误率降低约一半,价格保持不变
SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型,在保持价格不变的前提下,错误率降低约一半。 官方表示,Grok Voice Transcribe 2.0 基于 Grok ...
腾讯升级元宝 App“AI 录音笔”功能:边录边拍、设备内录、WorkBuddy 快捷分享…
腾讯宣布升级旗下元宝 App 内置的“AI 录音笔”功能,主要新增“边录边拍”、“设备内录音”、“支持自定义编辑”等,同时打通 WorkBuddy、腾讯文档等产品快捷分享,...
阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元
9 月 18 日消息,阿里千问今日正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash,并已在千问 AI 平台提供。该模型可同时处理文本、图像、音频和视频输入,支...
谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换
9 月 16 日消息,当地时间 9 月 15 日,谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智...
阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一
9 月 15 日消息,今日阶跃正式发布 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中...
苹果新 CEO 特努斯谈 Meta“变态眼镜”风波:AI 智能设备需要让旁人安心
9 月 14 日消息,据《商业内幕》前天报道,苹果新任首席执行官约翰 · 特努斯最近接受媒体采访,谈及 Meta 公司最近陷入的“变态眼镜”风波,以及苹果如何看待 ...
津公网安备12011002023007号