标签:音频
NewCloudflare 推出开放权重决策 AI 模型 Clef-omni,新增支持音频 / 视频输入
10 月 10 日消息,Cloudflare 昨日(10 月 9 日)发布公告,宣布推出开放权重决策模型 Clef-omni,支持单次 API 调用处理文本、图像、音频和视频等。 定位方...
New2026 年披露的第 4 笔 AI 交易:苹果投资 Huxe,由前谷歌 NotebookLM 团队成员创立
10 月 10 日消息,科技媒体 9to5Mac 昨日(10 月 9 日)发布博文,报道称苹果与 AI 音频初创公司 Huxe 达成人才引进与技术许可协议,这是今年公开披露的第 4 ...
New生数科技发布视频生成模型 Vidu Q4 Preview 预览版本,支持 2K、4K 输出
10 月 10 日消息,生数科技现已发布全新一代视频生成旗舰模型预览版本 Vidu Q4 Preview,最多支持 3 段参考音频、15 张参考图与 2K、4K 输出。 Vidu Q4 目前...
New多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」
在语音助手、多用户共享的家庭助理等长期对话场景中,模型需要跨越多次会话记住用户的信息,但现有评测常遭遇两大难题: 一是语音中的关键信息不止于文字,...
马斯克:Grok Bot 不再只认自家模型,按用户任务择优用 Claude 等最佳 AI
10 月 8 日消息,全球首富埃隆 · 马斯克(Elon Musk)昨日(10 月 7 日)在 X 平台发布重要说明,宣布旗下 Grok Bot 不再局限于 SpaceXAI 自研的 Grok 系列模...
谷歌 SynthID 面向全球用户开放,可检测 AI 生成内容
谷歌公司宣布,其 AI 生成内容检测网站 SynthID 已面向全球用户开放,用户可使用该产品检测图片、视频或音频是否由 AI 生成。 据介绍,该网站使用 SynthID 识...
谷歌推出全新 macOS 应用 AI Edge Foresight,支持离线记录会议纪要
谷歌现已推出全新 macOS 应用 AI Edge Foresight,向苹果用户展示 EmbeddingGemma 2 端侧多模态模型的实力。这款应用可以帮助用户处理线上、线下会议笔记,支...
谷歌推出 EmbeddingGemma 2:支持多模态、7.4 亿参数量化手机端运行只需 191MB 内存
去年谷歌推出了 EmbeddingGemma,为开发者提供轻量高质量的文本嵌入方案,下载量已超 2000 万次,广泛应用于端侧搜索工具和隐私优先检索增强生成( RAG )管...
ElevenLabs 推出 v4 和 v4 Turbo 语音模型:支持 90 余种语言,10 秒素材即可克隆声音
9 月 29 日消息,ElevenLabs 于当地时间周一正式推出了两款全新语音模型,分别为 ElevenLabs v4 与 v4 Turbo。新版模型强化了情绪表达控制能力,降低了语音智...
快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成
9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、...
津公网安备12011002023007号