标签:音频

New微软最强转录 AI 模型:MAI-Transcribe-2 登场,60 语种平均词错误率 5.2%

9 月 4 日消息,微软昨日(9 月 3 日)发布博文,宣布推出 MAI-Transcribe-2,宣称是其最快、最准确、最便宜的 AI 语音转文字模型。 在定价方面,MAI-Transcr...

Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写

9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe,这是其首个实时音频感知模型。 开发者可通过 Me...

复制完脸,AI 开始复制专家的大脑

资本押注AI分身,转向复制人的知识、思维模式和工作流程。专家私有语料成产品壁垒,但需解决合规、留存和能力边界问题。数字人竞争分两条路线,人的经验被重...

刚刚,全网最猛AI视频模型免费了!我们手搓了一段「牛来」,效果绝了

最近,AI短剧的风刮遍了所有平台。 各种疯狂吸金的AI短剧和漫剧,是数不胜数,更不用提最近火爆的现场级神作《云上天宫》了。 「云上天宫」的作者,正是使...

阿里云视频生成模型 Wan3.0 正式上线,支持单次生成 30 秒视频、文档输入

8 月 24 日消息,阿里云消息,今天,视频生成模型 Wan3.0 正式上线。官方称,Wan3.0 在生成时长、万能创作、全能参考以及真实世界还原等维度全面升级,单次可...

钉钉加码AI办公:推出“QwenNote”App,全新硬件“QwenNote A2”曝光

相比“千问办公”的高调宣传,钉钉另外一款全新的AI办公App“QwenNote”就显得较为低调。据悉,QwenNote(千问听记)定位全新一代的AI随身助理。QwenNote通过软硬...

谷歌发布 Gemma 4 系列开源模型,含 MTP 草稿模型与多模态能力

谷歌 DeepMind 于近日发布 Gemma 4 系列开源模型,涵盖五种尺寸(E2B、E4B、12B、26B A4B、31B),支持文本、图像、音频与视频输入,并输出文本。该系列模型...

Adobe Firefly 扩充 AI 音频服务,可生成音乐、配音和音效

8 月 21 日消息,Adobe 昨日(8 月 20 日)发布博文,宣布其创意 AI 工作室服务 Adobe Firefly 扩充 3 项音频功能,目前已面向所有用户开放。 Adobe 邀请用...

阿里打造新“虾米”,推出AI音乐平台“Happy Shrimp”

我们很好奇:AI音乐,能否改写版权为王的竞争规则? 《读佳》获知,阿里ATH事业群已推出AI音乐平台“Happy Shrimp”,Slogan是“Hear Your Imagination(让想象...

AI 编曲控制台 Suno Studio 2.0 发布:新增 MIDI 支持、效果插件

Suno 正式推出了 Studio 2.0,通过一系列大幅升级进一步向“真正的数字音频工作站(DAW)靠拢”,而非只是带有生成式 AI 功能的简易音频编辑器。 其中最重要的...
123314