标签:多模态

New快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成

9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、...

New字节火山引擎发布 Seedance 影视合作计划:提供 Token 补贴,单项目激励最高达百万

在第十届平遥国际电影展期间,字节跳动旗下火山引擎正式发布 Seedance 影视合作计划,将面向全球专业影视项目提供 Token 补贴、宣发资源及技术与工具支持,单...

OpenCode 宣布为 DeepSeek V4.1 Flash 永久提供 60 美元额度

OpenCode 宣布启动“Operation Cheepseek”第二阶段,DeepSeek V4.1 Flash 在 OpenCode Go 中原本限时提供的 60 美元(注:现汇率约合 403.5 元人民币)额度现...

让 AI 学会“挑刺”:根据说明书 + 照片指出家具是否装错,OpenAI GPT-6 Astra 准确率已达 80%

Epoch AI 进行了一组家具组装基准测试(Furniture Assembly Benchmark,FAB)。结果显示,多模态 AI 在识别宜家家具组装错误方面取得明显进展。 其中,OpenAI...

美团上线 LongCat-2.5-Preview 模型:1.6T 参数,主打 AI 长程任务与多模态能力

美团旗下 LongCat API 开放平台于 9 月 25 日上线新一代大模型 LongCat-2.5-Preview,主打“长程任务”与多模态能力,并同步开放 API 与网页端体验入口。 附上...

谷歌 Gemini 3.8 Live 虚拟人上线:实时唇形同步 + 自然表情,无缝切换 97 种语言

谷歌近日宣布,在上周推出 Gemini 3.8 Live 的基础上,正式推出带有 Live Avatar 功能的 Gemini 3.8 Live,为原生实时对话模型带来接近实时的视觉呈现效果。 ...

阿里云栖大会公布全模态进展:Qwen4 训练中,下一代视频模型 11 月发布

9 月 22 日,2026 云栖大会开幕,阿里巴巴集中披露了从大语言模型到多模态模型的最新进展。最受关注的是下一代旗舰的节奏:基于全新架构的 Qwen4 已进入训练...

书生发布 Intern-S2-397B 多模态科学智能模型

书生 InternLM 团队在 Hugging Face 上线了新一代多模态基础模型 Intern-S2-397B,模型卡显示其总参数量为 403B,采用 Apache-2.0 许可,任务类型标注为图像-...

小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型

9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进...

vivo 发布四款蓝心大模型,推出系统级蓝心 Harness

9 月 16 日消息,在今日的 2026 vivo 开发者大会上,vivo 发布了四款新的蓝心大模型。 「听得懂你的蓝心语音大模型 RealTime」全新的端到端语音理解架构...
123…336