标签:Transformer

面壁智能发布MiniCPM5-2B-SFT模型,支持长上下文与工具调用

面壁智能(OpenBMB)于 2025 年发布 MiniCPM5 系列第二款模型 MiniCPM5-2B,这是一款稠密 2B 参数的 Transformer 模型,专为端侧、本地部署及资源受限场景设...

同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案

在大模型的发展中,提升能力的主要手段一直是 '做大'—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层...

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于...

智谱发布GLM-5.3-Flash:320B参数原生多模态模型

智谱AI(Z.ai)于Hugging Face发布GLM-5系列首个原生多模态模型GLM-5.3-Flash。该模型总参数达320B,但激活参数仅18B,在多项基准测试和真实工作负载中超越前...

Sand.ai:全球首个千亿级开源MoE视频生成模型MAGI Preview

“五毛钱生成10秒视频,视频生成的成本从“烧不起”变成了“用得起”。” 2026年8月5日,Sand.ai发布并开源了MAGI Preview这个全球首个千亿级开源MoE视频生成模型。...

李飞飞团队发布世界模型Atlas,一张图可补全3D世界

李飞飞创立的World Labs于9月发布新一代世界模型Atlas,号称“全球首个多模态世界模型”。该模型仅需一张图片即可生成具有像素级相机控制的视频,最高支持1440p...

谷歌发布 TimesFM 3.0 时序预测模型 PyTorch 权重

谷歌研究院于近日在 Hugging Face 平台发布了 TimesFM 3.0 时序预测基础模型的官方 PyTorch 权重与配置文件,版本号为 0.3B,更新于 8 分钟前。TimesFM(Time...

腾讯发布WeMM-Embedding-9B多模态嵌入模型,MMEB-v2得分80.6

腾讯旗下混元团队于Hugging Face平台发布了WeMM-Embedding-9B,一个通用多模态嵌入模型。该模型基于Qwen3.5-9B构建,能够处理文本、图像、视频、视觉文档以及...

AI for 制药化学合成:今天的AI,能力比肩10年经验的化学家?

AI for Science 正在成为一级市场最热的方向之一。 7 月底的中央政治局会议强调“加强对基础研究的长期稳定支持”,叠加此前的人工智能+计划,一个很具体的问...

Cohere 发布 Command A+ W4A4 量化版,单块 B200 可运行

Cohere 与 Cohere Labs 于今日发布 Command A+ 的 W4A4 量化版(模型 ID:CohereLabs/command-a-plus-05-2026-w4a4),该版本在保持模型质量的同时,将硬件需...
123149