标签:预训练
NewDeepSeek V4.1 Flash 模型正式发布:全面超越 V4 Pro、原生多模态视觉理解,API 定价下调
9 月 10 日消息,深度求索今日正式发布 DeepSeek V4.1 Flash 模型。这是其全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。 新模型结构的...
New面壁智能发布MiniCPM5-2B-SFT模型,支持长上下文与工具调用
面壁智能(OpenBMB)于 2025 年发布 MiniCPM5 系列第二款模型 MiniCPM5-2B,这是一款稠密 2B 参数的 Transformer 模型,专为端侧、本地部署及资源受限场景设...
New端侧模型太夯了!面壁智能开源2B「小钢炮」,通用Agent杀到端侧
过去几年,端侧大模型一直在不断突破能力边界。 最初,人们关注的是手机等设备能否运行一个基础语言模型;随后,长文本理解、数学推理、代码生成、多语言能...
New同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案
在大模型的发展中,提升能力的主要手段一直是 '做大'—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层...
New全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图
先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于...
New中国模型,全球底座
中国大模型被“套壳”,现在已经不是新闻了,这不,前几天又爆出来一个。 9月2日,沙特AI公司HUMAIN发布了HUMAIN M3模型,发布之初,官方直接宣称这是“100% Sa...
腾讯混元:Hy4 preview 模型升级,显著降低任务轮次及输入输出 Token 消耗
9 月 7 日消息,腾讯混元与 WorkBuddy 联合团队今日宣布,针对 Hy4 preview 模型“复杂任务下的长思考、过度自我验证”等问题,进行了专项优化并全量上线。 ...
小米表格结构化数据大模型 TabLDM 发布开源:四大基准评测第一梯队,回归能力登顶 OpenML-CTR23
小米今日正式发布通用表格数据基础大模型 Xiaomi-TabLDM。 据介绍,该模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练...
阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型
9 月 6 日消息,阿里千问本周开源了 Qwen-Drive-1.0-4B,这是一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。 官方表示,Qwen-Drive-1.0 是首个面向自动驾...
中国大模型的集体隐形出海
2026 年 6 月 12 日,美国商务部给 Anthropic 发了一份出口管制指令。 指令要求,Fable 5 和 Mythos 5 两款最强模型,从当日起不允许任何外国国籍的人访问,...
津公网安备12011002023007号