标签:文长
NewDeepSeek V4.1 Flash 发布:7630 亿参数,KV 缓存降至前代 13%–25%
DeepSeek 于周四发布其主打成本与延迟优化的 Flash 模型更新版本 V4.1。这一版本号看似只是小幅迭代,但架构层面的改动幅度超出一般点版本,可能为更大、更聪...
刚刚,DeepSeek 新模型突然上线,Flash 的模型,Pro 的野心
就在刚刚,DeepSeek 开启了新模型 DeepSeek V4.1 Flash 的限时内测。 官方称,这是一个面向用户开放测试的中间版本,采用新的模型结构,原生支持多模态。按...
面壁智能发布MiniCPM5-2B-SFT模型,支持长上下文与工具调用
面壁智能(OpenBMB)于 2025 年发布 MiniCPM5 系列第二款模型 MiniCPM5-2B,这是一款稠密 2B 参数的 Transformer 模型,专为端侧、本地部署及资源受限场景设...
同等预算下,Looped Transformer更强吗?清华、字节Seed给出答案
在大模型的发展中,提升能力的主要手段一直是 '做大'—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层...
腾讯混元:Hy4 preview 模型升级,显著降低任务轮次及输入输出 Token 消耗
9 月 7 日消息,腾讯混元与 WorkBuddy 联合团队今日宣布,针对 Hy4 preview 模型“复杂任务下的长思考、过度自我验证”等问题,进行了专项优化并全量上线。 ...
1.5TB 压到 214GB:腾讯混元 Hy4 preview 轻量版发布开源,异构设备可联合推理
9 月 1 日消息,腾讯混元团队今日宣布推出 Hy4 preview 轻量版,将 Hy4 preview 的模型权重从接近 1.5TB 压缩至约 214GB。 注:Hy4 preview 是腾讯于 8 月 2...
腾讯混元:Hy4 preview 调用激增,WorkBuddy 已紧急扩容
8 月 31 日消息,腾讯混元今日发文称,自 2026 年 8 月 28 日混元 Hy4 preview 在 WorkBuddy 首发接入以来,凭借其 Agent 能力的显著提升,受到了广大用户与...
腾讯开源Hy4-preview-FP8:804B MoE模型,激活参数49B
腾讯混元团队今日在Hugging Face等平台开源了新一代MoE旗舰模型Hy4 preview及其FP8量化版本Hy4 preview-FP8。该模型总参数达770B(含MTP层共804B),每token...
加州理工用AI攻克量子化学60年难题,1块显卡做完7800块的活
100 个电子的量子行为,用暴力方法计算一次所需的时间超过宇宙的年龄。 一颗药物分子动辄上千个电子,一块电池材料更多。模拟它们,是药物、电池、芯片研发...
原生支持 4K 图像输出,商汤开源 8B 参数量多模态大模型 SenseNova U1.5 Lite
8 月 21 日消息,商汤科技今日宣布开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。 据介绍,SenseNova U1.5 Lite 原生支持 3-4k 上下文长度,能够同...
津公网安备12011002023007号