标签:文长
Cohere 发布 Command A+ W4A4 量化版,单块 B200 可运行
Cohere 与 Cohere Labs 于今日发布 Command A+ 的 W4A4 量化版(模型 ID:CohereLabs/command-a-plus-05-2026-w4a4),该版本在保持模型质量的同时,将硬件需...
蚂蚁百灵发布Ling-3.0-tiny轻量推理模型
蚂蚁集团旗下百灵(inclusionAI)于今日发布轻量级混合推理模型 Ling-3.0-tiny,该模型总参数为 7.9B,但每个token仅激活 1.3B 参数,旨在以较低推理成本提供...
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理...
不再仅限 API 密钥:Codex 中的 GPT‑5.6 Sol 百万上下文能力已可通过 ChatGPT 账号使用
8 月 17 日消息,今日,OpenAI 负责 Codex 与 ChatGPT 的工程师 Tibo(@thsottiaux)在 X 平台宣布,Codex 中针对 GPT-5.6 Sol 模型的 100 万 Token 上下文窗...
刚刚,阿里开源 Qwen3.8-Max 2.4万亿参数大模型!性能比肩Fable 5
阿里千问首次开源Max级别模型。 刚刚,阿里千问大模型团队开放Qwen3.8-2.4T-A95B模型权重! Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,于8月3日发布...
智源FlagOS完成Qwen3.8-2.4T在9款芯片的Day0适配
阿里巴巴近日开源了其超大规模MoE(混合专家)模型Qwen3.8-2.4T-A95B,与此同时,智源研究院的Flag OS社区宣布已完成该模型的Day0多芯片适配。这意味着,在模...
DeepSeek宣布8月17日起API涨价,v4-pro高峰输出价涨至27元
深度求索(DeepSeek)于8月13日宣布,将自北京时间2026年8月17日零时起大幅上调其API服务价格,并同步引入峰谷定价机制。以旗舰模型deepseek-v4-pro为例,高...
蚂蚁百灵开源 Ling-3.0-tiny 模型,支持英伟达 DGX Spark、苹果 Mac mini 部署
8 月 11 日消息,蚂蚁百灵今天在 Hugging Face 平台开源 Ling-3.0-tiny 模型,该模型为轻量级混合推理 MoE 架构,总参数 7.9B,每 Token 激活 1.3B 参数。官...
清华唐杰团队揭示大模型记忆全景
近年来,大语言模型(LLMs)的突破很大程度上归功于Scaling Laws(参数、数据、算力)。 然而,在模型演进的过程中,一个同等重要的维度正变得愈发关键——记...
腾讯 WorkBuddy / CodeBuddy:Hy3 模型限时免费活动再次延长至 8 月 31 日
8 月 4 日消息,腾讯旗下的 CodeBuddy 和 WorkBuddy 今日宣布,CodeBuddy 和 WorkBuddy 中 Hy3 模型调用限时免费活动延长至 2026 年 8 月 31 日。 据此前报道...
津公网安备12011002023007号