xAI 发布 Grok 4.6,主打智能体与性价比,Grok 4.7 已在训练

AIGC行业资讯7小时前发布 zhang
2 0

xAI 于 8 月 11 日发布新一代大模型 Grok 4.6,官方称其在同等价格下相较 4.5 实现“重大升级”,并确认模型参数规模为 1.5T。该模型被定位为面向“长期运行的智能体”和“更具雄心的交互与视觉工作”的升级版本,xAI 同时透露下一代 Grok 4.7 已完成初步训练,计划使用 SpaceX 内部数据继续训练。

独立评测机构 Artificial Analysis 将 Grok 4.6 的智能指数评为 61,大致与 GPT-5.6 Sol Max 相当,略低于 Claude Opus/Fable。在智能体相关基准上,Grok 4.6 在 Terminal-Bench v2.1 上取得 88.4% 的成绩,GDPval-AA v2 Elo 达到 1753,并在 AA-Briefcase 测试中表现出竞争力,而成本远低于同类模型。早期竞技场数据也显示,其在网页开发任务上的表现接近 GPT-5.6 Sol 和 Claude Fable。

定价是此次发布的焦点之一。Artificial Analysis 指出,Grok 4.6 的 API 价格为 每百万输入 token 2 美元、每百万输出 token 6 美元,显著低于前沿同类模型。多位从业者立即将其视为编码和缺陷查找工作负载的“新默认选择”,例如 Pawel Huryn 和 Cognition 已在 Devin 中提供该模型。

xAI 表示,性能提升主要来自更长的补充训练、重新生成的 SFT 轨迹,以及针对编码、网页、CAD 和内核优化等领域的智能体强化学习。官方还报告模型在长任务中表现出更多自我测试行为。

在 Grok 4.6 发布同日,阿里 的 Qwen3.8-Max 也以开放权重形式发布,总参数 2.4T、激活参数 95B 的 MoE 架构,社区强调其规模、首日可用性以及长上下文和智能体导向。vLLM 提供首日支持,并为 NVIDIA B300 和 AMD MI355X 提供厂商特定的 4-bit 检查点;Together AI 和 Baseten 也宣布立即支持。不过有用户指出,初始开放权重版本仅支持文本,暂不支持视觉输入。

同日,DeepSeek 的 V4 Pro 正式版(GA)上线,定价约为 每百万输入 token 0.435 美元、每百万输出 token 0.87 美元,有观察者称其比 Fable 5 便宜约 57 倍,同时相比预览版在 Terminal Bench 上提升 15.8%。不过早期用户反馈其能力并非在所有任务上都明显领先于 Kimi 或 Flash,暗示 DeepSeek 未来的进步可能更多依赖强化学习环境和智能体工作,而非单纯扩大规模。

微软 也加入推理模型竞争,Mustafa Suleyman 宣布推出 MAI-Thinking-1,这是微软首个“从零构建”的推理模型,现已在 Foundry 中提供。团队初期请求聚焦于工具使用的反馈,表明微软将其定位为应用型推理模型,而非单纯的基准测试参赛者。此外,Upstage 的 Solar Pro 4 在智能指数上从 14 跃升至 42,在智能体和长上下文任务上进步显著,但仍落后于当前顶级前沿和开放模型。

Grok 4.6 的发布正值 AI 智能体(AI teammate)赛道竞争加剧之际。此前 Claude Tag 评价褒贬不一,Block 的 Buzz 则对技术用户要求较高,市场仍在等待一个明确的品类领导者。xAI 凭借 Grok 4.6 的性价比和智能体能力,有望在这一领域占据一席之地。

© 版权声明

相关文章

堆友更新