标签:强化学习

OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误

9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指...

小米直播训练 MiMo-V2.6 模型,罗福莉称沉寂半年钻研一件事

9 月 17 日消息,小米 MiMo 大模型负责人罗福莉今日发文,自 4 月份开源 MiMo-v2.5 后,小米沉寂了近半年,花时间研究了一件事 —— 强化学习究竟能扩展到多远...

ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费

 9 月 17 日消息,TypeSafe AI 昨日(9 月 16 日)发布公告,宣布推出 Jev,该 AI 模型定位为“System One Model”(系统一模型),不生成文本,直接返回结构化...

传 GPT-6 Sol 已在 OpenAI API 现身,或本月发布

据未经证实的爆料,OpenAI 的新模型 GPT-6 Sol 正在内部测试,并已被部分开发者在 OpenAI API 中发现,预计本月正式发布。相关消息来自社交平台上的爆料与开...

刚写完V4.1主算子就要“转业”?DeepSeek资深算子工程师深夜独白

大模型狂飙的这半年,宏观叙事越来越走向极端:一边是创始人动辄颠覆一切的狂言,一边是耸人听闻的末日威胁。而当变革的重锤砸向AI开发的一线,那些用代码推...

阿莫迪倡AI减速遭特朗普反对,Anthropic被曝筹备千亿美元IPO、Opus 5.2疑似灰测

阿莫迪前脚发文呼吁给前沿AI'限速',特朗普后脚就公开反对。美国时间9月13日,特朗普在爱尔兰多恩贝格的自家高尔夫球场被记者问到AI行业是否应放慢速度或接受...

Sebastian Raschka 长文拆解 GPT-6 Astra:循环 Transformer 并非隐藏思维链的元凶

OpenAI 新旗舰模型 GPT-6 Astra 发布前后,一场围绕其底层架构的争议迅速升温。据 The Information 在模型上线前约两天援引内部消息报道,Astra 采用了一种名...

马斯克:Grok 4.8 模型本周完成训练,参数量 2.5 万亿

9 月 14 日消息,xAI 首席执行官埃隆 · 马斯克今天在 X 平台透露,Grok 4.8 将是一款参数量达 2.5 万亿的 AI 模型,使用全新 C++ 软件栈训练。 马斯克表示,G...

DeepSeek V4.1 Flash 模型上线国家超算互联网

DeepSeek V4.1 Flash 模型今日上线国家超算互联网中心。用户可登录国家超算互联网官网,从首页进入「模型服务」页面,即可快速打开 DeepSeek V4.1 Flash 模型...

DeepSeek V4.1 Flash 模型正式发布:全面超越 V4 Pro、原生多模态视觉理解,API 定价下调

9 月 10 日消息,深度求索今日正式发布 DeepSeek V4.1 Flash 模型。这是其全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。 新模型结构的...
1234…107