标签:预训练
国产智能化工大模型 3.0 Pro 发布,中国科学院大连化物所、科大讯飞、阿里云等研发
9 月 1 日消息,由中国科学院大连化学物理研究所(以下简称“大连化物所”)联合科大讯飞股份有限公司(以下简称“科大讯飞”)、阿里云计算有限公司(以下简称“...
端侧唯一百万 Token 上下文模型开源:科大讯飞词元星火 X2.5-4B&1.7B 正式发布
9 月 1 日消息,科大讯飞旗下词元星火今日宣布推出并开源星火 X2.5-4B 和星火 X2.5-1.7B 两款端侧通用大模型。 据介绍,两款模型原生支持最长 100 万 Token ...
腾讯混元:Hy4 preview 调用激增,WorkBuddy 已紧急扩容
8 月 31 日消息,腾讯混元今日发文称,自 2026 年 8 月 28 日混元 Hy4 preview 在 WorkBuddy 首发接入以来,凭借其 Agent 能力的显著提升,受到了广大用户与...
消息称字节跳动豆包大模型 2.2 将推迟发布,原计划 8 月推出
据白鲸实验室消息,字节跳动原计划于 8 月推出的豆包大模型 2.2 将推迟面世。 多位接近字节的人士称,延期的原因是,字节内部希望通过更充分的预训练和后训练...
谷歌发布 TimesFM 3.0 时序预测模型 PyTorch 权重
谷歌研究院于近日在 Hugging Face 平台发布了 TimesFM 3.0 时序预测基础模型的官方 PyTorch 权重与配置文件,版本号为 0.3B,更新于 8 分钟前。TimesFM(Time...
智谱开源GLM-5.3-Flash,商汤大装置提供国产算力支持
8月26日晚,智谱正式上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型。该模型总参数达320B,能力超过GLM-5.2,在全球权威的Artifi...
腾讯开源Hy4-preview-FP8:804B MoE模型,激活参数49B
腾讯混元团队今日在Hugging Face等平台开源了新一代MoE旗舰模型Hy4 preview及其FP8量化版本Hy4 preview-FP8。该模型总参数达770B(含MTP层共804B),每token...
蚂蚁百灵推出金融增强模型 Ling-3.0-flash-Fin:API 调用限免一个月,下周开源
8 月 28 日消息,蚂蚁百灵今日推出金融增强模型 Ling-3.0-flash-Fin,延续 Ling-3.0-flash 的模型架构和长上下文能力,保持 124B 总参数、5.1B 激活参数的配...
加州理工用AI攻克量子化学60年难题,1块显卡做完7800块的活
100 个电子的量子行为,用暴力方法计算一次所需的时间超过宇宙的年龄。 一颗药物分子动辄上千个电子,一块电池材料更多。模拟它们,是药物、电池、芯片研发...
突发:Fable 5.1灰度了
Anthropic或很快发布Fable 5.1,与Sonnet 5.1或同时推出。开发者实测显示,Fable 5.1在前端开发、长链推理和自主工作流上性能卓越,版权限制更严格。Anthropi...
津公网安备12011002023007号