jimeng

书生发布 Intern-S2-397B 多模态科学智能模型

AIGC行业资讯2小时前发布 zhang
0 0

书生 InternLM 团队在 Hugging Face 上线了新一代多模态基础模型 Intern-S2-397B,模型卡显示其总参数量为 403B,采用 Apache-2.0 许可,任务类型标注为图像-文本到文本,定位是面向科学智能与长周期智能体的多模态基础模型。

按照官方介绍,Intern-S2-397B 的能力扩展沿三条主线展开:预训练强化学习任务覆盖,以及交互式智能体环境。团队称,通过把新的视觉-语言预训练范式、大规模多任务强化学习与长周期智能体强化学习结合起来,模型在通用推理、科学问题求解和智能体能力上实现了阶跃式提升。

其中最值得关注的是预训练范式的变化。Intern-S2-397B 不再依赖先把科学文献解析成中间格式,而是直接以科学文献的原始页面为学习对象,在共享表示空间里同时建模符号语义与视觉关系。官方称,这种做法保留了文本与视觉之间的对应关系,增强了空间与视觉推理能力,也提升了数据效率。对科研场景而言,图表、公式、版式本身往往承载关键信息,直接学习原始页面意味着模型有机会捕捉到传统文本抽取流程容易丢失的部分。

在科学模态的推理与生成方面,团队把强化学习任务扩展到 20 多个领域并联合训练,官方称其在开源模型中取得领先的通用推理表现,并在生物分子相互作用设计、材料结构生成等专业科学任务上取得较强结果。这类任务通常对结构化输出和领域约束要求较高,能否稳定生成可用结果,是衡量科学模型实用性的关键。

智能体方向则通过把多个智能体框架接入大规模沙盒环境,进行黑盒式智能体强化学习。官方表示,这一路径提升了模型的泛化能力,并抬高了通用与科学领域长周期任务的能力上限。长周期任务意味着模型需要在多步操作、工具调用和中间状态反馈中保持目标一致性,这也是当前智能体从演示走向实用的主要瓶颈之一。

评测方面,团队在通用与科学数据集上对 Intern-S2-397B 进行了测试,并与近期多模态模型和大语言模型做了对比,评测使用 OpenCompassVLMEvalKitAgentCompass 三套工具。文本推理基准的最大推理长度为 256K tokens,多模态基准为 64K tokens。官方说明中,下划线表示开源模型中的最佳表现,加粗表示所有模型中的最佳表现。

部署层面,模型支持 LMDeployvLLMSGLang 等主流推理框架,官方提供了对应的部署示例。推荐采样参数为 top_p 0.95、top_k 50、min_p 0.0、temperature 0.8。模型还支持工具调用,可通过兼容 OpenAI 的接口调用外部工具与 API,例如查询天气等外部信息。

从产业视角看,这条发布延续了开源模型向科学计算与智能体两条高价值赛道延伸的趋势。科学智能对应的是研发效率与专业数据壁垒,长周期智能体对应的是任务自动化与工具生态,两者都对算力、推理框架和评测体系提出更高要求。对关注 AI 产业链的读者而言,值得跟踪的是这类模型在真实科研与工程流程中的可用性,以及开源许可下企业与研究机构的采用节奏。

© 版权声明

相关文章

小云雀