标签:注意力机制
NewDeepSeek V4.1 Flash 发布:7630 亿参数,KV 缓存降至前代 13%–25%
DeepSeek 于周四发布其主打成本与延迟优化的 Flash 模型更新版本 V4.1。这一版本号看似只是小幅迭代,但架构层面的改动幅度超出一般点版本,可能为更大、更聪...
谷歌发布 TimesFM-3,3.3 亿参数即可进行零样本多变量时间序列预测
9 月 1 日消息,谷歌今天发布 TimesFM-3 模型,这是该公司时间序列基础模型系列的第三代产品。拥有原生多变量预测、双注意力机制、连续补丁掩码等特性,可进...
神秘「牛来」模型果然是智谱,GLM首个原生多模态,还用的国产卡
智谱发布GLM-5.3 Flash模型,首个原生多模态,能力超越前代,价格低廉,架构全新,采用线性+稀疏注意力混合架构,提升效率,在国产芯片上运行,已开源。 终...
DeepSeek视觉模型实测:认错梁文锋,复刻网页不如GLM-5.3
DeepSeek在千呼万唤中推出了视觉理解模型DeepSeek-V4-Flash-Vision-Exp,正式补齐多模态能力。该模型原生支持图片输入,可识别图像、读取截图和图表。价格延...
月之暗面第一代万亿参数多模态模型 Kimi K2.5 官宣月底结束服役
8 月 24 日消息,月之暗面 Kimi 官方微博今日宣布,其第一代万亿参数多模态模型 —— Kimi K2.5 本月底即将结束服役。 据此前报道,今年 1 月,月之暗面宣布推...
谷歌发布 Gemma 4 系列开源模型,含 MTP 草稿模型与多模态能力
谷歌 DeepMind 于近日发布 Gemma 4 系列开源模型,涵盖五种尺寸(E2B、E4B、12B、26B A4B、31B),支持文本、图像、音频与视频输入,并输出文本。该系列模型...
让 AI 替人写代码这件事,人类已经尝试了 70 年
AI 编程席卷的取代论不绝于耳,但如果把时间线拉长却会发现让 AI 替人写代码这件事,人类已经尝试了七十年。1952 年霍珀想让程序员“回归为数学家”;1980 年代...
阿里开源2.4T参数Qwen3.8,国产超大模型架构趋同
8月13日,阿里正式开放了Qwen3.8-2.4T的模型权重,这是继Kimi K3开源半个月后,国产超大模型开源领域的又一重磅动作。此次开源不仅是参数规模达到2.4T的大模...
下一场AI革命,要取代Transformer?
2017 年夏天,Google 的 AI 研究人员发表了影响深远的论文《Attention Is All You Need》,提出了一种新的神经网络架构——Transformer。九年过去,Transformer...
手掌、桌面与车轮,端侧AI打响“入口之战”
当行业还在为云端大模型的参数规模、训练算力争论不休时,一场更具决定性的战争,已经在离用户最近的终端设备上悄然打响。 从车企密集发布搭载端侧大模型的...
津公网安备12011002023007号