智谱很想再次“牛来”_-Flash_模型_Token
位置: 当前位置: 首页 >

智谱很想再次“牛来”_-Flash_模型_Token
发布时间:2026-08-28 12:05:31
  |  
阅读量:
字号:
A+ A- A

作者 | 叶二 编辑 | 魏晓

智谱,又搅动了市场。

8月20日,一款名为Ox Alpha的匿名模型悄然登陆OpenRouter和OpenCode平台。没有开发者署名,没有参数披露,没有技术报告,只挂着一句"面向代码与智能体任务设计的推理模型"的描述。

但就是这样一款神秘感拉满的模型,在短短五天内累计流量突破50万亿Token,刷新两大平台历史增长纪录,调用量一度超过DeepSeek的两倍,在中文社区被扣以“牛来”之名。

智谱“认养一头牛”的梗图,来源网络

然后到了8月26日晚,智谱正式认领了这头在全球开发者社区横冲直撞了六天的"牛"。

随后,股价暴涨。截止今日收盘,智谱股价收涨12.62%,市值回到5400亿港元。

从匿名引爆社区热度,引发归属猜想,再到官方揭晓身份,不难看出,整套***背后,是智谱又一次对市场情绪的精准拿捏。

而眼下的智谱,也的确急需这样一场 “牛来” 式的胜利。

两个月前,智谱的市值还站在1.33万亿港元的山巅。而两个月后,它跌去了超过六成,最低时市值不足4200亿港元。"稀缺性幻觉""万亿泡沫""AI估值逻辑崩塌"——质疑声从未停歇。

现在,一场匿名模型引发的狂欢,暂时提振了资本市场的情绪,但对于智谱而言,想要再次万亿,这些或许还不够。

一场价格奇袭

过去一周,全球AI开发者社区被Ox Alpha(即GLM-5.3-Flash)搅得天翻地覆。其能在匿名状态下走红,核心在于一句话:极低成本下的高性能。

在实测成绩方面,GLM-5.3-Flash在Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。

但在成本方面,GLM-5.3-Flash限时折扣期内定价为GLM-5.3的1/20,Claude Opus 4.8的1/40。与调价后的DeepSeek V4 Flash相比,绝大多数场景下GLM-5.3-Flash更便宜。

"以价换量"虽然不怎么***,但放在当前算力吃紧、国产大模型一轮集体涨价的窗口下,格外有效。

今年 8 月 DeepSeek 全面提价,DeepSeek V4 Pro 从 6 元涨到 13.5 元,高峰 27 元;DeepSeek V4 Flash 的输出从每百万 token 2 元涨到 4.5 元,高峰时段 9 元,相比以往价格是成倍上涨。

市场普遍认为,随着DeepSeek 的全面调价,行业逻辑发生反转,算力供给成为稀缺***,API 成本水位整体性抬升,大厂纷纷告别低价补贴时代。

但智谱却反其道而行之,GLM-5.3-Flash瞄准的正是涨价之后溢出的海量刚需:大量 RAG、Agent、自动化业务,追求够用的能力,却无力承担持续走高的推理账单。

一个事实是,据《晚点LatePost》报道,DeepSeek V4 Flash提价后,OpenCode平台调用量直接下滑一半。

这部分外溢需求,正给了智谱增长的机会。GLM-5.3-Flash发布短短五天内累计流量突破50万亿Token,便是低价策略奏效最好的证明。

值得注意的是,根据智谱方面表示,GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355Bvs.320B),但激活参数量(32B→18B)与层数(92→45)几乎减半。结合智谱最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算***实现更强的性能。

同时,GLM-5.3-Flash进行了多项架构升级,是首个***用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并***用流形约束超连接提升模型Scaling能力。

以长上下文为例,这是大模型推理成本增长最快的部分。

上下文越长,注意力计算量和KV Cache占用的显存就越大。当窗口扩展到100万Token,如果继续用传统全注意力,服务成本和硬件压力都会失控。

而基于GLM-5.3-Flash线性注意力 + 稀疏注意力的混合架构,模型不必每次生成都让所有Token彼此完整计算。线性注意力负责捕捉局部依赖,稀疏注意力则通过轻量级索引器,从百万Token上下文中检索真正相关的全局内容,如此一来就能大幅降低成本。

显然,智谱也深知当下资本市场对烧钱补贴的厌恶,对外强调其低价实现,源于模型架构层面的深度优化。

国产芯片叙事

引爆市场情绪的另一关键,还在于GLM-5.3-Flash讲出了国产芯片故事。

智谱官方披露:Ox Alpha匿名测试期间的全部推理流量,均运行在国产AI芯片集群上,调用规模超过10万张国产加速芯片。相较同一硬件上的初始基线版本,端到端推理性能提高了3倍,每Token成本和硬件效率"达到与主流英伟达GPU相当的水平"。

这是什么概念?半导体研究机构SemiAnalysis在X平台评论道:

"所有流量均由国产芯片承载,硬件效率和单Token成本已可与英伟达GPU相媲美。继Jalapeño(OpenAI自研推理芯片)昨日宣布之后,CUDA护城河再度受到考验。此前业界普遍认为只有顶级前沿实验室才具备每日100万亿Token的算力规模——而这里每日100万亿Token的免费流量,全部跑在国产芯片上。"

据了解,为解决单颗国产芯片在计算能力和显存容量上的限制,智谱基于SGLang开发了专用推理引擎,包括线性注意力和LM Head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合KV Cache量化以及Layer Split等优化。

市场有消息称,GLM-5.3-Flash所调用的超过10万张国产加速芯片供应商,或来自华为、摩尔线程与海光。

虽然并未明确,但无论具体型号如何,"10万张国产芯片承载每日100万亿Token流量"这个事实本身,已经在AI硬件领域投下了一颗震撼弹。

对于智谱而言,这也足够让资本市场对其重新定价。

这个叙事的杀伤力在于:它把智谱从一家"大模型公司"提升到了"中国AI自主可控标杆"的位置。当市场质疑智谱的估值泡沫时,"国产芯片大规模商用验证"这个故事,也可以撑起全新的估值逻辑——这不再只是一家AI应用公司,而是中国AI产业链自主化的核心节点。

还能万亿吗

从结果来看,智谱这一次的"牛来"叙事,讲得非常漂亮。

匿名发布制造话题,技术支撑实力,价格奇袭展示商业化决心,国产芯片拔高战略定位,股价应声涨超11%,市场信心似乎正在修复。

但问题是:一次漂亮的叙事,能让智谱再次"牛来"吗?

事实上类似撩拨市场情绪的操作,已经成为了智谱的套路。

今年以来,智谱的营销打法很鲜明,在时间点上紧盯海外头部Anthropic动态卡点发布产品,在叙事上主打开源对抗闭源形成鲜明反差,在价值层面上,绑定国产突围、打破技术垄断等宏大叙事,以此夯实 “国产 AI 对标海外顶尖”的技术心智。

这让智谱尝足了甜头,也直接让其上演了一波直冲市值万亿的神话。

但情绪褪去之后,则就是对真实商业化能力的检验,过去两个月,智谱市值跌去了超过六成,曾经的万亿,不仅变得遥不可及,同样更是给智谱扣上了“泡沫”帽子。

此次GLM-5.3-Flash的发布,可以视为智谱的一次反击。

但牛来能不能真的来?最终还是要回归商业化基本面,万亿神话能不能重演,归根结底,要看智谱讲出的故事能不能落地成实实在在的收入。

Lanmeih/今日话题

你看了电影《牛来》了吗?返回搜狐,查看更多

智谱很想再次“牛来”_-Flash_模型_Token