AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章920
当前页4 / 23
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新普通
Anthropic 悄然向部分用户推送 Claude Fable 5.1
ANTHROPIC 🔥:看起来现在有更多用户在后台从 Claude Fable 5 被路由到 Claude Fable 5.1。 > 一些用户发现 Fable 5 模型的知识截止日期已更新,指向一次静默发布。 快了?👀
信息来源:X:Testing Catalog (@testingcatalog) · Claude
模型发布 / 更新普通
智谱Ox Alpha开源,屠榜模型揭晓
彭博确认匿名屠榜的Ox Alpha是智谱GLM系列新迭代,今晚开源权重。该模型上线首日登顶OpenRouter调用量榜首,打破DeepSeek 56天霸榜纪录,前五大应用累计调用达4万亿Token;DeepSWE基准10任务过8个(80%),支持104.8万Token超长上下文和多模态。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · DeepSeek / GLM
模型发布 / 更新普通
阿里云发布 Qwen3.8-Flash 多模态 MoE 模型
阿里云发布 Qwen3.8-Flash,一款多模态 MoE 模型,为 Qwen4 架构的早期预览,现已开放权重。该模型拥有 125B 参数,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。其 API 定价为每百万输入 token 0.16 美元、输出 0.47 美元,原生支持 262K 上下文,可扩展至 1M。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新精选
Qwen3.8-Flash 开源,Qwen4 架构预览
通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,作为 Qwen4 架构的早期预览并开放权重。该模型总参数 125B,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。生产版 API 定价 $0.16/1M 输入 tokens 和 $0.47/1M 输出 tokens,原生上下文 262K,可扩展至 1M。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新普通
Z.ai 揭晓 Ox Alpha 实为 GLM-5.3-Flash
Z.ai 证实此前神秘模型 Ox Alpha 实为 GLM-5.3-Flash,其每日 100 万亿 token 的流量由数万块国产 AI 芯片支撑,而非 NVIDIA GPU 集群。
信息来源:X:Rohan Paul (@rohanpaul_ai) · GLM / NVIDIA
模型发布 / 更新普通
微信开源多模态嵌入模型 WeMM-Embedding
微信开源其多模态嵌入模型 WeMM-Embedding,9B 版本在 MMEB-v2 和 MMEB-v3 双榜登顶。2B 小版本跑分超越上一代 8B 开源顶流,靠几亿级数据对齐与细粒度蒸馏实现。该模型已部署于视频号、公众号、朋友圈和电商搜索推荐,支持文字、多图、长视频混合输入,维度截断至 256 维仍保留近 99% 性能,可大幅降低向量数据库存储与检索成本。
信息来源:X:阿易 AI Notes (@AYi_AInotes)
模型发布 / 更新普通
Qwen3.8-Flash-Next 与 GLM-5.3-Flash 发布,开源模型逼近前沿
Qwen3.8-Flash-Next(125B MoE,6B 激活)在 8/9 项基准上超越 Claude Opus 4.6 Max;GLM-5.3-Flash(320B 总参,18B 激活)在 Terminal-Bench 2.1 得 84.3 分,逼近 Opus 4.8 的 85.0。两者均为 MIT 许可、原生多模态、1M 上下文,但完整权重需专业工作站或本地服务器才能运行。
信息来源:X:Kim (@kimmonismus) · Qwen / Claude / GLM
模型发布 / 更新普通
Qwen3.8-Flash:高效多模态MoE模型,Qwen4架构早期预览
阿里发布Qwen3.8-Flash,一款多模态MoE模型,也是Qwen4架构的早期预览,现已开源权重。该模型总参数量125B,每token仅激活6B,原生上下文262K,可扩展至1M。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Qwen
模型发布 / 更新普通
阿里 Qwen 团队发布 Qwen3.8-Flash-Next:125B 多模态 MoE 模型,仅 6B 参数激活,预览 Qwen4 架构
阿里 Qwen 团队发布开源权重多模态 MoE 模型 Qwen3.8-Flash-Next,125B 主干搭配 51B N-gram 嵌入表和 4B 多 token 预测模块,每个 token 仅激活 6B 参数,被视为 Qwen4 架构的早期预览。
信息来源:MarkTechPost(RSS) · Qwen
模型发布 / 更新普通
前 Meta 科学家创办的 Perceptron 推出工业视觉模型 Isaac 0.5
由两位前 Meta FAIR 研究员创立的 Perceptron 推出视觉模型 Isaac 0.5,帮助机器在仓库、工厂等工业环境中感知、推理并行动,支持视觉引导机器人导航及提取视频信息。该模型以开放权重发布,训练数据含百万小时通用视频与 ego video。公司近期完成 2100 万美元融资。
信息来源:TechCrunch:AI(RSS)
模型发布 / 更新普通
可灵AI带你进入前所未见的世界
欢迎来到一个你从未见过的世界 👀
信息来源:X:可灵 Kling AI (@Kling_ai)
模型发布 / 更新普通
GLM-5.3-Flash 发布:320B-A18B 全面超越 GLM-5.2
智谱发布 GLM-5.3-Flash(320B-A18B),体积不到 GLM-5.2 一半,却在所有基准测试中全面超越后者。该模型原生多模态、支持 1M-token 上下文窗口,以 MIT 许可证开源,此前以 Ox Alpha 代号预览,完全运行于国产 AI 芯片。Databricks 将尽快为客户接入并实现超快运行。
信息来源:X:Yuchen Jin (@Yuchenj_UW) · GLM
模型发布 / 更新普通
智谱匿名模型Ox Alpha今晚开源,屠榜OpenRouter
在 OpenRouter 上匿名屠榜、调用量超 DeepSeek 一倍的 Ox Alpha 被证实为智谱出品,官方确认今晚开源权重。该模型以 Flash 级速度和成本实现前沿实战能力,支持 1M 上下文与图片视频多模态,推理优先架构,社区测试在 10 个高难度 Coding 任务中拿下 80% 过关率,全量 DeepSWE 跑出 64.6%。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · DeepSeek / GLM
模型发布 / 更新普通
智谱发布GLM-5.3-Flash开源多模态模型
ZHIPU AI 🔥:GLM-5.3-Flash(Ox Alpha)已正式发布! > GLM-5.3-Flash 是一款 320B-A18B 多模态模型。 > 采用 MIT 许可证。 > 此前名为 Ox Alpha,是 OpenRouter 上的一个隐身模型。 看来 GLM-5.3-Flash 和 Gemini 3.7 Flash 确实是"好朋友"。
信息来源:X:Testing Catalog (@testingcatalog) · Gemini / GLM
模型发布 / 更新普通
GLM-5.3-Flash 百T日活竟由中国芯片支撑
Ox Alpha 已揭晓为 GLM-5.3-Flash,但令人震惊的是,每天 100T tokens 的服务竟运行在中国芯片上。(1/3)🧵
信息来源:X:SemiAnalysis (@SemiAnalysis_) · GLM
模型发布 / 更新普通
GLM-5.3-Flash发布:多模态1M上下文
智谱发布GLM-5.3-Flash,原生多模态并支持1M token上下文窗口,性能对标Opus-4.8。该320B-A18B模型以MIT许可证开源,此前代号Ox Alpha,完全运行于国产AI芯片,现已通过HuggingFace、API等全平台上线。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · GLM / Hugging Face
模型发布 / 更新普通
阿里发布 Qwen3.8-Flash-Next,主打"极致成本效率"
阿里 Qwen 团队发布多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 的架构预览,总参数 1250 亿但每 token 仅激活 60 亿,并引入 510 亿参数的 N-gram 嵌入层,可运行于系统内存。
信息来源:The Decoder:AI News(RSS) · Qwen
模型发布 / 更新普通
GLM-5.3 Flash 发布:18B 激活参数效率惊人
GLM-5.3 Flash(Ox Alpha)正式发布,320B MoE 架构、每 token 仅激活 18B 参数,开源且 MIT 许可,原生多模态,支持 1M 上下文。
信息来源:X:Kim (@kimmonismus) · GLM
模型发布 / 更新普通
智谱开源 GLM-5.3-Flash 原生多模态模型,限时折扣价为 GLM-5.3 的 1/20
智谱上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,总参数量 320B、激活参数仅 18B。该模型在 AA 综合智能指数取得 57 分,与 Claude Opus 4.8 持平,编程表现亦相当;定价为 GLM-5.3 的 1/10,限时折扣为 1/20,为 Opus 4.8 的 1/40。模型已接入 ZCode 等平台,并开放 API 调用。
信息来源:IT之家(RSS) · Claude / GLM
模型发布 / 更新普通
Z.ai 证实 Ox Alpha 是其 GLM 系列新模型,将于周三开源权重
谜底揭晓:Ox Alpha 由智谱(Z.ai)打造,是其 GLM 系列最新迭代,此前匿名上线 OpenRouter 后已在多项基准测试中登顶。Z.ai 确认将于周三发布 Ox Alpha 权重,供开发者在其基础上构建。该模型被描述为面向编程、持续智能体工作与生产负载的推理模型,其发布加剧了中国高性价比模型对 OpenAI、Anthropic 等高价前沿模型的竞争威胁。
信息来源:TechCrunch:AI(RSS) · OpenAI / Claude / GLM
模型发布 / 更新普通
OpenRouter 揭晓 GLM-5.3-Flash 多模态模型
Ox Alpha 揭晓:@Zai_org 的 GLM-5.3-Flash,GLM-5 系列中首个原生多模态模型。 Ox Alpha 是 OpenRouter 上有史以来最大的模型,6 天内处理了超过 20 万亿 token。 立即继续使用该模型:https://openrouter.ai/z-ai/glm-5.3-flash
信息来源:X:OpenRouter (@OpenRouter) · GLM
模型发布 / 更新普通
智谱发布GLM-5.3-Flash,MIT开源320B模型
智谱推出GLM-5.3-Flash,原生多模态,支持1M-token上下文窗口,320B-A18B参数,MIT许可证开源。该模型此前以Ox Alpha代号预览,完全运行于国产AI芯片,现已在HuggingFace、API等全平台上线,主打高性价比。
信息来源:X:智谱 Z.ai (@Zai_org) · GLM / Hugging Face
模型发布 / 更新普通
GLM-5.3-Flash 开源:320B 总参数、AA 指数 57 分,定价为 Opus 4.8 的 1/40
智谱上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,AA 综合智能指数 57 分,与 Claude Opus 4.8 持平。其定价为 GLM-5.3 的 1/10,限时折扣内为 Opus 4.8 的 1/40,并已接入 ZCode 等平台开放 API 调用。该模型采用稀疏注意力与线性注意力混合架构,推理服务已跑在国产芯片集群上。
信息来源:公众号:智谱(GLM) · Claude / GLM
模型发布 / 更新普通
GLM-5.3 Flash 将发布,性能超 Opus 4.8
即将推出的 Ox Alpha 就是 GLM-5.3 Flash(如预期):总参数 320b,激活参数 18b。 以 1/10 的价格超越 GLM-5.2,在编程和智能体基准测试上接近 Opus 4.8。 大动作即将到来!
信息来源:X:Kim (@kimmonismus) · GLM
模型发布 / 更新普通
Z.ai 证实 Ox Alpha 是 GLM 系列新模型,将发布其权重
Z.ai 证实 Ox Alpha 是 GLM 系列的新模型,并宣布将发布其权重。该消息在 Hacker News 上引发关注,获得 267 个 HN Points。目前尚未披露具体参数量、benchmark 分数或发布时间等更多细节。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GLM
模型发布 / 更新精选
GLM-5.3-Flash:前沿智能进入普惠时代
智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,在AA综合智能指数取得57分,与Claude Opus 4.8持平。其定价为GLM-5.3的1/10(限时1/20),为Opus 4.8的1/40,并首次在大规模流量中由国产芯片集群提供算力支持。模型已接入ZCode等平台,同步开放API调用。
信息来源:智谱:研究(网页内嵌数据) · Claude / GLM
模型发布 / 更新普通
Qwen 开源 Qwen3.8-Flash-Next,SGLang 提供 Day-0 支持
Qwen 团队开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览版。该模型采用 125B 参数主模型加 51B N-gram Embedding,每 token 激活 6B 参数,共 48 层,MoE 层使用 512 个专家和 top-10 路由。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · Qwen
模型发布 / 更新普通
通义千问发布 Qwen3.8-Flash,开源 Qwen4 架构早期预览
通义千问发布 Qwen3.8-Flash,作为 Qwen4 架构的早期预览并开源权重。模型总参数 125B 加 51B N-gram 嵌入,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,SWE-bench Pro 得分 62.5,反超 Claude Opus 4.6 Max 的 53.4。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Qwen / Claude
模型发布 / 更新普通
阿里发布 Qwen3.8 Flash 多模态 MoE 模型
阿里巴巴发布 Qwen3.8 Flash,一款 125B 参数的多模态 MoE 模型,原生支持 262K 上下文,可通过 YaRN 扩展至 1M。API 定价为每百万输入 token $0.16、输出 token $0.47。该模型基于新架构构建,是 Qwen4 架构的前身,在 DeepSWE 1.1 和 SWE-bench Pro 上分别得分 58.7 和 62.5。
信息来源:X:Testing Catalog (@testingcatalog) · Qwen
模型发布 / 更新普通
阿里云 Wan3.0 登顶六大动画评测
阿里云 Wan3.0 在六大动画类别评测中均排名第一,同时在写实视频生成方面表现优异。KoyalAI CEO Mehul Agarwal 从专业电影制作视角对其进行了测试,Wan3.0 现已上线 KoyalAI 平台,并提供 Model Studio 和 Qwen Cloud 的 API 访问。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新普通
Qwen3.8-Flash-Next 发布,SGLang 首日支持
通义千问发布 Qwen3.8-Flash-Next,SGLang 即日支持部署。该模型为 125B 主模型,含 51B N-gram 嵌入,每 token 激活 6B 参数。N-gram 嵌入几乎不增加计算成本即可扩展容量,并可通过异步预取驻留内存;GDN+QSA 混合注意力兼顾长任务效率与检索精度。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新普通
OxAlpha新模型挑战DeepSeek
OxAlpha 是来自中国 Z.ai 的 GLM 新迭代版本。 它将改变你快速运行长时智能体的方式。 --- bloomberg.com/news/articles/2026-08-26/china-s-z-ai-made-ox-alpha-stealth-model-that-rivals-deepseek 来源:X:Rohan Paul (@rohanpaul_ai)
信息来源:X:Rohan Paul (@rohanpaul_ai) · DeepSeek / GLM
模型发布 / 更新普通
Qwen3.8-Flash-Next 获 vLLM 首发支持
通义千问 Qwen3.8-Flash-Next 获 vLLM 首发(day-0)支持,已在 NVIDIA 和 AMD GPU 上验证。该超稀疏多模态 MoE 模型拥有 125B 总参数、6B 激活参数、262K 原生上下文(经 YaRN 可扩展至 1M),并附带可卸载的 51B N-gram 表。模型现可通过 `vllm/vllm-openai:qwen38-flash-next` 镜像运行。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · OpenAI / Qwen / NVIDIA
模型发布 / 更新普通
Recraft V4 Styles 上线 OpenRouter
Recraft V4 Styles 已在 OpenRouter 上线。 精确模式遵循纹理、构图、色彩和渲染,而不仅仅是整体外观。可使用来自其他生成器、品牌素材或现有资产的 1-10 个参考。 来自 @recraftai 的 Styles、Vector、Pro 和 Pro Vector 如下 ↓ https://openrouter.ai/recraft
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新普通
Qwen3.8-Flash-Next 获 SGLang 首发支持
非常感谢 @sgl_project 的首日支持!🙌 Qwen3.8-Flash-Next 今日即可通过 SGLang 部署。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新普通
Qwen3.8-Flash-Next:6B激活参数击败Claude Opus 4.6 Max
Qwen3.8-Flash-Next 正式发布,这是一款高度稀疏的 MoE 模型,总参数 125B 外加 51B N-gram 嵌入,但每个 token 仅激活 6B 参数。
信息来源:X:Kim (@kimmonismus) · Qwen / Claude
模型发布 / 更新普通
Qwen3.8-Flash-Next发布,6B激活超越Claude Opus 4.6
Qwen3.8-Flash-Next正式发布,这是一款高度稀疏MoE开源多模态模型,总参数125B加51B n-gram嵌入,每token仅激活6B参数,原生256K上下文可经YaRN扩展至1M。
信息来源:X:Kim (@kimmonismus) · Qwen / Claude
模型发布 / 更新普通
阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
阿里通义千问团队发布 Qwen3.8-Flash,这是一款 125B 参数的多模态 MoE 模型,每 token 激活 6B 参数,原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。
信息来源:IT之家(RSS) · Qwen
模型发布 / 更新普通
通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览
通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。该模型总参数量 125B,每 token 仅激活 6B,原生上下文 262K,可扩展至 1M;训练成本仅为 Qwen3.7-Plus 的 1/9,并在编码和办公任务上表现更优。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新精选
Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览
通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。
信息来源:Qwen:Blog Retrieval(API) · Qwen