AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章920
当前页3 / 23
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新普通
Google 发布 Gemini 3.5 Transcribe,支持 85 种语言实时语音转文字
Google 推出 Gemini 3.5 Transcribe 语音转文字模型,支持 85 种以上语言,可自动去除"um"等填充词、纠正口误并自动排版。流式转录词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。
信息来源:The Decoder:AI News(RSS) · Gemini
模型发布 / 更新普通
智谱开源GLM-5.3-Flash,国产芯片驱动
智谱于8月26日开源GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型。其线上流量完全运行在10万颗国产芯片上。发布前,匿名"Ox Alpha"模型在OpenRouter和OpenCode上处理了62T token--同样使用中国硬件。据报道,供应商可能包括华为、海光和摩尔线程。该模型在Artificial Analysis上得分为57,与Claude Opus 4.8持平,而成本仅为GLM-5.3的十分之一。开放模型、国产算力、全球需求。
信息来源:X:X.PIN (@thexpin) · Claude / GLM
模型发布 / 更新普通
GLM-5.3-Flash 发布:3200 亿参数、百万上下文,成本仅为 GLM-5.3 的约 1/7.5
Z.ai 发布 GLM-5.3-Flash,3200 亿总参数(180 亿激活)、百万 token 上下文窗口,MIT 许可开源。该模型在 Intelligence Index 上得 57 分,接近 GLM-5.3 的 60 分,但每任务成本仅 0.09 美元,约为后者的 7.5 分之一。该模型全程运行于国产 AI 芯片,Z.ai 自研服务软件实现了与 Nvidia GPU 相当的性能。
信息来源:The Decoder:AI News(RSS) · GLM / NVIDIA
模型发布 / 更新普通
Grok 4.6 登陆微软 Foundry 平台
突发:SpaceXAI 的 Grok 4.6 现已上线 Microsoft Foundry Models。 在 Foundry 上使用 Grok 4.6 进行构建,企业组织可在此对比前沿 AI 模型、运行工作负载专项测试、部署托管端点,并以企业级安全与治理管控进行运营。
信息来源:X:cb_doge (@cb_doge) · Grok
模型发布 / 更新普通
小鹏第二代 VLA 全新版本 9 月推送,面向所有 Ultra / Ultra SE 车型
小鹏第二代 VLA 全新版本将于9月面向Ultra和Ultra SE车型推送,Lite蒸馏版同步开启首批推送,G9L Max首发搭载。该版本基于统一技术底座贯通L2至L4能力,X-Foresight预测世界模型首次上车,可预判未来6秒交通参与者行为,并引入Infini-VLA长时序架构记忆前30秒世界。
信息来源:IT之家(RSS)
模型发布 / 更新普通
小鹏第二代 VLA Lite 蒸馏版 9 月推送,G9L Max 版首发搭载
小鹏汽车宣布第二代 VLA Lite 蒸馏版将于 9 月开启推送,面向单图灵芯片的 Max 车型,G9L Max 版首发搭载。该版本通过学习式 Token 压缩与蒸馏训练,以更少的有效 Token 实现高质量视觉理解,将基座模型能力部署到算力更低的平台。第二代 VLA 基于统一技术底座,已实现 L2 至 L4 能力贯通。
信息来源:IT之家(RSS)
模型发布 / 更新普通
小鹏 X-Foresight 预测世界模型首次上车,可预判未来 6 秒交通参与者行为
小鹏在第二代 VLA 全新版本体验日宣布 X-Foresight 预测世界模型首次上车,可预判未来 6 秒周边交通参与者的可能行为,并引用 Flow Matching 预测多种未来。第二代 VLA 还引入 Infini-VLA 长时序架构,可记忆前 30 秒世界,并采用 MoT 混合架构减少场景任务干扰。模型推理效率同步提升,端到端响应提速 300%,实现"边看、边想、边行动"的并行处理。
信息来源:IT之家(RSS)
模型发布 / 更新普通
小鹏刘先明:第二代 VLA 升级核心是让模型首次建立对时间维度的理解
小鹏集团通用智能中心负责人刘先明在物理 AI 分享会上表示,第二代 VLA 升级的核心是让模型第一次建立起对时间维度的理解。小鹏物理世界基座模型首次将"时间"纳入模型,AI 理解维度从"3D 空间"跃迁至"4D 时空",并引入 Infini-VLA 长时序架构,可记住前 30 秒的世界。第二代 VLA 同步采用流式自回归推理,端到端响应提速 300%,实现"边看、边想、边行动"的并行处理。
信息来源:IT之家(RSS)
模型发布 / 更新普通
Qwen3.8-Flash 上线,超低价格引关注
Qwen3.8-Flash 已在 @qwen_cloud 上线:输入 $0.15/1M tokens,输出 $0.47/1M tokens,缓存命中仅 $0.016/1M tokens。☁️ 快来试试吧!👇 【引用 @qwen_cloud】:Qwen3.8-Flash API 已在 QwenCloud 上线。原生 262K 上下文,可扩展至 1M,定价适合规模化部署。 价格详情⬇️ 输入:$0.15 / 1M tokens 输出:$0.47 / 1M tokens 缓存命…
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新普通
Qwen3.8-Flash上线OpenRouter
Qwen3.8-Flash 现已上线 @OpenRouter!⚡ 编程助手、智能体工作流、长视频理解,一个 API 调用即可全部实现。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新精选
唐杰宣布GLM-5.3 Flash AA登顶OpenRouter
Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。
信息来源:X:唐杰(@jietang) · GLM
模型发布 / 更新普通
谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅
谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除"嗯""呃"等口头禅及说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,支持 85 种语言及最多 3 名说话者的预录音频。该模型已为 Pixel 11 上 Gboard 的"Rambler"功能提供支持,后续将进入更多谷歌产品。
信息来源:IT之家(RSS) · Gemini
模型发布 / 更新普通
GLM-5.3 开源权重 22 小时后发布
GLM-5.3 开源权重 22 小时后发布!!! 我很兴奋。
信息来源:X:Yuchen Jin (@Yuchenj_UW) · GLM
模型发布 / 更新普通
智谱 GLM-5.3 权重明日开源
更多好消息:GLM-5.3 的权重将于明日发布。 https://huggingface.co/zai-org/GLM-5.3
信息来源:X:智谱 Z.ai (@Zai_org) · GLM / Hugging Face
模型发布 / 更新普通
Qwen3.8-Flash-Next 发布:Qwen 开源多模态 MoE 模型,提前预览 Qwen4 架构
Qwen 发布开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览。模型总参数 125B,仅激活 6B 参数,带来显著性能提升。作者已在 DGX Spark 上通过 Unsloth 量化版本试用,包括 72.5GB 的 UD-IQ1_S 和 78.9GB 的 UD-Q2_K_XL 版本。
信息来源:Simon Willison 博客 · Qwen
模型发布 / 更新普通
Meta Muse 图像模型上线 OpenRouter
Meta 的 Muse 图像模型现已在 OpenRouter 上线。基于搜索增强,定价面向生产级用量,每张图像 $0.01。 可创建和编辑复杂图像,且保留未修改部分不变,价格极具竞争力,让大规模创意工作成为可能。
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新普通
智谱发布GLM-5.3-Flash,匿名模型OX Alpha正式亮相
智谱正式发布GLM-5.3-Flash,即此前在OpenRouter和OpenCode上爆火的匿名模型OX Alpha。该模型为总参数320B、激活18B的MoE架构,是GLM-5系列首个原生多模态模型,支持图像、视频和文本输入,原生上下文100万。
信息来源:公众号:数字生命卡兹克 · GLM
模型发布 / 更新普通
通义千问 Qwen3.8 Flash 上线 OpenRouter
来自 @Alibaba_Qwen 的 Qwen3.8 Flash 现已上线 OpenRouter。 这是一款多模态推理模型,适用于编程助手、智能体工作流、视觉理解、代码库与文档分析、桌面交互、图表及长视频处理。 https://openrouter.ai/qwen/qwen3.8-flash
信息来源:X:OpenRouter (@OpenRouter) · Qwen
模型发布 / 更新普通
Sam Altman 提议为下个模型再办发布会
我觉得我们应该为下一个模型的发布再办一次派对,5.5 的派对非常有趣。 下一次怎样做才能让它更棒?
信息来源:X:Sam Altman (@sama)
模型发布 / 更新普通
Z.ai 发布 GLM-5.3-Flash:320B-A18B 原生多模态 MoE,支持 100 万 token 上下文
Z.ai 发布 GLM-5.3-Flash,这是 GLM-5 系列首款原生多模态模型,320B 总参数、18B 激活参数,支持 100 万 token 上下文和图像/视频输入,权重以 MIT 许可开源在 Hugging Face。
信息来源:MarkTechPost(RSS) · GLM / Hugging Face
模型发布 / 更新普通
Gemini 3.5 Transcribe 发布,智能转写 API 上线
Google 发布 Gemini 3.5 Transcribe,智能转写语音为"实际意图文本",可消除口误、过滤语气词、格式化数字日期并适配自定义词汇。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Gemini
模型发布 / 更新普通
MiniMax H3 Max登顶图生视频榜
MiniMax H3 Max(fal 后训练版)在 Artificial Analysis 视频榜登顶图生视频(含音频)第 1、文生视频第 3,均超越基础版 H3。该模型由 fal 构建并托管,生成 5-15 秒带原生音频的 768p 视频,定价 $0.04/秒。fal 计划开源权重,若实现将成为两榜最高排名开源模型。
信息来源:X:Artificial Analysis (@ArtificialAnlys)
模型发布 / 更新普通
Gemini 3.5 Transcribe 发布,AA-WER 2.6% 排名第五
Google 发布 Gemini 3.5 Transcribe 与 Transcribe Live 两款 API:前者面向预录音频,AA-WER 2.6% 排名第五,处理速度约 84 倍实时;后者面向流式传输,首个最终转录延迟 0.40 秒,WER 4.0%。两者均支持 85+ 语言,预录版支持最多三人带时间戳的说话人识别,价格分别约 $5 与 $9 每千分钟。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · Gemini
模型发布 / 更新普通
Google 推出 Gemini 3.5 Transcribe 语音转文本 AI 模型
Google 发布 Gemini 3.5 Transcribe,用于语音输入的 AI 模型,可去除"嗯"等语气词并润色文本。相比上一代 Chirp 3,语音到最终文本速度提升约 70%,实时语音错误率降至 5.5%。
信息来源:Ars Technica:AI(RSS) · Gemini
模型发布 / 更新普通
Perceptron 开源具身基础模型 Isaac 0.5,将遥操作需求降低 210 倍
Perceptron 发布开源具身基础模型 Isaac 0.5,这是一个 36B 参数动态 MoE 模型,通过扩展无动作视频将遥操作需求降低 210 倍。该模型可输入摄像头图像/视频、人类指令和机器人当前状态,输出物体位置、任务进度或下一步动作,既能微调后直接控制机械臂,也可仅用于感知。
信息来源:X:Rohan Paul (@rohanpaul_ai)
模型发布 / 更新普通
Qwen3.8-Flash-Next 发布,融合 Qwen4 架构创新
阿里通义千问发布 Qwen3.8-Flash-Next,采用与即将推出的 Qwen4 相同的架构创新。包括 510 亿参数的 N-gram Embedding(可将嵌入表卸载至低速廉价 DRAM)、门控残差连接(GR),以及微块粒度选择上下文的 Qwen 稀疏注意力(QSA)。这些创新展示了中国开源模型在残差连接等方向的前沿探索。
信息来源:X:SemiAnalysis (@SemiAnalysis_) · Qwen
模型发布 / 更新普通
Qwen 新架构开源:125B 总参仅激活 6B
Qwen 团队开源新架构,总参数 125B 加 51B 嵌入,每 token 仅激活 6B,训练成本降至上一代 1/9,SWE-bench Pro 拿下 62.5,反超 Claude Opus 4.6 Max 的 53.4。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · Qwen / Claude
模型发布 / 更新普通
GLM-5.3-Flash 发布,支持 1M 上下文与 MIT 许可
智谱发布 GLM-5.3-Flash,320B-A18B 参数、原生多模态、1M-token 上下文窗口,MIT 许可开源,此前预览名为 Ox Alpha,完全运行于国产 AI 芯片。DAIR.AI 创始人推荐用 /eli5 制作视觉解释器,并可在其新 agent 游乐场搭配 Pi 或 Hermes Agent 试用。模型权重与 API 已在官方平台开放。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · GLM
模型发布 / 更新普通
Anthropic 明日发布 Fable 5.1 及 Opus 更新
Anthropic 正筹备明日发布,预计推出 Fable 5.1 及可能的 Opus 更新。据 @legit_api,Fable 已开始路由至新版 Fable 5.1,发布在即。@synthwavedd 称若不想难堪,最迟需下周初发布。
信息来源:X:Kim (@kimmonismus) · Claude
模型发布 / 更新普通
GLM-5.3-Flash 发布:低成本登顶性价比前沿
智谱发布 GLM-5.3-Flash,320B 总参数、18B 激活参数,在 Artificial Analysis 智能指数上以最大推理强度得 57 分,仅比 GLM-5.3 低 3 分,与 GPT-5.6 Terra 和 Muse Spark 1.2 持平。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · GPT / GLM
模型发布 / 更新普通
Gemini 3.5 Transcribe 发布,支持85+语言
推出 Gemini 3.5 Transcribe 🚀 我们最精准的语音转文字模型,支持 85+ 种语言,具备智能纠错和自定义词汇功能。 我用该模型 vibe coding 了一个类似 Wispr Flow 的应用。 演示 + 开源如下!
信息来源:X:Ammaar Reshi (@ammaar) · Gemini
模型发布 / 更新普通
Gemini 3.5 Transcribe 上线 AI Studio 与桌面端
GOOGLE 🔥:全新的 Gemini 3.5 Transcribe 现已登陆 Google AI Studio、API 以及 macOS 版 Gemini Desktop! > "开箱即用,自动识别 85+ 种语言"
信息来源:X:Testing Catalog (@testingcatalog) · Gemini
模型发布 / 更新普通
Gemini 3.5 Transcribe 发布,支持实时流式转写
推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精准的转写(更低 WER)、自定义词汇支持、多说话人识别,并支持超过 85 种语言! 同时支持实时流式传输!
信息来源:X:Logan Kilpatrick (@OfficialLoganK) · Gemini
模型发布 / 更新普通
Gemini 3.5 Transcribe 发布,精准语音转写
Google 推出 Gemini 3.5 Transcribe 语音转写模型,支持 85+ 语言,可自动过滤语气词、格式化非结构化语音,并结合屏幕上下文执行语音指令。该模型还能利用多模态能力将杂乱语音输入和本地文件直接转为邮件草稿。
信息来源:X:Google AI (@GoogleAI) · Gemini
模型发布 / 更新普通
Gemini 3.5 Transcribe 语音转写模型发布
🗣️💬 向 Gemini 3.5 Transcribe 问好,这是一款真正理解你代码库的语音转文本模型。 观看这款最新模型如何在 @Antigravity 中构建时,过滤口头犹豫,同时将技术术语、文件名和代码变量精确锚定到当前上下文中。通过使用视觉偏置,该模型为复杂的开发者工作流带来了深度的、屏幕感知的上下文。
信息来源:X:Google AI for Developers (@googleaidevs) · Gemini
模型发布 / 更新普通
Gemini 3.5 Transcribe 发布,支持多语言转录
向 Gemini 3.5 Transcribe 问好! - 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:) API 现已在 @GoogleAIStudio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用! 更多详情:https://blog.google/innovation-and-…
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
模型发布 / 更新普通
Gemini 3.5 Transcribe 语音转文本模型发布
Gemini 3.5 Transcribe 是我们最新的语音转文本模型,用于精准、智能的转录。🧵
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型
Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新普通
Google 发布 Gemini 3.5 Transcribe 转录模型,可自动去除"um""ah"等填充词
Google 推出 Gemini Audio 家族新成员 Gemini 3.5 Transcribe,可自动识别专业术语和超过 85 种语言,并自动格式化文本、去除"um""uh"等填充词。该模型支持自定义词汇表、为最多三位说话人区分语音,并提供词级时间戳。今日起向 macOS Gemini 应用用户开放英语版本,开发者可通过 Gemini API 公开预览使用。
信息来源:The Verge:AI(RSS) · Gemini
模型发布 / 更新普通
Qwen3.8-Flash 75GB 内存本地运行
一款高性能 125B 模型现在仅需 75GB 内存即可本地运行!感谢 @UnslothAI 的 Day-0 支持。🥳
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen