AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章917
当前页2 / 23
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新普通
四小时后可下载运行SOTA AI模型
快速提醒:4小时后,你将能够下载并运行SOTA级AI。当然,前提是你有足够的算力。活在这个时代真不错。
信息来源:X:Kim (@kimmonismus)
模型发布 / 更新普通
腾讯混元 Hy4 预览版上线 WorkBuddy,限时免费
腾讯混元 Hy4 预览版现已上线 WorkBuddy,在真实智能体工作流中测试表现亮眼,涵盖研究、Office 任务、前端开发与游戏开发。Hy4 在信息检索整合、跨文件分析与 Excel 准确性、前端视觉与交互设计、以及从自然语言构建可玩原型等任务上均有提升。Hy4 预览版在 WorkBuddy 上未来两周免费,Hy3 免费至 9 月底。
信息来源:X:Tencent WorkBuddy (@WorkBuddy_AI)
模型发布 / 更新普通
万相3.0上线Medeo,支持30秒原生视频生成
阿里云万相(Wan 3.0)正式上线 @Medeo_AI,支持原生30秒视频生成、同步音频,以及多模态 Omni Reference 带来的角色与风格一致性。视频支持1080p电影级画质与真实物理效果。API 已开放,可通过 Model Studio 和 Qwen Cloud 获取。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新普通
阿里云 Wan 3.0 上线 DeepInfra,视频音频一体
阿里云 Wan 3.0 现已上线 DeepInfra,单模型同时支持视频与音频生成,可生成 30 秒 1080P 片段,并支持图像、文件乃至网页等多模态参考,角色一致性得以保持。价格 $0.20/秒,另可通过 Model Studio 与 Qwen Cloud 调用 API。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新普通
万相3.0上线Pixel Dojo,附提示词指南
Wan 3.0 现已上线 @PixelDojoAI!查看指南并开始创作吧。👇 更多 API 接入方式: • Model Studio: https://click.alibabacloud.com/m/20000002017/ • Qwen Cloud: https://click.qwencloud.com/m/20000002025/
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新普通
阿里云 Wan3.0 上线 A2E,支持 30 秒视频生成与编辑
阿里云 Wan3.0 登陆 A2E 平台,支持从文本或图像生成完整 30 秒视频。用户可编辑时间线、扩展场景、重绘镜头并重塑视觉元素,全程保持角色一致性。API 已通过 Model Studio 和 Qwen Cloud 开放。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新普通
Midjourney 开始测试 V8.2 编辑模型
我们今天将开始测试首个 V8.2 编辑模型。该模型支持指令编辑、用其他图像生成图像(最多 4 张参考图)、基于笔刷的局部重绘和外绘。它还可与个性化、情绪板和 srefs 配合使用。玩得开心!
信息来源:X:Midjourney (@midjourney)
模型发布 / 更新普通
智谱开源 GLM-5.3 权重上线 Hugging Face
智谱 Z.ai 8-28 将 GLM-5.3 开源权重(safetensors)上线 Hugging Face 官方 zai-org 仓,为此前 API 与技术博客之后的权重落地(非新模型首发,亦非 GLM-5.3-Flash)。官方模型卡说明 GLM-5.3 与 GLM-5.2 使用同一基座、增益来自后训练,主打编码与网络安全任务提升,许可为 glm-5.3。本文不写未交叉核验的参数规模与跑分。
信息来源:AI Insight · GLM / Hugging Face
模型发布 / 更新普通
腾讯发布 Hy4 Preview:770B 开源模型
腾讯发布 Hy4 Preview,770B 参数开源模型,49B 激活参数,1M token 上下文窗口。其智能体研究能力可并行协调多个 Codex 会话并评估结果、调整方向,在八项基准上超越 Codex 单独运行。Hy4 面向长时编码、多文件办公与科学研究,定价稳定实惠。
信息来源:X:Kim (@kimmonismus)
模型发布 / 更新普通
曝谷歌内部开始测试 Gemini 3.8 Flash 模型,Pro 和 Flash 系列"冰火两重天"
谷歌部分员工已开始试用 Gemini 3.8 Flash 预览版,该模型已登陆内部编程平台 Jetski。一名参与测试的员工称,其体验已明显好于 3.7 Flash,但现阶段还不适合下完整结论。谷歌正以数周为间隔快速更新模型,CEO 皮查伊希望将发布节奏提高到接近每月一次。
信息来源:IT之家(RSS) · Gemini
模型发布 / 更新普通
腾讯发布开源 MoE 旗舰模型 Hy4 Preview
腾讯发布 Hy4 Preview,一款采用 Apache License 2.0 的开源权重模型。该模型为新一代 MoE 旗舰,拥有 770B 总参数、49B 激活参数和 1M 上下文窗口,主打生产力场景,并保持定价稳定。
信息来源:X:Testing Catalog (@testingcatalog)
模型发布 / 更新普通
Qwen3.8-Flash上线GMI Cloud,Qwen4架构预览
Qwen3.8-Flash 现已在 @gmi_cloud 上线--这是一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。更多 API 访问方式: • Model Studio: https://click.alibabacloud.com/m/20000002820/ • Qwen Cloud: https://click.qwencloud.com/m/20000002828/ #BuildWithQwen
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
模型发布 / 更新普通
腾讯混元发布Hy4预览版,770B参数开源
🚀 Hy4 预览版来了。 770B 参数,49B 激活,1M 上下文。为生产力而生。开源前沿。价格稳定实惠。去用它,告诉我们哪里有问题。 更多内容见 Hy 博客:https://hy.tencent.ai/research/hy4-preview HuggingFace:https://huggingface.co/tencent/Hy4-preview Github:https://github.com/Tencent-Hunyuan/Hy4-preview
信息来源:X:腾讯混元 (@TencentHunyuan) · Hugging Face
模型发布 / 更新普通
腾讯发布混元 Hy4 preview 模型,稳居开源模型第一梯队
腾讯今日发布混元 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并上线腾讯云 TokenHub 和 OpenRouter。
信息来源:IT之家(RSS)
模型发布 / 更新精选
腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。
信息来源:公众号:腾讯混元
模型发布 / 更新普通
Google 发布 Gemini 3.5 Transcribe:85+ 语言平均 WER 2.6% 的语音转文本模型
Google 发布 Gemini 3.5 Transcribe 语音转文本模型,通过 Interactions API 和 Live API 分别提供预录文件与双向流式处理。
信息来源:MarkTechPost(RSS) · Gemini
模型发布 / 更新普通
GLM-5.3-Flash 推理速度达 270 tok/s
GLM-5.3-Flash 达到 270 tok/s! Databricks 推理团队火力全开。为团队感到骄傲! 在我们 OfficeQA Pro v2 基准测试中,GLM-5.3-Flash 以仅 1/10 的成本,质量比 GLM-5.2 高出 10%。 又快、又便宜、又好。
信息来源:X:Yuchen Jin (@Yuchenj_UW) · GLM
模型发布 / 更新普通
蚂蚁百灵推出金融增强模型 Ling-3.0-flash-Fin:API 限免一个月,下周开源
蚂蚁百灵今日推出金融增强模型 Ling-3.0-flash-Fin,延续 Ling-3.0-flash 架构,保持 124B 总参数、5.1B 激活参数,模型权重将于下周开源。
信息来源:IT之家(RSS)
模型发布 / 更新普通
蚂蚁百灵发布金融增强模型 Ling-3.0-flash-Fin,面向真实金融工作流
蚂蚁集团联合中金等机构发布金融增强模型 Ling-3.0-flash-Fin,延续 Ling-3.0-flash 架构,保持 124B 总参数、5.1B 激活参数,通过金融语料持续预训练强化年报、财务工作簿等复杂内容处理。
信息来源:公众号:蚂蚁百灵(Ling)
模型发布 / 更新普通
谷歌推出 Gemini Omni 1.1 Flash 视频生成 AI 模型,最高 4K 分辨率
谷歌推出 Gemini Omni 1.1 Flash 视频生成 AI 模型,最高可生成 4K 视频。新模型支持场景扩展(每次 10 秒步长,单条最长 40 秒)、指定首尾帧及最长 3 秒视频参考。360p 预览生成速度较标准 720p 最高提升 60%,成本仅为三分之一;价格从 360p 每秒 0.03 美元到 4K 每秒 0.3 美元不等。
信息来源:IT之家(RSS) · Gemini
模型发布 / 更新精选
Midjourney 开放 V8.2 图像编辑模型测试
Midjourney 开始向所有用户开放其首个 V8.2 图像编辑模型的测试。该模型支持指令编辑、以图生图(最多同时引用 4 张参考图)、局部重绘与扩画,并兼容个性化、moodboards 和 srefs 功能。用户可通过网页端或 Discord 的 `--edit` 命令使用,官方同步更新了 midjourney.com 与 alpha.midjourney.com 的界面。
信息来源:Midjourney:Updates(RSS)
模型发布 / 更新普通
MiniMax H3 助力 fal 打造 H3 Max
MiniMax 发文祝贺 fal 团队基于 MiniMax H3 推出 H3 Max。fal 对 H3 进行后训练以提升提示词遵循与视觉质量,并协同设计推理栈,在提速同时持续测试质量,仅保留不损失后训练收益的优化。
信息来源:X:MiniMax (@MiniMax_AI)
模型发布 / 更新普通
MiniMax 与 fal 合作推出 H3 Max 视频模型
MiniMax 祝贺 fal 团队推出基于其开源模型的后训练视频模型 H3 Max,该模型在质量、提示理解和美学方面排名第一,生成 5 秒 720p 视频仅需不到 3 秒。fal 同时优化了推理系统以实现超实时性能。H3 Max 发布首周享 50% 折扣。
信息来源:X:MiniMax (@MiniMax_AI)
模型发布 / 更新普通
MiniMax 开源 H3 基础模型,生态后训练登顶
MiniMax 祝贺 fal 团队基于其开源 H3 基础模型后训练的 H3 Max 视频模型登顶多项评测。H3 Max 在整体质量、提示词理解和美学上均排名第一,生成 5 秒 720p 视频耗时低于 3 秒,且本周价格五折。MiniMax 强调后训练只是释放基础模型已有能力,并指出 SGLang 训练管线及 Sol-Attention 引擎带来 3.95 倍端到端加速。
信息来源:X:MiniMax (@MiniMax_AI)
模型发布 / 更新普通
Gemini Omni 1.1 Flash 发布:新增场景扩展、4K 升级等生成视频控制能力
Google 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成视频能力。新功能包括场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量延长至累计 40 秒)、首尾帧插值、360p 快速草稿(比 720p 快至多 60%、成本为其三分之一)以及最高 4K 分辨率升级。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Gemini
模型发布 / 更新普通
Cohere 发布 Parse 5(parse-v5.0):2.3B 视觉语言模型,将企业文档转为 Markdown
Cohere 发布文档解析模型 Parse(parse-v5.0),基于 North-Micro-Vision-Instruct 架构,拥有 2.3B 参数、8,192-token 上下文窗口和约 4.6GB 体积,可将 PDF、PPT、JPEG 页面直接转为含 HTML 表格和边界框坐标的 Markdown,无需独立 OCR 阶段。
信息来源:MarkTechPost(RSS)
模型发布 / 更新普通
蚂蚁百灵发布金融增强模型 Ling-3.0-flash-Fin
蚂蚁百灵推出金融增强版 Ling-3.0-flash-Fin,总参数 124B、激活参数 5.1B,面向信息检索、研究、估值建模与报告撰写。
信息来源:X:蚂蚁百灵 (@AntLingAGI)
模型发布 / 更新普通
Google 发布 Gemini Omni 1.1 Flash,视频生成更便宜更灵活
Google 将 Gemini Omni Flash 视频模型升级至 1.1 版本,场景扩展可分析现有视频最多十秒而非仅最后一秒,并以 10 秒为增量延长至 40 秒。
信息来源:The Decoder:AI News(RSS) · Gemini
模型发布 / 更新普通
Gemini Omni Flash 1.1 发布,支持视频扩展
很高兴将 Gemini Omni Flash 1.1 带给世界,这是对我们"任意输入、任意输出"世界模型的更新。它现在支持: - 360p 草稿、4K 上采样器 - 扩展时最多 10 秒的视频上下文 - 以 10 秒为增量进行视频扩展 - 视频参考
信息来源:X:Logan Kilpatrick (@OfficialLoganK) · Gemini
模型发布 / 更新普通
Gemini Omni 1.1 Flash 发布,支持 4K 视频生成
Google 正式发布多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,现已上线 Gemini API 和 Google AI Studio。新模型为开发者提供场景扩展、指定镜头起止帧、视频输入参考等创意控制,并支持将片段放大至 4K、以 360p 快速测试想法。
信息来源:X:Testing Catalog (@testingcatalog) · Gemini
模型发布 / 更新普通
Gemini Omni 1.1 Flash 发布,场景扩展大升级
Google 发布多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,支持 4K 超分、首尾帧控制及快速 360p 草稿。最大升级是场景扩展:基于原视频 10 秒上下文进行扩展,远超 Veo 的 1 秒,带来更强一致性与更长叙事。
信息来源:X:Google AI (@GoogleAI) · Gemini
模型发布 / 更新精选
Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制
Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新普通
Google 发布 Omni 1.1 Flash 视频模型
GOOGLE 🔥:Omni 1.1 Flash 视频模型即将发布,支持 1080p 和 4K 输出分辨率选项。 很快推出 👀
信息来源:X:Testing Catalog (@testingcatalog)
模型发布 / 更新普通
Cohere 发布 Parse 5 文档解析模型
Cohere 推出 Parse 5 文档解析模型,主打市场最强性价比。此前企业需在高成本高精度解析与低成本有损解析间取舍,Parse 5 以行业最低每页价格实现高质量解析,适合大规模企业数据处理。
信息来源:X:Aidan Gomez(Cohere CEO,@aidangomez)
模型发布 / 更新普通
GLM-5.3-Flash 开源上线硅基流动
Ox-Alpha🐮 已揭晓。👀 认识来自 @Zai_org 的 GLM-5.3-Flash -- 现已开源,并已在 SiliconFlow 上线。⚡ 一如既往的 Day-0 支持。 总计 320B 参数,仅 18B 激活。原生多模态。MIT 许可。让前沿智能更可及。强于 GLM-5.2。成本降低 90%。编码与智能体任务接近 Opus 4.8。成本降低 >95%。 在 SiliconFlow 上:优化推理、高可用性、生产级规模容量。立即在 SiliconFlow 上构建…
信息来源:X:硅基流动 SiliconFlow (@SiliconFlowAI) · GLM
模型发布 / 更新普通
Cohere 发布 Parse 5 文档解析模型
推出 Cohere Parse 5。这是我们最新的文档解析模型,拥有市场上最强的性价比。 非常适合高吞吐量的企业工作。在保持每页价格处于行业低位的同时,获得高质量的解析准确率。
信息来源:X:Cohere(@cohere)
模型发布 / 更新普通
Lux3D:3D 生成正从"提示词"走向"API 调用"
Manycore Tech 发布新 3D 生成模型 Lux3D,最快 20 秒生成 3D 资产,支持高质量材质纹理与 Harness Mode 批量创建。Rohan Paul 指出,其 API 可被编码智能体反复调用,从规格说明批量生成 3D 道具并送入 Blender 处理,使 3D 生成成为更大智能体执行循环中的一环,而非简单的"图生 3D"工具。
信息来源:X:Rohan Paul (@rohanpaul_ai)
模型发布 / 更新普通
Google 发布 Gemini 3.5 Transcribe,支持 85 种语言实时语音转文字
Google 推出 Gemini 3.5 Transcribe 语音转文字模型,支持 85 种以上语言,可自动去除"um"等填充词、纠正口误并自动排版。流式转录词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。
信息来源:The Decoder:AI News(RSS) · Gemini
模型发布 / 更新普通
智谱开源GLM-5.3-Flash,国产芯片驱动
智谱于8月26日开源GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型。其线上流量完全运行在10万颗国产芯片上。发布前,匿名"Ox Alpha"模型在OpenRouter和OpenCode上处理了62T token--同样使用中国硬件。据报道,供应商可能包括华为、海光和摩尔线程。该模型在Artificial Analysis上得分为57,与Claude Opus 4.8持平,而成本仅为GLM-5.3的十分之一。开放模型、国产算力、全球需求。
信息来源:X:X.PIN (@thexpin) · Claude / GLM
模型发布 / 更新普通
GLM-5.3-Flash 发布:3200 亿参数、百万上下文,成本仅为 GLM-5.3 的约 1/7.5
Z.ai 发布 GLM-5.3-Flash,3200 亿总参数(180 亿激活)、百万 token 上下文窗口,MIT 许可开源。该模型在 Intelligence Index 上得 57 分,接近 GLM-5.3 的 60 分,但每任务成本仅 0.09 美元,约为后者的 7.5 分之一。该模型全程运行于国产 AI 芯片,Z.ai 自研服务软件实现了与 Nvidia GPU 相当的性能。
信息来源:The Decoder:AI News(RSS) · GLM / NVIDIA