AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页8 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
Meta 发布开源模型 Muse Glimmer
推出 Muse Glimmer,一款开放权重、300 亿参数的模型,专为本地、常驻运行的智能体工作流优化。 与同尺寸领先模型相比,Muse Glimmer 在关键智能体用例和基准测试中表现出色,并设计为完全在消费级硬件(如 Mac 或配备高性能 GPU 的 PC)上运行。 秉承我们长期分享基础 AI 研究的传统,我们以宽松的 Apache 2.0 许可证发布模型权重。
信息来源:X:AI at Meta (@AIatMeta)
模型发布 / 更新精选
Scale AI 开源 Muse 系列模型
1/ 今天有个重大消息:我们很快将发布 Muse Spark 1.2 的开源权重版本。 同时,我们还将发布 Muse Glimmer--一个 30B 参数的智能体模型,采用 Apache 2.0 协议开源权重。Muse Glimmer 可在 24GB 显存上运行,且不损失智能体可靠性。🧵
信息来源:X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
模型发布 / 更新精选
OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
信息来源:MarkTechPost(RSS) · NVIDIA
模型发布 / 更新精选
inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark
inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
信息来源:公众号:蚂蚁百灵(Ling)
模型发布 / 更新精选
谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时
谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有效预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展。
信息来源:IT之家(RSS)
模型发布 / 更新精选
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
信息来源:NVIDIA Blog(RSS) · NVIDIA
模型发布 / 更新精选
ChatGPT 推出改进版 GPT-5.6 Sol,并扩大免费用户访问权限
ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型
NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。
信息来源:MarkTechPost(RSS) · NVIDIA
模型发布 / 更新精选
Qwen-Image-3.0-Pro 上线 Qwen Cloud
阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
模型发布 / 更新精选
OpenRouter 上线 FLUX 3 Video 统一多模态模型
@bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。 一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新精选
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现"边看、边听、边说"的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
模型发布 / 更新精选
商汤 SenseNova U1 开源:统一推理与图像生成
商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
模型发布 / 更新精选
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
信息来源:NVIDIA Blog(RSS) · NVIDIA
模型发布 / 更新精选
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。
信息来源:公众号:腾讯混元
模型发布 / 更新精选
商汤发布 SenseNova U1.5-Lite-Preview 开源模型
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。
信息来源:公众号:MiniMax(稀宇科技)
模型发布 / 更新精选
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
信息来源:Qwen:Blog Retrieval(API) · Qwen
模型发布 / 更新精选
UEmbed:统一稀疏与稠密的多模态嵌入模型
UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
DeepSeek V4 Flash 0731 开源,登顶开源模型前三
DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · DeepSeek
模型发布 / 更新精选
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频
MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。
信息来源:MiniMax:Blog(网页)
模型发布 / 更新精选
DeepSeek-V4-Flash API公测上线,Agent能力大幅升级
🚀 DeepSeek-V4-Flash 官方 API 现已上线公测! 🔷 我们大幅升级了其 Agent 能力--基准测试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses API 格式,并已完全适配 Codex! 查看我们官方 API 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
信息来源:X:DeepSeek (@deepseek_ai) · DeepSeek
模型发布 / 更新精选
DeepSeek V4 Flash 正式版发布:后训练重做,九项 Agent 测试全面超越 V4 Pro Preview
DeepSeek V4 Flash 正式版发布,模型结构和参数规模不变,仅重做后训练,Terminal Bench 2.1 从 61.8 涨至 82.7,DeepSWE 从 7.3 涨至 54.4。
信息来源:公众号:数字生命卡兹克 · GPT / DeepSeek / Claude
模型发布 / 更新精选
MiniMax H3 发布并将开源,主打视觉包装与后期特效
MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。
信息来源:公众号:数字生命卡兹克
模型发布 / 更新精选
Inkling-Small 发布,276B 参数性能持平原版
今天,我们发布 Inkling-Small。 Inkling-Small 在仅为 Inkling 四分之一规模的情况下,实现了与之相当的性能。它拥有 276B 总参数,12B 激活参数。我们将开放完整权重。 https://thinkingmachines.ai/news/inkling-small/ 现在即可在 Tinker 上对其进行微调,或在 Tinker Playground 中以文本、图像和音频形式与之对话。
信息来源:X:Thinking Machines (@thinkymachines)
模型发布 / 更新精选
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑
字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
模型发布 / 更新精选
Google DeepMind 发布 Gemini Robotics 2 物理 AI
One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
GPT-5.6 如何推进性价比前沿
OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测
OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制
Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
OpenAI 推出两款新转录模型 API
我们在 API 中引入了两种新的转录模型: • GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。 两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI / GPT
模型发布 / 更新精选
Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%
Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。
信息来源:MarkTechPost(RSS)
模型发布 / 更新精选
FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA
Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Hugging Face
模型发布 / 更新精选
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。
信息来源:公众号:月之暗面(Kimi) · Kimi
模型发布 / 更新精选
Kimi K3 开源:2.8T MoE 模型与技术报告
Kimi 发布其最强模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,具备原生视觉理解和 1M token 上下文窗口。新架构实现了每单位计算 2.5 倍的智能提升。除模型权重外,Kimi 还开源了高性能注意力内核、MoE 通信库及大规模智能体运行环境基础设施。
信息来源:X:Kimi.ai (@Kimi_Moonshot) · Kimi
模型发布 / 更新精选
Midjourney V8.2 发布:专注美学提升与个性化理解
Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
信息来源:Midjourney:Updates(RSS)
模型发布 / 更新精选
FLUX 3 x mimic:新一代视频动作模型
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频
Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。
信息来源:IT之家(RSS)