AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页14 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
Miso One 开源语音模型:8B 参数、110ms 延迟、一次语音克隆
Miso One 正式发布,一个 8B 参数的开源权重语音模型(TTS),旨在模拟真实人类朗读的温暖与节奏。它支持一次语音克隆(只需短样本),推理延迟仅 110ms。模型权重已开源至 GitHub,无需 API 即可自托管,音频数据不离开本地。API 访问即将推出。演示已上线,可先试听再克隆仓库。
信息来源:X:Kim (@kimmonismus)
模型发布 / 更新精选
商汤开源SenseNova U1:视觉理解推理生成一体模型
商汤(SenseTime)开源SenseNova U1模型,宣称实现"看、思考、创作"一体--从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
模型发布 / 更新精选
GPT-Rosalind 新功能发布
GPT-Rosalind 在生命科学研究领域推出新功能,增强了生物推理、药物化学专业知识、基因组学分析以及实验工作流处理能力。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)
xAI 通过 API 发布了图像转视频模型 `grok-imagine-video-1.5-preview`(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。
信息来源:xAI:News(网页) · Grok
模型发布 / 更新精选
MiniMax-M3 多模态模型发布,开源权重新SOTA
MiniMax-M3 在 @ValsAI 排名中位列第六 新的开源权重 SOTA 🚀
信息来源:X:MiniMax (@MiniMax_AI)
模型发布 / 更新精选
微软首款高级推理AI模型MAI-Thinking-1发布
微软在Build 2026上发布了其首款高级推理AI模型MAI-Thinking-1。该模型被定位为"中等规模",能在"关键"软件工程基准测试中达到领先模型的水平。微软称其完全从头使用干净数据进行训练,未涉及从第三方模型进行知识蒸馏。这标志着微软在自研AI模型上迈出重要一步,此前其主要依赖OpenAI。近期两家公司已重新协商合作协议,关系有所松绑。
信息来源:The Verge:AI(RSS) · OpenAI
模型发布 / 更新精选
Gemma 4 12B:开发者指南
Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。
信息来源:Google Developers Blog(RSS)
模型发布 / 更新精选
Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型
Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
MAI-Image-2.5 launches at No. 2 for image editing on Arena
信息来源:Microsoft AI:官方博客(网页)
模型发布 / 更新精选
Holo3.1:快速本地计算机使用智能体
Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 …
信息来源:Hugging Face:Blog(RSS) · Qwen / Hugging Face
模型发布 / 更新精选
蚂蚁 inclusionAI 开源万亿参数 MoE 基座模型 Ling-2.6-1T-base
Ling-2.6-1T-base 是蚂蚁 inclusionAI 开源的万亿参数 MoE 基座模型(总参约 1T,激活 63B)。它由 Ling-2.0-1T-base 升级而来,采用 Lightning Attention 与 MLA 以 7:1 混合的线性注意力架构,经约 9.6T token 的迁移预训练、持续预训练和中训练,上下文窗口从 4K 分阶段扩展至 256K。在 MMLU(86.82)、SimpleQA、LongBenchv2(43.54)等基准上超越前代。…
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
Building a hill-climbing machine: Launching seven new MAI models
信息来源:Microsoft AI:官方博客(网页)
模型发布 / 更新精选
商汤 SenseNova U1 发布信息图专用模型
感谢使用我们的模型来创建这些复杂的图表和图表。 看到具有挑战性的信息被转化为清晰、准确和可读的视觉效果真是太棒了。这就是我们的目标。😄
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
MiniMax M3 模型上线 Cloudflare AI Gateway
M3 on Cloudflare AI Gateway, day one ⚡ 前沿编码能力,1M 上下文,原生多模态,现在一次 fetch 即可调用。 是时候构建些东西了。 🦞
信息来源:X:MiniMax (@MiniMax_AI)
模型发布 / 更新精选
Qwen3.7-Plus 多模态智能体模型发布
Qwen3.7-Plus 深度融合视觉与语言,实现"看、想、写、做、验"端到端闭环,在 12 项核心基准测试中表现提升。实测中,基于该模型的智能体连续运行超 11 小时,自动完成英语学习 APP 开发,生成代码超 10000 行、触发调用超 1000 次;复刻 macOS Stocks 应用并通过 10 项功能验证。支持图像/视频转 SVG、视觉驱动网页设计及浏览器自动化。已在阿里云百炼上线,提供 OpenAI 兼容 API 与 Anthropic 协议。
信息来源:公众号:通义实验室(千问) · OpenAI / Qwen / Claude
模型发布 / 更新精选
英伟达 Cosmos 3
英伟达发布了 Cosmos 3,这是一个用于物理 AI 推理的世界和行动模型。该信息来源于英伟达开发者博客,发布日期为 2026 年 6 月 1 日。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · NVIDIA
模型发布 / 更新精选
JetBrains 发布 Mellum2:12B 参数混合专家模型
Mellum2 是 JetBrains 从头训练的 12B 参数混合专家(MoE)模型,专注于自然语言与代码。每个 token 仅激活 2.5B 参数,推理速度可达同类模型的 2 倍以上,适合高吞吐、低延迟场景。该模型支持路由、RAG、摘要、子智能体及私有部署,以 Apache 2.0 许可证开源。在代码生成、推理、科学和数学基准测试中,Mellum2 与同等规模的开放模型竞争力相当。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
SenseNova新模型解决AI图表生成难题
大多数AI模型在生成图表时存在数值错误(如负值显示为正)、柱状图位置偏移、元素关系混乱等问题。SenseNova-U1-8B-MoT-Infographic(SenseNova-U1)专为解决此类图表生成问题而设计,能够生成准确的图表,并支持实时调整设计和布局。项目在Hugging Face提供了模型,并在GitHub展示了效果案例。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
模型发布 / 更新精选
黄仁勋:英伟达下一代 AI 超级芯片平台 Vera Rubin 全面投产
英伟达 CEO 黄仁勋在 2026 台北电脑展宣布,下一代 AI 超级芯片平台 Vera Rubin 全面投产。该平台是 POD 级基础架构,与上一代 Grace Blackwell 平台相比,其大规模智能体吞吐量提高了 10 倍。凭借开源 MGX 设计,其供应链规模是 Grace Blackwell 的两倍,产品预计于今年秋季开始发货。
信息来源:IT之家(RSS) · NVIDIA
模型发布 / 更新精选
MiniMax M3:前沿编码、100万token上下文与原生多模态一体模型
MiniMax M3 是一个开源前沿模型,具备先进的编码与AI智能体能力。它支持100万token的超长上下文窗口,并采用名为MSA(MiniMax Sparse Attention)的新型稀疏注意力架构。该架构使模型在100万token上下文下的每token计算成本降至前代的1/20,预填充速度提升9倍以上,解码速度提升15倍以上。在SWE-Bench Pro编码基准上,MiniMax M3得分59.0%,超越GPT-5.5和Gemini 3.1 Pro,性能接近Opus…
信息来源:MiniMax:Blog(网页) · GPT / Gemini
模型发布 / 更新精选
Qwen3.7-Plus:多模态智能体模型发布
阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenW…
信息来源:Qwen:Blog Retrieval(API) · Qwen / Claude
模型发布 / 更新精选
MiniMax M3 发布:前沿 Coding、1M 上下文与原生多模态集于一身
MiniMax 发布 M3 模型,采用全新稀疏注意力架构 MSA,支持 1M 上下文窗口,并原生支持图片、视频输入及电脑桌面操作,是国内首个齐备这些要素的开源模型。
信息来源:公众号:MiniMax(稀宇科技)
模型发布 / 更新精选
xAI发布Composer 2.5
xAI的最新编程模型Composer 2.5现已在Grok Build中可用,用户可通过`/models`菜单选择使用。这是一款快速、先进的模型,擅长处理长时间运行的任务和复杂指令。该模型面向SuperGrok和X Premium+用户开放。
信息来源:xAI:News(网页) · Grok
模型发布 / 更新精选
本地设备 AI 图像生成模型 1-Bit Bonsai Image 4B 发布
1-Bit Bonsai Image 4B 是一款新的 AI 图像生成模型,其主要特点是面向本地设备进行优化,可以在用户的本地硬件上运行。这是一款专注于端侧部署的图像生成解决方案。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
Nano Banana Pro与Nano Banana 2正式发布
ICYMI:Nano Banana Pro 【gemini-3-pro-image】 和 Nano Banana 2 【gemini-3.1-flash-image】 现已正式发布,可通过 Gemini API 投入生产使用。 查看这些优秀的社区示例,了解两个模型的实际能力 🧵
信息来源:X:Google AI for Developers (@googleaidevs) · Gemini
模型发布 / 更新精选
Liquid AI 公布了在 38T 数据集上训练的 8B-A1B MoE 模型
Liquid AI 发布了其 LFM2-5 系列的 8B-A1B 模型,该模型采用混合专家(MoE)架构,在包含 38T token 的数据集上训练完成。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
OpenAI推出实时翻译模型,支持70+语言输入
OpenAI 实时翻译功能--使用70多种输入语言说话,翻译成13种输出语言: gpt-realtime-translate 接收任意语言的语音输入,并输出目标语言的语音。 大语言模型很棒,但特定用例需要专用模型。 我们正在智能眼镜上运行此功能。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT
模型发布 / 更新精选
Gemini Omni 与 Gemini 3.5 的 11 个实战展示
Google 在 2026 年 Google I/O 大会上发布了新一代多模态模型 Gemini Omni 与 Gemini 3.5,并同步提供了 11 个视频,集中演示了这两款模型在实际场景中的能力。
信息来源:Google Blog:AI(RSS) · Gemini
模型发布 / 更新精选
xAI 发布 Grok Build 0.1 公测版
grok-build-0.1 现已通过 xAI API 提供公开测试版。 这是驱动 Grok Build CLI 的同一模型,擅长智能体编码。 定价为输入 $1/m,输出 $2/m,极具成本效益、智能且快速。
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
模型发布 / 更新精选
Qwen-VLA:迈向通用具身智能的统一动作框架
通义实验室提出Qwen-VLA,以Qwen3.5-4B视觉语言主干与1.15B参数DiT动作解码器构建统一视觉-语言-动作模型。通过文本到动作DiT预训练和本体感知提示,将操作、导航与轨迹预测统一在同一框架下,支持11种机器人平台。在5个仿真基准中,单一通用模型在3个上超越最佳专用模型;ALOHA真机in-domain成功率83.6%,OOD泛化76.9%,分别超越π0.5超35和40个百分点;DOMINO动态操作零样本达26.6%;VLN-CE导航R2R和RxR分别达57…
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
ChatGPT上线GPT-5.5 Instant新版本
ChatGPT 新增 GPT-5.5 instant 模型: 我们今天发布了 GPT-5.5 instant 的新版本。之前的模型过于"子弹化"。新版本在其他一些重要维度上有所改进:谄媚性、事实性和多语言性能。希望你喜欢!我们始终对反馈感兴趣。
信息来源:X:Greg Brockman (@gdb) · ChatGPT / GPT
模型发布 / 更新精选
小米开源可控视频音效生成模型 ControlFoley,让声音"按你想要的来"
小米大模型应用团队发布开源可控视频音效生成模型 ControlFoley,旨在解决创作中的可控性难题。该模型统一支持文本引导视频配音、文本控制视频配音和参考音频控制视频配音三类任务。ControlFoley 在 VGGSound-Test 等多个 benchmark 上取得开源 SOTA 表现,其代码、模型权重和在线 Demo 均已开放。
信息来源:IT之家(RSS)
模型发布 / 更新精选
Qwen-VLA:从理解世界到付诸行动
通义千问推出通用视觉-语言-动作模型Qwen-VLA,基于Qwen多模态骨干,将视觉感知、语言理解与空间推理扩展至连续动作生成和轨迹预测。训练分四阶段:文本到动作预训练(T2A)、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在LIBERO上达97.9%,Simpler-WidowX达73.7%,RoboTwin-Easy/Hard达86.1%/87.2%,匹配或超越专精模型。数据涵盖超10,000小时公共机器人轨迹、1,000+小时内部真实轨迹及800万+合…
信息来源:Qwen:Blog Retrieval(API) · Qwen
模型发布 / 更新精选
阶跃发布 Step 3.7 Flash,面向生产级 Agent 的高效率 Flash 模型
阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ2-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode …
信息来源:公众号:阶跃星辰(Step) · Claude
模型发布 / 更新精选
Anthropic 发布 Opus 4.8 并推出新型"动态工作流"工具
Anthropic 发布了最新的 Opus 4.8 大语言模型,并为该模型引入了一个名为"Dynamic Workflows"的新工具。该工具旨在协调由多个子代理组成的群组,以执行复杂任务。
信息来源:TechCrunch:AI(RSS) · Claude
模型发布 / 更新精选
SenseNova信息图表生成模型升级:文本、布局与图表质量全面增强
SenseNova-U1-8B-MoT-Infographic 是一个升级后的8B参数信息图表生成模型。其核心提升在于:增强了文本的准确性与可读性,减少了重复和不自然的放大;改进了布局的一致性与合理性,背景更稳定;提升了图表与示意图的渲染质量;并新增了学术内容的渲染支持。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
MiMo-V2.5现已登陆OpenCode限时免费
MiMo-V2.5现已在OpenCode上线--限时免费。🎉 【引用 @opencode】:OpenCode x MiMo V2.5 - 限时免费 1M上下文 • 推理 • 文本 • 图像
信息来源:X:小米 MiMo (@XiaomiMiMo)
模型发布 / 更新精选
商汤发布信息图生成模型升级,增强多项核心能力
商汤科技介绍了其升级后的信息图生成模型 SenseNova-U1-8B-MoT-Infographic。该模型参数为8B,在四个关键维度进行了优化:文本准确性与可读性增强,减少了重复和不当放大;布局的一致性与合理性提升,背景更稳定;图表与示意图的质量提高;并新增了学术内容的渲染支持。推文提供了在 Hugging Face 上的模型页面链接及能力展示页面。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
模型发布 / 更新精选
Grok Build 0.1 on API
xAI 的最新编码模型 Grok Build 0.1 已通过 xAI API 进入公开测试阶段。该模型专为智能体编码任务训练,支持网页开发、调试和 MCP,同时也是驱动 Grok Build CLI 的同一模型。其推理速度超过 100 tokens/秒,定价为输入 $1/m tokens,输出 $2/m tokens。除编码外,它也适用于通用智能体及工具调用场景,并可通过 OpenRouter 和 Vercel AI Gateway 获取。
信息来源:xAI:News(网页) · Grok
模型发布 / 更新精选
Krea 2图像模型现已登陆ComfyUI
Krea 2现已登陆Comfy! KREA的首个基础图像模型--从零训练--具备可调节的创造力、风格参考和情绪板条件控制。
信息来源:X:Krea AI (@krea_ai)