AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页15 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级
Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增"动态工作流"特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Onlin…
信息来源:Anthropic:Newsroom(网页) · GPT / Claude
模型发布 / 更新精选
Qwen3.7-Max代码竞技场排名第四,与Claude Opus 4.6持平
🚀🚀 Qwen3.7-Max 刚刚在 Code Arena 上升至第 4 名,与 Claude Opus 4.6 持平,是榜单上排名最高的中国实验室!@arena 更多内容即将发布。敬请期待。🕶️
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen / Claude
模型发布 / 更新精选
面壁智能开源 MiniCPM5-1B:在 AA-Index 上超越所有 2B 参数以下模型,能跑在手机、浏览器上
面壁智能开源其新一代端侧大语言模型MiniCPM5-1B。该模型仅1B参数,在AA-Index榜单上超越所有2B参数以下模型,相比3个月前的Qwen3.5-2B效果更优且参数量减半。经INT4量化后权重仅0.5GB,支持在手机和浏览器上运行。其Base Model版本由面壁智能自主研发的AI训练框架ForgeTrain预训练完成,现已全面开源模型权重、训练数据集与部署方案。
信息来源:IT之家(RSS) · Qwen
模型发布 / 更新精选
谷歌 AI 框架 AlphaProof Nexus 攻克 2 道悬置 56 年数学难题
信息来源:IT之家(RSS)
模型发布 / 更新精选
inclusionAI 发布 SingGuard 系列模型
inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-4b。该模型是一种策略自适应多模态 LLM 护栏,将安全策略作为运行时输入而非固定训练分类,支持对文本、图像、图文、多语言、查询侧和响应侧进行安全评估。SingGuard 采用动态推理流程,可先快速输出首 token 安全信号,再继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全及多语言响应安全的六大类基准测试中,SingGuard 达到平均…
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
SingGuard: 策略自适应多模态护栏模型族开源
SingGuard 是一个策略自适应的多模态护栏模型族,包含 Sing-Guard-4b 和 Sing-Guard-8b 两个版本。它将安全策略作为运行时输入而非固定分类,部署团队可自定义自然语言规则而无需重训练模型。支持文本、图像、图文、多语言以及查询端与响应端的安全评估,提供快速和快慢结合两种推理模式。在涵盖多模态安全、纯图像安全、文本查询/响应安全、多语言查询/响应安全六大类基准上取得平均 SOTA 表现。模型已开源至 HuggingFace 和 ModelScope。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型族
inclusionAI 发布 SingGuard-8b,一个策略自适应(policy-adaptive)的多模态 LLM 安全护栏模型族,支持文本、图像、图文、多语言、查询侧和响应侧的安全评估。SingGuard 将活跃安全策略作为运行时输入,部署团队无需重训模型即可按默认或自定义自然语言规则进行审核。模型采用动态推理流程,先快速路由输出初步安全信号,再在需要时继续生成更精确的判断。在六大基准类别上,SingGuard 取得平均 SOTA 性能,并展现出对运行时策略的强适应…
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
蚂蚁 inclusionAI 发布策略自适应多模态安全护栏模型 Sing-Guard-8b
SingGuard 是蚂蚁 inclusionAI 推出的策略自适应多模态大语言模型安全护栏模型族(版本 Sing-Guard-8b),支持纯文本、纯图像、图文混合、多语言查询与回复的安全评估。其核心设计将安全策略作为运行时输入,部署团队可基于默认分类或自定义自然语言规则评估内容,无需重新训练模型。模型内置 fast-slow 动态推理流程:首 token 路由快速输出安全信号,需深度推理时继续生成更精确的最终判断。在涵盖多模态安全、纯图像安全、文本查询与回复安全、多语言查…
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b
inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
inclusionAI 发布 Sing-Guard-2b:策略自适应多模态大模型安全护栏
inclusionAI 开源了 Sing-Guard 模型家族,版本包括 Sing-Guard-2b 和 Sing-Guard-8b。该模型将安全策略作为运行时输入,支持文本、图像、图文及多语言场景的查询侧
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
蚂蚁 inclusionAI 开源 SingGuard 多模态安全护栏模型族
蚂蚁集团 inclusionAI 开源了 SingGuard 多模态安全护栏模型族,包含 2B、4B 和 8B 三个版本。SingGuard 将安全策略作为运行时输入而非训练时固定分类,部署团队无需重新训练即可按默认分类或自定义自然语言规则评估内容。模型支持文本、图像、图文、多语言、查询侧和回复侧的安全审核,采用"快-慢"动态推理机制。SingGuard 在多模态安全、图像安全、文本查询安全、文本回复安全、多语言查询安全及多语言回复安全基准上达到平均 SOTA 性能。模型基…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库 · Qwen
模型发布 / 更新精选
蚂蚁 inclusionAI 开源多模态安全护栏模型 SingGuard
SingGuard 是蚂蚁 inclusionAI 开源的多模态安全护栏模型族,提供 2B、4B、8B 三个参数版本。它将安全策略作为运行时输入,支持文本、图像、图文、多语言及查询/回复侧的安全评估,无需重新训练即可适配不同规则。采用快慢动态推理机制,在低延迟场景下输出紧凑判断,对模糊或高风险内容进行策略引导的推理。在多模态安全、图像安全、文本查询与回复安全、多语言查询与回复安全等基准上达到 SOTA 平均性能。模型已上架 HuggingFace 和 ModelScope。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库 · Hugging Face
模型发布 / 更新精选
Grok V9-Medium模型完成训练即将发布
Grok基础模型V9-Medium(1.5T)已完成训练。评估结果良好。补充训练中加入了大量Cursor数据,后续还会有更多。 微调正在进行中,强化学习将在几天后开始。预计2到3周内公开发布。 这将比当前服务所有Grok生产流量的0.5T v8-small模型有重大改进,尤其在复杂编码任务上。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok / Cursor
模型发布 / 更新精选
面壁智能联合清华等开源中国首个基于华为昇腾训练的 1.58-bit 端侧大模型 BitCPM-CANN
信息来源:IT之家(RSS)
模型发布 / 更新精选
StepAudio实时语音发布,能听懂你的语气与言外之意
StepAudio 2.5 Realtime 是一款实时语音交互模型。其核心优势在于能感知用户的副语言特征,如语气、节奏、停顿甚至轻叹,从而理解话语背后的真实意图。该模型支持通过 API 高度定制角色人格与说话风格,内置超过10,000种可组合的预置角色,并提供5种开箱即用的预设角色供体验。同时,模型经过RLHF优化,能在复杂的角色扮演压力测试中稳定保持设定的人设。支持中英文双语交互。
信息来源:X:阶跃星辰 StepFun (@StepFun_ai)
模型发布 / 更新精选
NVIDIA 发布 Nemotron-Labs Diffusion 系列模型,支持三种生成模式
NVIDIA 发布 Nemotron-Labs Diffusion 系列,含 3B、8B、14B 文本模型和 8B 视觉-语言模型(VLM),均采用商用友好的 NVIDIA Nemotron Open Model License 或 NVIDIA Source Code License。模型支持自回归、扩散(逐块并行生成后逐步精炼)和自推测(扩散草拟候选 token 再自回归验证)三种模式。8B 模型平均准确率比 Qwen3 8B 提升 1.2%,扩散模式每次前向传递的 t…
信息来源:Hugging Face:Blog(RSS) · Qwen / NVIDIA / Hugging Face
模型发布 / 更新精选
首个基于华为昇腾910B NPU全栈训练的1.58比特开源大模型BitCPM-CANN发布
ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署…
信息来源:X:Rohan Paul (@rohanpaul_ai)
模型发布 / 更新精选
网易有道"子曰4"多模态模型、语音合成模型全量开源
网易有道宣布将其"子曰"大模型4.0的多模态模型与语音合成模型面向全球全量开源。其中,多模态模型(27B参数)专注于教育场景,在处理高难度视觉数理问题上达到行业顶尖水平,纯文本中文数理难题准确率为81.4%。该模型通过思维链优化,将输出长度压缩43.2%,有效降低了推理成本。同时开源的语音合成模型支持跨语种音色与情感迁移克隆,3秒内即可完成零样本复制,准确度超97%,并支持包括中、英、日、韩在内的14种语言。
信息来源:IT之家(RSS)
模型发布 / 更新精选
LongCat-Video-Avatar 1.5 正式开源
美团正式开源 LongCat-Video-Avatar 1.5,在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现全面跃升。该模型采用 DMD 蒸馏将生成步骤压缩至 8 步,推理效率提升约 15 倍,生成 10 秒视频仅需约 1 分钟;Wav2Vec2 升级为 Whisper-large,并引入 GRPO 逐帧偏好对齐优化手部稳定性。
信息来源:公众号:龙猫LongCat(美团)
模型发布 / 更新精选
智谱GLM-5.1高速版发布:刷新全球大模型API速度纪录
5月22日,智谱向部分企业客户推出了旗舰大模型GLM-5.1的高速版API"GLM-5.1-highspeed"。该版本输出速度达400 tokens/s,刷新了全球大模型API速度上限。关键突破在于,它首次在国产大模型中实现了旗舰级能力与低延迟的结合,打破了"高速模型即轻量模型"的传统。该版本由智谱GLM团队与TileRT团队合作,通过系统级优化确保了速度的生产级稳定性,适用于AI编程、实时语音交互等场景。
信息来源:IT之家(RSS) · GLM
模型发布 / 更新精选
GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度
智谱面向部分企业客户推出GLM-5.1高速版API"GLM-5.1-highspeed",输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。
信息来源:公众号:智谱(GLM) · GLM
模型发布 / 更新精选
智谱推出GLM-5.1高速版
智谱发布GLM-5.1高速版,推理速度达400 tokens/s,在顶尖模型中生成速度最快。
信息来源:公众号:智谱(GLM) · GLM
模型发布 / 更新精选
阿里通义千问Qwen3.7-Max上线OpenRouter
阿里巴巴通义千问团队的全新Qwen3.7-Max现已登陆OpenRouter。 作为Qwen3.7系列的旗舰模型,专为以智能体为核心的工作场景打造:编程、办公与生产力任务,以及长周期自主执行。在编程和智能体基准测试中较Qwen3.6有显著提升,并支持显式提示缓存以处理重复上下文。
信息来源:X:OpenRouter (@OpenRouter) · Qwen
模型发布 / 更新精选
Qwen3.7-Max:面向Agent时代的旗舰模型
Qwen3.7-Max是Qwen系列面向Agent时代推出的最新旗舰模型,旨在为能完成实际任务的智能体提供强大基础。其核心能力包括:可作为端到端编码智能体,处理前端原型与多文件重构;作为可靠的办公助手,通过MCP集成与多智能体编排协同工作;并支持超长时间(超过35小时)的自主运行,执行复杂任务链。该模型兼容Claude Code、OpenClaw等主流开发框架,现已上线阿里云模型工作室与Qwen Studio提供服务。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen / Claude
模型发布 / 更新精选
LongCat-Video-Avatar-1.5:升级版音频驱动数字人视频生成框架
美团LongCat团队发布了LongCat-Video-Avatar-1.5,一个专注于音频驱动数字人视频生成的开源框架。其核心升级在于采用Whisper-Large音频编码器,显著优化了唇部动态的流畅度与自然度。该版本实现了精准的唇形同步、全身时序稳定性以及长视频中的身份一致性,并能泛化应用于动漫、动物及多人交互等复杂场景。通过基于DMD2的步蒸馏技术,模型仅需8步即可高效推理。团队还构建了一个涵盖多场景、多语言的人工评估基准,通过大规模主观评分与专家分析,验证了其在多项…
信息来源:美团 LongCat:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
腾讯开源Hy-MT2多语言翻译模型
腾讯正式开源Hy-MT2多语言翻译模型,支持33种语言间的无缝互译。其7B与30B-A3B版本在开源模型中达到最先进的翻译性能,超越了许多参数规模大数十倍的模型。更具突破性的是,1.8B轻量级版本性能超越微软等主流商业API,并凭借腾讯AngelSlim 1.25-bit极量化技术,仅需440MB存储空间,即可在主流手机芯片上本地运行,推理速度较前代提升1.5倍,显著降低了高质量AI翻译的部署门槛。
信息来源:X:腾讯混元 (@TencentHunyuan)
模型发布 / 更新精选
Gemini 3.5 Flash 正式发布
Gemini 3.5 Flash 已正式发布。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Gemini 3.5 Flash快速整理混乱输入
Gemini 3.5 Flash能快速提供整理好的结果,无论输入多么混乱。 看看Gemini如何将与客户的聊天和文本,转化为您小企业可用的文档。
信息来源:X:Gemini (@GeminiApp) · Gemini
模型发布 / 更新精选
Stability AI 推出音频模型 Stability Audio 3.0,可生成最长 6 分钟专业级歌曲
Stability AI 推出 Stability Audio 3.0 音频生成模型家族,包含四款不同规格模型,参数从45900万到27亿。小型模型专注设备端运行,可本地生成两分钟以内的音频;中型和大型模型支持创作超过6分20秒的完整音乐,
信息来源:IT之家(RSS)
模型发布 / 更新精选
SenseNova U1:同时思考文本与图像的AI
将你的想法转化为激发故事的视觉画面 🧨 【引用 @Adamaestr0_】:大多数AI工具可以写作或生成图像。 但这个能同时做这两件事。 向你介绍 SenseNova U1。 一个能同时思考文本和图像的AI。 这改变了一切 🧵
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
Qwen3.7-Max 重新定义 AI Agent 基座
通义实验室推出 Qwen3.7-Max,定位为重新定义 AI 智能体基座的模型,侧重提升智能体的基础能力与架构。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
Qwen3.7-Max:面向智能体时代的最新专有模型
通义千问发布 Qwen3.7-Max,专为智能体时代设计。它具备从原型到复杂多文件工程的编码智能体能力,通过 MCP 和多智能体编排实现办公自动化,能自主执行超 1000 步工具调用(如 35 小时全自主内核优化)。兼容 Claude Code、OpenClaw、Qwen Code 等多框架。在多项基准测试中超越 Opus-4.6 Max 等模型:Terminal Bench 2.0 (69.7)、SWE-Verified (80.4)、GPQA Diamond (92.4…
信息来源:Qwen:Blog Retrieval(API) · Qwen / Claude
模型发布 / 更新精选
Gemini Omni
Google DeepMind 于 2026 年 5 月 19 日发布了新一代多模态大模型 Gemini Omni。该模型整合了文本、图像、音频与视频的理解与生成能力,旨在实现更自然的人机交互。在同期 Hacker News 讨论中获得 112 点赞,显示出技术社区对多模态融合趋势的持续关注。这标志着大模型从单模态向全模态感知与响应能力的进一步演进。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Gemini
模型发布 / 更新精选
Gemini 3.5 Flash 发布,智能体与编码性能前沿
来自 #GoogleIO 现场,我们正在推出 Gemini 3.5 Flash,这是我们最新的模型,为智能体和编码提供前沿性能。我们今天在全球范围内推出,以其他前沿模型 4 倍的速度为现实世界的智能体工作流提供前沿级性能。🧵
信息来源:X:Noam Shazeer(@NoamShazeer) · Gemini
模型发布 / 更新精选
I/O 2026: 欢迎来到自主的 Gemini 时代
Google 在 I/O 2026 大会上宣布 Gemini 进入自主代理时代,新功能使其能够自动执行复杂任务,显著提升用户工作效率。大会展示了 Gemini 如何通过代理操作简化工作流程,实现自动化处理,例如自动管理邮件、安排日程或生成报告,帮助用户从重复性工作中解放出来,专注于创造性任务。这一更新基于先进机器学习模型,强调准确性与效率,标志着 AI 助手向更智能、更自主的方向发展。
信息来源:Google Blog:AI(RSS) · Gemini
模型发布 / 更新精选
Gemini 3.5:前沿智能与行动能力相结合
Google 在 I/O 大会上正式发布了最新的 Gemini 3.5 模型系列。该系列模型将前沿的人工智能能力与执行操作的功能相结合,旨在提供更强的综合性能。作为 Google 最新推出的模型,它代表了其在大模型技术上的最新进展。
信息来源:Google Blog:AI(RSS) · Gemini
模型发布 / 更新精选
谷歌发布Gemini Omni Flash,Pro版即将推出
谷歌 I/O 🔥:GEMINI OMNI FLASH 已发布,现已在 GEMINI 和 GOOGLE FLOW 上可用。 GEMINI OMNI PRO 即将推出 🤩
信息来源:X:Testing Catalog (@testingcatalog) · Gemini
模型发布 / 更新精选
Gemini Omni发布,迈向AGI新进展
"迈向AGI的进展":Gemini Omni - 世界模型 -Gemini Omni官方发布!! 它可以从任何输入创建任何内容!!!
信息来源:X:Kim (@kimmonismus) · Gemini
模型发布 / 更新精选
谷歌I/O大会发布Gemini 3.5 Flash
谷歌I/O 🔥:我们今天将迎来 Gemini 3.5 Flash! >; GEMINI >; GEMINI >; GEMINI >; GEM 👀 【引用 @AiBattle_】:Gemini 3.5 Flash 刚刚出现在 Google Cloud 控制台中 它来了
信息来源:X:Testing Catalog (@testingcatalog) · Gemini
模型发布 / 更新精选
Qwen3.5-LiveTranslate:从声音到视觉,从词语到准确
Qwen3.5-LiveTranslate-Flash 是 Qwen 家族最新的同声传译模型,基于 Qwen3.5-Omni 架构,支持实时多模态翻译(音频、视频及视觉上下文)。语言覆盖大幅扩展:输入音频与输出文本从18种增至60种,输出音频从10种增至29种。采用 Readable Unit 技术,平均端到端每 token 延迟降至2.8秒,相比前代首 token 延迟降低3.45秒、每 token 延迟降低1.88秒。支持一句话启动的实时语音克隆和可动态配置的热词增强。…
信息来源:Qwen:Blog Retrieval(API) · Qwen