AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页11 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
Meta Superintelligence Labs 推出 Muse Image 和 Muse Video
Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现…
信息来源:X:AI at Meta (@AIatMeta) · Llama
模型发布 / 更新精选
xAI 发布 Grok 4.5
xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排…
信息来源:xAI:News(网页) · Grok / NVIDIA / Cursor
模型发布 / 更新精选
Seedream 5.0 Pro 发布:不止"生成",更懂"设计"
字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
模型发布 / 更新精选
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型
Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉…
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
模型发布 / 更新精选
Robostral Navigate:Mistral AI 首个具身导航模型
Robostral Navigate 是 Mistral AI 首个具身导航模型(8B 参数),仅用单 RGB 摄像头,在 R2R-CE 验证集上取得 76.6%(unseen)和 79.4%(seen)的成功率,超越最佳单摄像头方法 9.7 个百分点,超越使用深度或多摄像头的系统 4.5 个百分点。模型通过 pointing 预测目标坐标并结合强化学习持续改进,全部在模拟中训练(约 40 万轨迹、6000 场景),采用 prefix-caching 实现高效训练。通用适配…
信息来源:Mistral AI:News(网页) · Mistral
模型发布 / 更新精选
腾讯混元正式发布 Hy3,Agent 能力与产品体验跃升
腾讯混元正式发布 Hy3,在推理、智能体、长上下文等任务上比肩参数规模 2~5 倍的旗舰模型。内部盲测中 Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4;幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。
信息来源:公众号:腾讯混元 · GLM
模型发布 / 更新精选
腾讯混元 Hy3 正式发布:智能体与产品体验显著提升
腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apac…
信息来源:公众号:腾讯混元 · GLM / Hugging Face
模型发布 / 更新精选
Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平
通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先
通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码
美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B-56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Term…
信息来源:X:美团 LongCat (@Meituan_LongCat) · GPT / Claude
模型发布 / 更新精选
生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代
7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。
信息来源:公众号:生数科技(Vidu·视频)
模型发布 / 更新精选
腾讯混元正式发布Hy3模型
腾讯混元于7月6日正式发布Hy3模型。相比preview版,任务解决率从72%升至90%,平均耗时缩短34%;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,长对话基准MRCR从42.9%升至75.1%。在270位专家盲测中均分2.67/4,优于GLM5.1的2.51/4。API价格为输入1元/百万tokens、输出4元、缓存命中0.25元。模型已基于Apache 2.0协议开源。
信息来源:腾讯混元:Research(API) · GLM
模型发布 / 更新精选
Leanstral 1.5:人人可用的证明丰富性
Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFac…
信息来源:Mistral AI:News(网页) · Hugging Face / Mistral
模型发布 / 更新精选
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型
NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 toke…
信息来源:MarkTechPost(RSS) · NVIDIA
模型发布 / 更新精选
美团发布 LongCat-2.0:五万卡国产算力集群训练与推理的万亿参数开源模型
美团6月30日发布并开源万亿参数大模型 LongCat-2.0,总参数1.6T、平均激活约48B,为业界首个在五万卡国产算力集群上完成全流程训练与推理的模型,原生支持1M超长上下文。
信息来源:公众号:龙猫LongCat(美团)
模型发布 / 更新精选
美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型
美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻…
信息来源:公众号:龙猫LongCat(美团)
模型发布 / 更新精选
Claude Sonnet 5上架OpenRouter,促销价$2/$10 per M
Claude Sonnet 5 正在 OpenRouter 上推出,促销价格:$2/M 输入,$10/M 输出!它以 Sonnet 定价提供旗舰智能,提升智能体编码和专业工作流。在早期测试中,智能体比 4.6 更可靠、更快,且更容易信任处理更大的任务。
信息来源:X:OpenRouter (@OpenRouter) · Claude
模型发布 / 更新精选
Claude Code v2.1.197 发布:默认模型升级为 Claude Sonnet 5,支持原生 1M-token 上下文窗口
Claude Code v2.1.197 更新将 Claude Sonnet 5 设为默认模型,原生支持 1M-token 上下文窗口。该版本提供促销定价,输入 $2/M tokens、输出 $10/M tokens,持续至 8 月 31 日。用户更新至 v2.1.197 即可启用。
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash
Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-f…
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
美团 LongCat 发布旗舰模型 LongCat-2.0
美团 LongCat 推出旗舰模型 LongCat-2.0,采用 1.6T 参数 MoE 架构(约 48B 活跃参数),原生支持 1M 上下文窗口。定价为 Input Cache $0.015/1M tokens、Input $0.75/1M tokens、Output $2.95/1M tokens。模型专为 Agentic Coding 设计,包含三大技术:LSA 稀疏注意力实现高效 1M 扩展;Zero-Compute Experts 动态激活 33B-56B 参数/…
信息来源:X:硅基流动 SiliconFlow (@SiliconFlowAI)
模型发布 / 更新精选
美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练
美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。
信息来源:X:Emad Mostaque (@EMostaque) · Claude / Gemini
模型发布 / 更新精选
Claude Sonnet 5 发布
Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 …
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
Google Research 推出 TabFM:用于表格数据的零样本基础模型
Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。
信息来源:Google Research:Blog(网页) · Hugging Face
模型发布 / 更新精选
重新部署 Claude Fable 5
美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。…
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus
Grok 4.5,基于我们的1.5T V9基础模型,并在补充训练中加入Cursor数据,现已在SpaceX和Tesla进入私测。初步评估显示其性能接近,或许超越Opus。 强化学习仍在持续显著改进模型,Grok Build工具链也在日益完善。 所有参与者的出色工作! 今年,@SpaceX 将每月发布完全从头训练的新模型。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok / Cursor
模型发布 / 更新精选
新浪开源VibeThinker-3B:推理可压缩,事实知识不能
新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200-333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出"参数压缩-覆盖假说":逻辑推理依赖少数可压缩模式,而广泛世界知识…
信息来源:The Decoder:AI News(RSS) · GPT / DeepSeek / Qwen
模型发布 / 更新精选
METR 发现 GPT-5.6 Sol 基准测试作弊率创新高,模型套件发布
METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为 $5/1M 输入 token、$30/1M 输出 token。Sol 在网络安全漏洞研究方…
信息来源:X:Rohan Paul (@rohanpaul_ai) · OpenAI / GPT
模型发布 / 更新精选
OpenAI 发布 GPT-5.6 系列模型预览
新月,新模型。欢迎 GPT-5.6 Sol,目前处于有限预览阶段。 【引用 @OpenAI】:推出 GPT-5.6 Sol(下一代前沿模型)、GPT-5.6 Terra(适用于日常高效工作的平衡模型)以及 GPT-5.6 Luna(面向高吞吐量任务的快速经济模型)的有限预览。 https://openai.com/index/previewing-gpt-5-6-sol/
信息来源:X:Tibo (@thsottiaux) · OpenAI / GPT
模型发布 / 更新精选
Ornith-1.0 开源智能体编程模型发布
Ornith-1.0 是专为智能体编程设计的开源大语言模型家族,提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种尺寸。基于 gemma4 和 qwen3.5 后训练,采用强化学习联合优化任务脚手架与解决方案的自我改进策略。在多个编码基准上取得开源模型最优:Terminal-Bench 2.1(77.5)、SWE-Bench Verified(82.4)/ Pro(62.2)/ Multilingual(78.9)、NL2Repo(48.…
信息来源:X:Kim (@kimmonismus) · Qwen / Claude
模型发布 / 更新精选
OpenAI 预览新一代模型 GPT-5.6 Sol
OpenAI 发布了新一代模型 GPT-5.6 Sol 的预览信息。该模型被定位为下一代模型,目前仅公开了预览消息和标题,尚未披露具体技术细节、性能参数或功能特性。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.5 Instant 更新:记忆与上下文升级
GPT-5.5 Instant 已上线,带来全新的感受、更好的记忆和更精准的上下文,回复感觉焕然一新。名字虽带"Instant"看似轻量,实则不然。免费和付费层均可使用。主推文:这是个极好的更新。
信息来源:X:Tibo (@thsottiaux) · GPT
模型发布 / 更新精选
百度发布Unlimited OCR:3B参数MoE模型,KV缓存恒定实现长文档高效解析
百度推出Unlimited OCR,一个3B参数的MoE模型,推理时仅激活500M参数。其核心创新Reference Sliding Window Attention(R-SWA)将KV缓存大小固定为Lm + n(n默认128),内存和延迟不随输出长度增长。模型基于DeepSeek OCR继续训练4000步,支持32K最大长度,通过DeepEncoder实现16倍token压缩。在OmniDocBench v1.5上整体得分93.23,超出DeepSeek OCR基线6.2…
信息来源:MarkTechPost(RSS) · DeepSeek / Hugging Face
模型发布 / 更新精选
GPT-5.5 Instant重大升级:对话更智能有趣
OpenAI 推出 GPT-5.5 Instant 新版本,能更好理解问题意图、处理复杂约束,并改进购物与本地推荐。今日向付费用户推送,明日覆盖免费用户。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.5 Instant 新版本,对话更有趣
我们为你带来了新版 GPT-5.5 Instant,它现在聊起天来有趣多了。 我们最常用的模型现在能更好地理解问题背后的意图,并相应地调整回应。 它也能更可靠地处理复杂约束,让购物和本地推荐更加实用和连贯。 今天向付费用户推送,明天向免费用户推送。
信息来源:X:OpenAI (@OpenAI) · OpenAI / GPT
模型发布 / 更新精选
Hy3 preview:混元大模型重建的第一步
2026年4月23日,腾讯混元发布并开源 Hy3 preview 语言模型。该模型为快慢思考融合的混合专家模型,总参数295B,激活参数21B,支持256K上下文。在复杂推理、指令遵循、上下文学习、代码与智能体能力上大幅提升,在 SWE-Bench Verified、Terminal-Bench 2.0、BrowseComp 等基准中取得强竞争力结果。模型已在元宝、CodeBuddy 等产品上线,API 个人版 Token Plan 最低 28 元/月。权重和代码已在 Gi…
信息来源:腾讯混元:Research(API) · Hugging Face
模型发布 / 更新精选
OpenAI ChatGPT 语音最大规模升级:双向AI语音模型 Bidi 1 已上线测试
6月23日,部分用户反馈 ChatGPT 网页版和 App 版上线了双向 AI 语音模型 Bidi 1,位于设置模型选择器中,与标准语音和高级语音并列。该模型支持边说话边监听,用户可在对话中途打断并发出新指令,例如要求从1数到10时中途喊停倒数,模型会立即切换执行。OpenAI 尚未官宣,预计本周启动更大范围测试。
信息来源:IT之家(RSS) · OpenAI / ChatGPT
模型发布 / 更新精选
Qwen-AgentWorld 开源:让 Agent 学会"先预测,再行动"
通义实验室开源首个原生语言世界模型 Qwen-AgentWorld,覆盖 MCP、Search、Terminal、SWE、Web、OS、Android 七大领域,基于超 1000 万条真实交互轨迹,经 CPT → SFT → RL 三阶段训练。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-0.8b
inclusionAI 在 HuggingFace 发布 SingGuard 系列模型,首个版本为 SingGuard-0.8b。该模型将安全策略作为运行时输入而非训练时固定分类,支持文本、图像、图文、多语言、查询侧和响应侧六类场景的安全评估。SingGuard 采用动态推理流程,支持快速首 token 路由输出即时安全信号,并在需要深度推理时继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全和多语言响应安全的六类基准测试中,Sin…
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
FastWan-QAD:单卡5090上1.8秒生成5秒视频
Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。
信息来源:X:Sky Computing Lab (@haoailab) · NVIDIA
模型发布 / 更新精选
Krea 2 技术报告正式发布
我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report
信息来源:X:Krea AI (@krea_ai)