AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章920
当前页20 / 23
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
Claude for Excel 与 Claude for PowerPoint 实现无缝同步
Claude for Excel 和 Claude for PowerPoint 新增跨文件上下文同步功能。同时打开多个文件时,对话上下文自动共享,可直接从表格提取数据构建演示文稿,无需重复说明操作步骤。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
Claude 新增交互式图表、图解与可视化功能
Claude 推出可视化功能测试版,支持在对话中实时生成交互式图表、图解等视觉内容,无需代码即可随对话调整修改。该功能不同于可下载的 Artifacts,以内联临时形式辅助理解当前话题,默认向所有套餐用户开启。同时 Claude 还新增食谱、天气等主题格式,并支持在对话内直接交互 Figma、Canva 和 Slack 等应用。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
当今前沿推理模型的配方与 AlphaGo 惊人相似:
当今前沿推理模型的训练路径与 AlphaGo 高度一致:先模仿大量人类数据,再扩展推理计算(从蒙特卡洛树搜索到思维链),最后用强化学习突破模仿上限。Demis Hassabis 称,十年前 AlphaGo 的"第37步"预示 AI 可攻克真实科学难题,这些思路对构建 AGI 仍至关重要。
信息来源:X:Noam Brown (@polynoamial)
模型发布 / 更新精选
Gemini 推出更新,让 Google Workspace 更个性化、实用且协作更高效
Gemini 为 Google Workspace 推出多项 AI 功能:支持选择来源秒级生成 Doc 草稿、9 倍速构建复杂 Sheets、提示词生成品牌风格 Slide 布局,Drive 搜索现可直接显示摘要答案。今日起向 Ultra 和 Pro 订阅者开放英文版 beta,Docs/Sheets/Slides 全球可用,Drive 仅限美国。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
模型发布 / 更新精选
改进前沿 LLM 的指令层级
IH-Challenge 训练模型优先处理可信指令,改进指令层级、安全可控性,并提升对提示词注入攻击的抵抗能力。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
模型发布 / 更新精选
Hugging Face Hub 正式推出 Storage Buckets 存储服务
Hugging Face Hub 发布 Storage Buckets,这是一种为机器学习工作流设计的可变、类 S3 的对象存储服务。它基于 Xet 存储后端,能对跨文件共享内容的 ML 工件进行高效去重,从而节省带宽、加速传输并降低存储成本。该服务还提供"预暖"功能,可将数据预先迁移至靠近计算资源的云区域,以提升分布式训练等场景的效率。目前支持 AWS 和 GCP,用户可通过 CLI 或 Python 库在 2 分钟内快速创建和同步存储桶。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
保持令牌流动:16个开源强化学习库的教训
同步强化学习训练中,数据生成是主要瓶颈,如在320亿参数模型上生成3.2万令牌样本需数小时,导致训练GPU闲置。业界主流解决方案是将推理与训练解耦到不同GPU池,通过rollout缓冲区连接并异步传输权重。本文调研了16个实现此模式的开源库,从编排原语、缓冲区设计、权重同步协议、陈旧数据处理、部分rollout支持、LoRA支持及分布式训练后端七个维度比较。关键发现:Ray在编排层占主导(8/16库使用),NCCL广播是默认权重传输方式,LoRA训练支持普遍不足,而分布式M…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Ulysses Sequence Parallelism: 实现百万令牌上下文的训练
研究团队发布了Ulysses序列并行方法,这是一种用于训练大型语言模型的新技术。该方法通过将长序列在设备间进行特定维度的分割与重组,实现了对极长上下文的并行处理。其核心变化在于能高效训练上下文长度高达百万令牌的模型,突破了现有方法在序列长度上的扩展瓶颈。这一进展使得在保持高训练效率的同时,处理书籍、长文档等超长文本成为可能,为推进AI的民主化与开源发展提供了关键技术支撑。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
GPT-5.4 is great at coding, knowledge work, computer use, etc, and it's nice to see how much people …
GPT-5.4 在编程、知识工作、计算机使用等方面表现出色,很高兴看到大家如此喜欢它。 但它也是我最喜欢聊天的模型!我们在模型个性方面已经偏离目标有一段时间了,所以能朝着正确方向前进感觉特别好。
信息来源:X:Sam Altman (@sama) · GPT
模型发布 / 更新精选
GPT-5.4 Thinking 与 GPT-5.4 Pro 现正登陆 ChatGPT
GPT-5.4 Thinking 和 GPT-5.4 Pro 开始向 ChatGPT 用户推出,同时通过 API 和 Codex 开放。该版本将推理、编程与智能体工作流能力整合为单一前沿模型。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
Anthropic与Mozilla合作提升Firefox安全性
Anthropic与Mozilla合作,使用Claude Opus 4.6审计Firefox安全。模型两周内发现22个漏洞,其中14个高危,占2025年Firefox已修复高危漏洞近五分之一。团队扫描近6000个C++文件并提交112份报告,多数已在Firefox 148中修复。Claude还能为漏洞编写利用代码,具备独立执行完整漏洞挖掘链的能力。
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
推理模型难以控制其思维链,而这反而是好事
OpenAI 发布 CoT-Control 研究,发现推理模型难以操控自身思维链。这种「不可控」特性反而增强了 AI 的可监控性,成为安全对齐的重要保障。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
模型发布 / 更新精选
GPT-5.4 Thinking 系统卡
OpenAI 发布 GPT-5.4 Thinking 系统卡,披露新一代推理模型的架构细节、安全评估框架及能力边界。文档详述思维链优化机制、长上下文推理性能指标,明确数学推导与代码生成准确率数据,分析幻觉风险与偏见控制措施,并列出越狱攻击防护策略及企业级部署的安全限制建议。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.4 发布
OpenAI 推出 GPT-5.4,面向专业工作的最强高效前沿模型,支持 100 万 token 长上下文,具备顶尖编程、计算机使用与工具搜索能力。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.3 Instant 已向所有 ChatGPT 用户开放
GPT-5.3 Instant 现已向所有 ChatGPT 用户推出,响应准确性提升,且减少了令人尴尬的 AI 味。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
PRX 第三部分 -- 24小时内训练一个文本到图像模型!
Photoroom团队在Hugging Face上发布博客,宣布成功在24小时内完成一个文本到图像模型的训练。这一突破将此类模型的典型训练周期从数周大幅缩短至仅一天。实现的关键在于采用了名为PRX的高效训练方法,该方法优化了计算资源分配与数据处理流程。此举显著降低了模型训练的时间与成本门槛,为快速迭代和部署高质量的图像生成AI模型提供了新的可能性。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
GPT-5.3 Instant 系统卡
OpenAI 发布 GPT-5.3 Instant 系统卡,概述该快速响应模型的安全评估、能力边界及使用限制,明确低延迟场景下的技术规范与风险管控措施。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.3 Instant:日常对话更流畅、更实用
GPT-5.3 Instant 模型升级,针对日常对话场景优化响应流畅度与实用性。新版本在保持即时响应速度的同时,输出更顺滑自然,提升普通用户高频问答体验。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
世界建模绝非像素渲染:Project Solaris发布多智能体视频世界模型
Project Solaris提出世界建模的本质在于全局共享状态而非局部像素渲染,推出基于Minecraft的多人在线视频世界模型。该系统突破单智能体视角局限,支持任意数量智能体随时介入交互,实现持久化世界状态演化。核心包含三大组件:Solaris Engine多人数据收集系统、基于DiT架构的Solaris Model(采用新型内存高效自强制设计,训练于1260万帧协调游戏数据)、以及使用VLM评判的Solaris Eval评估体系。这一范式转变为构建神经MMORPG服务…
信息来源:X:谢赛宁 (@sainingxie)
模型发布 / 更新精选
We're launching Nano Banana 2, built on the latest Gemini Flash model. 🍌 It's state-of-the-art fo…
我们推出 Nano Banana 2,基于最新的 Gemini Flash 模型构建。🍌 它在创建和编辑图像方面达到最先进水平,将专业级功能与闪电般的速度相结合。🧵
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
就战争部长 Pete Hegseth 评论的声明
美国战争部长 Pete Hegseth 宣布将 Anthropic 列为供应链风险,因其拒绝将 Claude 用于大规模国内监控和完全自主武器。Anthropic 认为当前 AI 模型不足以支持自主武器,且大规模监控违反基本权利,称将在法庭挑战这一史无前例的指定。声明澄清,该指定不影响个人和商业客户使用 Claude;国防部承包商仅在执行军方合同时受限,其他用途不受影响。
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
Anthropic CEO就国防部谈判发表声明
Anthropic CEO Dario Amodei声明,尽管Claude已广泛用于美军情报分析、网络作战等任务,且公司曾主动切断数亿美元收入阻止中国关联企业使用,但拒绝两项用途:大规模国内监控和完全自主武器。Amodei认为前者威胁民主价值,后者技术不可靠且缺乏监督。国防部威胁将其标记为"供应链风险"并强制移除安全措施。Anthropic坚持原则,但表示如被移除将确保平稳过渡,希望继续服务国防。
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
SONIC:半个GPT-1规模的机器人全身控制模型
SONIC是一个4200万参数的Transformer模型(规模仅半个GPT-1),通过1亿+动作捕捉帧和50万+并行机器人在NVIDIA Isaac Lab中训练,以密集帧级监督替代手工奖励函数。训练3天后零样本迁移至真实G1机器人,在50种动作序列上达100%成功率。单一策略支持VR遥操作、视频动捕、文本指令、音乐响应及VLA模型控制。项目已完全开源。
信息来源:X:Jim Fan (@DrJimFan) · GPT / NVIDIA
模型发布 / 更新精选
蒸馏对中国 LLM 到底有多重要?
针对 Anthropic 关于"蒸馏攻击"的最新论述,分析模型蒸馏技术对中国大语言模型的实际影响。探讨通过蒸馏 GPT、Claude 等模型来训练中国 LLM 的效果与争议,评估该方法在提升模型性能与降低训练成本方面的作用,以及可能引发的知识产权与安全问题。
信息来源:Nathan Lambert:Interconnects(RSS) · GPT / Claude
模型发布 / 更新精选
GGML 和 llama.cpp 加入 HF 以确保 Local AI 的长期进展
GGML 和 llama.cpp 团队正式加入 Hugging Face,以支持本地 AI 社区的长期扩展。创始人 Georgi Gerganov 及团队将全职维护 llama.cpp,保持 100% 技术自主权和社区领导力,项目继续 100% 开源和社区驱动。Hugging Face 提供长期可持续资源,助力项目增长。技术上将优化 transformers 库与 llama.cpp 的无缝集成,实现近乎"一键式"的模型部署,并改进基于 GGML 的软件打包和用户体验。长期…
信息来源:Hugging Face:Blog(RSS) · Llama / Hugging Face
模型发布 / 更新精选
Gemini 3.1 Pro 发布,核心智能升级
上周我们升级了 Gemini 3 Deep Think。今天,我们正式推出实现这些突破的核心智能:Gemini 3.1 Pro。一个明显更智能、能力更强的基线,应对你最艰巨的挑战。现已可用:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro
信息来源:X:Noam Shazeer(@NoamShazeer) · Gemini
模型发布 / 更新精选
Gemini 3.1 Pro:专为最复杂任务打造的更智能模型
Gemini 3.1 Pro 发布,专为无法通过简单回答解决的复杂任务设计,提供更智能的深度推理与处理能力。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
开源模型的永无止境的追赶
开源模型与闭源巨头(如 GPT、Claude)之间的能力差距持续存在,形成永无止境的追赶态势。文章探讨了知识蒸馏技术对缩小差距的作用,分析了开源与闭源模型在创新时间尺度上的差异,以及开源模型如何通过专业化模型在特定领域寻找获胜路径。同时指出当前开源生态在基础研究和资源投入上的缺失环节,并评估了这种追赶模式的可持续性。
信息来源:Nathan Lambert:Interconnects(RSS) · GPT / Claude
模型发布 / 更新精选
实践中的OpenEnv:在真实环境中评估工具使用智能体
Meta与Hugging Face联合推出开源评估框架OpenEnv,旨在标准化智能体与真实系统的交互。Turing公司贡献了生产级"Calendar Gym"环境,用于在权限控制、时间推理等现实约束下研究工具使用智能体。该框架采用类似Gymnasium的API,通过标准接口连接真实工具,将评估重点从受控演示转向真实世界可靠性。日历系统因涉及多用户、多步骤工作流等复杂性,成为评估智能体实际能力的强大测试平台。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造
MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。
信息来源:MiniMax:Blog(网页) · Claude
模型发布 / 更新精选
GLM-5开源:从代码到工程,Agentic Engineering时代最好的开源模型
GLM-5 开源,参数规模达 744B(激活 40B),预训练数据 28.5T,集成 DeepSeek Sparse Attention 降低部署成本。Coding 能力对齐 Claude Opus 4.5,Agent 能力支持 SOTA 级长程任务执行,兼容国产芯片。同步推出 OpenClaw、AutoGLM、Z Code 及 Excel 插件等工具链,覆盖端到端开发、办公自动化等场景。
信息来源:智谱:研究(网页内嵌数据) · DeepSeek / Claude / GLM
模型发布 / 更新精选
inclusionAI发布新一代即时大模型Ling-2.5-1T
inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合"正确性"与"过程冗余"的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T
inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库 · Hugging Face
模型发布 / 更新精选
感知无界·创造有形:百灵全模态 Ming-flash-omni-2.0 焕新生活想象
百灵全模态大模型Ming-flash-omni-2.0正式发布。该模型基于MoE架构,在视觉、语音、图像等全模态能力上实现代际跃迁,其核心突破在于一个统一模型同时具备了强大的通用泛化能力和特定模态的专家级表现。具体特色包括:视觉百科能精准识别万物并关联知识;语音生成可控制情绪、方言,提供百种音色,并能统一生成语音、音效与背景音乐;图像创作可实现氛围重构、场景合成与智能擦除。技术层面通过亿级数据细粒度感知、知识对齐及超低帧率音频表征等创新实现性能飞跃。模型已在多个平台开源。
信息来源:蚂蚁百灵:Developer Blog(网页)
模型发布 / 更新精选
Transformers.js v4:现已在 NPM 上发布!
Transformers.js 发布第四个主要版本 v4,该版本现已通过 NPM 包管理器提供。这一更新延续了项目通过开源与开放科学推动人工智能技术进步与普及的使命,使开发者能够更便捷地获取并在项目中集成这一机器学习库。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Nvidia 为何构建开源模型:对话 Bryan Catanzaro
Interconnects 第17期访谈中,Nvidia 副总裁 Bryan Catanzaro 系统回顾了 Nemotron 开源模型项目的技术演进与战略定位。访谈涵盖该系列模型从研发初期到当前版本的迭代历程,剖析了英伟达在开源 AI 领域的布局逻辑,并披露了 Nemotron 在合成数据生成与模型训练效率方面的最新进展及未来规划。
信息来源:Nathan Lambert:Interconnects(RSS) · NVIDIA
模型发布 / 更新精选
Community Evals:因为我们不再信任黑箱排行榜胜过社区
LMSys 推出了社区驱动的评估框架 Community Evals,旨在通过开源和开放科学推进人工智能民主化。该框架允许社区贡献和审查评估案例,以透明、可复现的方式测试模型。此举旨在改变依赖少数机构"黑箱"排行榜的现状,让更广泛的社区参与定义和衡量AI模型的能力与价值。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
H公司新模型Holo2在UI本地化领域取得领先
H公司在Hugging Face发布博客,正式推出新一代模型Holo2。该模型在用户界面本地化任务上表现突出,实现了技术领先。其核心改进在于显著提升了多语言UI元素的识别与适配能力,能够更精准地处理图标、布局、文本标签等组件的文化适配与翻译。这一进展有望帮助全球应用和软件更高效地实现界面本地化,降低跨区域运营成本。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
全球开源AI生态系统的未来:从 DeepSeek 到 AI+
Hugging Face 在其官方博客发布文章,展望了全球开源人工智能生态系统的发展路径与未来趋势。文章以 DeepSeek 等代表性开源模型为例,探讨了开源社区如何推动技术民主化与创新加速。核心观点指向一个更加开放、协作的"AI+"未来生态,其中开源框架、模型和工具将深度融入各行各业,降低开发门槛并促进多样化应用场景的涌现。
信息来源:Hugging Face:Blog(RSS) · DeepSeek / Hugging Face
模型发布 / 更新精选
文本到图像模型训练设计:来自消融研究的经验
Photoroom团队通过消融研究,总结了文本到图像模型训练的关键发现:混合高质量与多样化数据、在训练中后期引入强数据增强,以及调整无分类器引导的丢弃率,能有效优化模型性能。这些结论为Stable Diffusion等模型的训练提供了实用指导。
信息来源:Hugging Face:Blog(RSS) · Hugging Face