AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章919
当前页22 / 23
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
SIMA 2:在虚拟3D世界中与你共玩、推理和学习的智能体
Google 推出 SIMA 2,基于 Gemini 的 AI 智能体,支持在交互式环境中思考、理解并执行动作,可在虚拟3D世界中进行游戏、推理和协同学习。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
通过 Skills 改进前端设计
LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
Aligning to What? Rethinking Agent Generalization in MiniMax M2
MiniMax 在 Hugging Face 发布博客,探讨其 M2 智能体模型的泛化能力。文章核心在于重新思考智能体应"对齐"到什么标准或目标,以提升其在未见任务和环境中的通用性能。这涉及对模型训练范式和评估指标的反思,旨在突破当前智能体在特定任务上过拟合、难以泛化的局限。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
MiniMax M2与AI智能体:简中见巧
MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的"不可能三角",为构建更普及的AI智能体应用提供基础,体现了其"智能平权"的愿景。
信息来源:MiniMax:Blog(网页) · Claude
模型发布 / 更新精选
MedGemma:健康 AI 开发领域最强的开源多模态模型
谷歌 MedGemma 系列新增多模态模型,专为健康 AI 开发设计。作为该系列迄今最强的开源版本,新模型具备更强大的医疗场景理解能力,为开发者提供先进的医疗人工智能技术支持,助力构建更精准的健康医疗解决方案。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Gemini 2.5 Flash-Lite 正式发布,可用于规模化生产
Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
带 Deep Think 的 Gemini 高级版本在 IMO 中正式达到金牌标准
集成 Deep Think 的 Gemini 高级版本在国际数学奥林匹克(IMO)中达到金牌水平。IMO 自1959年起每年举办,是全球最顶尖的青年数学家竞赛,各国派出6名精英学生角逐代数、组合、几何和数论领域的6道极难题目。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Gemini 2.5 Computer Use 模型发布
Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专门用于驱动能与用户界面交互的 agent,现已通过 API 以预览版形式提供。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Claude Code 发布网页版
Anthropic 推出网页版 Claude Code,以研究预览形式向 Pro、Max 及企业用户开放。用户可直接在浏览器中分配编码任务,无需本地终端,支持并行处理多个 GitHub 仓库的开发工作,并自动创建 PR 和变更摘要。该服务基于云端隔离沙盒运行,具备网络和文件系统限制,同时登陆 iOS 应用支持移动编码。云会话与现有 Claude Code 使用共享速率限制。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
Ming-VideoMAR:基于连续令牌的自回归视频生成模型
Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS …
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
Gemini 与 Google Cloud 推出组织上下文数据及 Agent 系统新功能
Google 为 Gemini 和 Google Cloud 推出一系列新功能,支持基于组织上下文数据构建 Agent 系统,实现企业数据信息提取与任务自动化,例如根据历史会议记录自动整理项目待办事项。
信息来源:X:Jeff Dean (@JeffDean) · Gemini
模型发布 / 更新精选
Claude Sonnet 4.5 发布,自动化对齐审计工具开源
Anthropic 上周发布 Claude Sonnet 4.5,期间使用新工具对模型进行自动化对齐审计以检测谄媚与欺骗行为。该工具现已开源。
信息来源:X:Anthropic (@AnthropicAI) · Claude
模型发布 / 更新精选
听完 Sutton 的这期播客:有趣且发人深省
Sutton(《The Bitter Lesson》作者)在播客中质疑 LLM 并非真正的"苦涩的教训"产物--它们依赖有限的人类数据且充满偏见。他主张 AI 应像动物一样通过 RL 与世界动态交互,而非模仿人类文本。作者认同 LLM 确实充斥人工干预,但认为预训练是应对冷启动的实用"进化替代方案",纯 RL 在现实世界难以行得通。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
Claude Code 今晨获多项升级
Claude Code 今晨发布多项功能升级,Claude Developer Platform 同步推出两项上下文管理新功能,具体更新详情可通过官方链接查看。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
推出 Claude Sonnet 4.5--全球最佳编程模型
Anthropic 发布 Claude Sonnet 4.5,称其为全球最佳编程模型。该模型在构建复杂智能体与计算机使用方面表现最强,推理和数学测试成绩也有显著提升。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
DeepSeek-V3.2-Exp 发布,引入稀疏注意力提升长文本效率,API 降价超 50%
DeepSeek 发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention(DSA)稀疏注意力机制,在几乎不影响输出效果的前提下大幅提升长文本训练和推理效率,公开评测表现与 V3.1-Terminus 基本持平。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新精选
inclusionAI发布MingTok-Audio:首个统一连续语音分词器
inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
DeepSeek-V3.1 更新至 Terminus 版本,优化语言一致性与 Agent 能力
DeepSeek-V3.1 已更新至 DeepSeek-V3.1-Terminus 版本,在保持原有能力基础上,缓解了中英文混杂、偶发异常字符等问题,并优化了 Code Agent 与 Search Agent 的表现。官方 App、网页端、小程序与 DeepSeek API 均已同步更新,开源版本已发布至 Hugging Face。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek / Hugging Face
模型发布 / 更新精选
12/12 题目全部解决,相当于第一名成绩,GPT-5 解决了其中 11 道
OpenAI 推理系统在 2025 ICPC 世界总决赛中获得 12/12 满分,成绩相当于人类参赛者第一名。其中 11 道题目由 GPT-5 解决。
信息来源:X:Noam Brown (@polynoamial) · OpenAI / GPT
模型发布 / 更新精选
OpenAI 通用推理模型在 2025 ICPC 世界总决赛获满分,排名人类第一
OpenAI 推理系统在 2025 ICPC 世界总决赛中解出全部 12 道算法题,获得 12/12 满分。该成绩在所有人类参赛队伍中排名第一,足以夺得冠军。
信息来源:X:OpenAI (@OpenAI) · OpenAI
模型发布 / 更新精选
Gemini 模型编程能力再提升:Gemini 2.5 Deep Think 在 ICPC 世界总决赛达到金牌水平
Gemini 2.5 Deep Think 高级版本在 2025 年 ICPC 世界总决赛中取得金牌级别成绩,标志着 Gemini 模型编程能力持续精进,在竞赛级编程任务中表现卓越。
信息来源:X:Jeff Dean (@JeffDean) · Gemini
模型发布 / 更新精选
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 中斩获金牌水平成绩
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 世界编程大赛中取得金牌水平成绩。继 IMO 数学竞赛后,这是该模型在竞技领域取得的又一历史性突破。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
GPT-5-Codex:简单查询快10倍,复杂问题思考时间翻倍
OpenAI 发布 GPT-5-Codex,针对智能体编程优化的 GPT-5 版本。简单查询响应速度提升10倍,复杂查询思考时间延长2倍以获得更多算力支持。已上线 Codex CLI、IDE 插件、网页、移动端及 GitHub 代码审查。
信息来源:X:Noam Brown (@polynoamial) · OpenAI / GPT
模型发布 / 更新精选
Circuits 更新 - 2025年9月
Anthropic 可解释性团队在月度更新中分享了关于大语言模型跨语言表征的新发现。研究显示,模型在不同语言间的特征相似性(通过交并比IoU衡量)会随文本样本长度增加而上升。通过对比英法双语段落的首句与末句,团队发现末句的IoU显著高于首句,且无关文本的首句间重叠度高于末句。这表明模型在较长上下文中能构建更丰富的跨语言理解,而非由虚假激活主导。相关发现支持了模型随上下文积累深化语义表征的观点。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
面向开发者的三大 AI 更新:
Veo 3 与 Veo 3 Fast 现已在 Gemini API 开放规模化生产使用,新增支持 16:9 1080p 高清视频及 9:16 竖屏视频格式。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Jakub 与 Szymon
OpenAI 高层公开致谢首席科学家 Jakub Pachocki 与 Szymon Sidor,二人多次联手攻克被认为不可能的技术难题,主导 Dota RL 扩展、GPT-4 预训练及推理突破,被形容为"不知疲倦"的黄金搭档。
信息来源:Sam Altman:Blog(RSS) · OpenAI / GPT
模型发布 / 更新精选
大众智能
从 GPT-5 到 nano banana,强大的人工智能技术正变得普及化。无论是尖端大模型还是轻量级应用,普通用户都能便捷获取先进 AI 能力,技术民主化进程加速,标志着智能时代进入人人可及的新阶段。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT
模型发布 / 更新精选
将人类知识、传感器与执行器从"人类优先"转向"LLM优先"……
教科书等知识载体应从人类可读格式转为LLM优化格式:提取正文为结构化markdown,例题转为SFT训练数据,练习题转为RL环境并附加答案作为评判标准,同时支持合成数据无限扩展(如将时钟角度问题泛化为任意时间的自动出题器),最终构建RAG或MCP服务供LLM像学生一样系统学习,远比简单PDF转文本更高效。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
xAI发布轻量级编程模型Grok Code Fast 1
xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。
信息来源:xAI:News(网页) · Grok / Cursor
模型发布 / 更新精选
Anthropic发布Claude浏览器扩展:AI自动操作功能向付费用户开放
Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
DeepSeek-V3.1 发布,迈向 Agent 时代的第一步
DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新精选
百川智能发布医疗增强推理模型Baichuan-M2
今天我们推出了 Baichuan-M2,一款医疗增强的推理模型,它在 #HealthBench 基准测试上超越了包括 gpt-oss-120b 在内的所有开源模型。在此试用:https://huggingface.co/baichuan-inc/Baichuan-M2-32B #AIHealth
信息来源:X:百川智能 (@BaichuanAI) · GPT / Hugging Face
模型发布 / 更新精选
GPT-5:只管做事
GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT
模型发布 / 更新精选
GPT-5 已在 OpenRouter 上线
GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。
信息来源:OpenRouter:Announcements(RSS) · GPT
模型发布 / 更新精选
GPT-5 现已上线
OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。
信息来源:OpenRouter:Announcements(RSS) · GPT
模型发布 / 更新精选
OpenAI开源推理模型性能评测出炉
【Lmgame Bench】 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-…
信息来源:X:Sky Computing Lab (@haoailab) · OpenAI / GPT
模型发布 / 更新精选
这或许验证了"推理核心假设"--推理本身只需极小的语言能力,而非数千亿参数的庞大知识库
Qwen发布4B参数模型Qwen3-4B-Instruct-2507与Thinking-2507,支持256K上下文,分指令与推理双版本。作者指出这验证了"推理核心假设":推理仅需基础语言能力,无需千亿参数知识库,契合轻量级LLM OS理念--最小化模型体积,最大化依赖工具调用与知识检索。
信息来源:X:Jim Fan (@DrJimFan) · Qwen
模型发布 / 更新精选
NVIDIA推出DreamGen引擎:让机器人在视频生成模型中"做梦"学习
NVIDIA发布DreamGen引擎(GR00T Dreams),将Sora/Veo等视频生成模型用作神经物理引擎,通过微调模型、模拟并行世界、恢复伪动作、训练基础模型四步流程,为机器人生成大规模合成训练数据。人形机器人仅凭单一拾放任务即可学会倾倒、折叠等22种新行为,在新动词和陌生环境中实现零样本泛化(成功率分别达43%和28%)。相比传统图形引擎,该方法以恒定计算成本处理可变形物体、流体等复杂交互,团队计划数周内完全开源。
信息来源:X:Jim Fan (@DrJimFan) · NVIDIA
模型发布 / 更新精选
FastWan视频生成模型实现70倍加速,5秒出片
FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为"稀疏蒸馏"的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。
信息来源:X:Sky Computing Lab (@haoailab)
模型发布 / 更新精选
2025年7月电路更新:特征语言重构数学框架与生物AI可解释性应用
Anthropic可解释性团队分享了2025年7月的研究进展。第一部分用"特征"语言重构Transformer数学框架,将注意力头的OV和QK电路描述为特征及其变换(如检测属性X、前一标记X、触发输出X的特征),并解释了先前用特征值分析复制头和归纳头行为的合理性。第二部分概述了稀疏自编码器在生物AI系统(如蛋白质语言模型ESM-2)可解释性中的应用进展,强调此类研究对确保药物发现等应用的安全与有效性至关重要。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude