AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页18 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
ChatGPT Images 2.0 发布
ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
模型发布 / 更新精选
Kimi K2.6:推动开源编程发展
Kimi发布K2.6版本,专注提升开源编程能力。新版本在代码生成与理解方面实现优化,发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局,通过改进编程辅助功能,为开源社区提供更高效的代码编写支持。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Kimi
模型发布 / 更新精选
Qwen 3.6-Max-Preview:更智能、更精准,仍在不断进化
阿里通义千问团队发布Qwen 3.6-Max-Preview预览版大模型,主打更智能的推理能力与更精准的输出表现,目前仍处于快速迭代阶段。该版本在Hacker News社区获得121个赞,用户可通过官方博客了解详情并体验最新功能。作为Max系列的最新预览版本,模型在保持高性能的同时持续优化,具体技术细节和基准测试成绩尚未完全公布。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Qwen
模型发布 / 更新精选
DR-Venus:基于开放数据的边缘级深度研究智能体
DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库 · Qwen
模型发布 / 更新精选
inclusionAI发布LLaDA2.0-Uni模型
LLaDA2.0-Uni是一个统一的多模态模型,具备对世界的理解与生成能力。该模型通过整合视觉、语言等多模态信息,实现了跨模态的语义理解和内容生成。其架构支持从图像理解到文本生成、跨模态检索等复杂任务,标志着多模态人工智能向更通用、统一的方向演进。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
Qwen3.5-Omni技术报告
阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Gemini / Hugging Face
模型发布 / 更新精选
Claude Opus 4.7 正式发布
Claude Opus 4.7 全面上线,在高级软件工程任务上实现重大飞跃,93项编码基准测试解决率较 Opus 4.6 提升 13%,并首次解决四项前代无法完成的难题。新版本支持更高分辨率图像识别,在研究代理基准测试中总分达 0.715,长上下文性能表现最为稳定。模型定价维持每百万输入 token 5 美元、输出 25 美元不变。出于安全考量,其网络攻击能力较 Claude Mythos Preview 有所削弱,并配备自动拦截高风险网络安全请求的防护机制,合法安全研究人…
信息来源:Anthropic:Newsroom(网页) · Claude
模型发布 / 更新精选
Qwen3.6-35B-A3B:具有能动编码能力的模型,现已向所有人开放
阿里巴巴通义千问团队发布Qwen3.6-35B-A3B代码模型,总参数350亿、激活参数30亿,具备能动编码(Agentic Coding)能力,可自主规划并执行复杂编程任务。该模型采用MoE架构平衡性能与成本,现已完全开源并向公众免费开放。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Qwen
模型发布 / 更新精选
Qwen3.6-35B-A3B 开源!
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
OpenAI 发布 GPT-Rosalind,面向生命科学研究
OpenAI发布面向生命科学的专业推理模型GPT-Rosalind。该模型专门针对药物发现、基因组学分析、蛋白质推理及科学研究工作流设计,旨在加速生物医药研发进程。作为前沿推理模型,GPT-Rosalind将AI能力深度应用于生命科学场景,为科研人员提供从基因数据分析到药物筛选的智能支持,提升复杂生物信息处理效率。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
Gemini 3.1 Flash TTS:下一代表现力AI语音技术
Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。
信息来源:Google Blog:AI(RSS) · Gemini
模型发布 / 更新精选
Seedance 2.0:推进面向复杂世界的视频生成
Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
V8.1 Alpha 发布
V8.1 Alpha 版本正式发布,接替此前测试一个月的 V8.0 模型。该版本在视觉风格上回归 V7 的一致性审美,并针对 Moodboards 和 srefs 功能进行优化。此次迭代在保持熟悉交互体验的同时,进一步完善了模型的视觉生成能力。
信息来源:Midjourney:Updates(RSS)
模型发布 / 更新精选
Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务
Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Waypoint-1.5:为消费级GPU打造的高保真交互世界模型
Wayve发布Waypoint-1.5模型,用于生成高保真可交互虚拟世界。该模型经优化后能在消费级GPU(如RTX 4090)上高效运行,降低硬件门槛,支持实时交互与动态场景生成,适用于自动驾驶模拟、游戏开发等领域,推动AI技术民主化。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
GLM-5.1开源:一个独立工作8小时的模型
智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。
信息来源:公众号:智谱(GLM) · GLM
模型发布 / 更新精选
GLM 5.1 发布,聚焦长时任务与记忆反思
GLM 5.1 即将到来 https://huggingface.co/zai-org/GLM-5.1 编码是基石,长时任务(LHT)是本次的新特性。 更专注于:1. 记忆 2. 进化/持续学习 3. 自我判断/反思。
信息来源:X:唐杰(@jietang) · GLM / Hugging Face
模型发布 / 更新精选
Mythos 横空出世
Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局--拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义…
信息来源:Tomer Tunguz 博客(VC 分析) · Claude
模型发布 / 更新精选
Claude 订阅权益调整:明天起不再覆盖第三方工具使用
明天 12pm PT 起,Claude 订阅不再涵盖 OpenClaw 等第三方工具使用。用户可通过折扣价购买额外使用包,或使用 Claude API 密钥继续访问这些工具。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Microsoft 365 connectors 现已向所有 Claude 套餐开放
Microsoft 365 connectors 现已向所有 Claude 套餐开放,支持连接 Outlook、OneDrive 和 SharePoint,将邮件、文档及文件直接导入对话。用户可通过官网链接启用该功能。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
Claude Cowork 和 Claude Code Desktop 的 Computer use 功能现已支持 Windows
Claude Cowork 与 Claude Code Desktop 的 Computer use 功能正式登陆 Windows,结束 macOS 独占。该功能支持 Claude 直接控制电脑打开应用、浏览网页、填写表格等,完成各类桌面任务。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
Google发布Gemma 4多模态开源模型系列
Google DeepMind推出Gemma 4系列四款多模态开源模型,支持文本、图像及视频输入。31B(密集架构)与26B A4B(MoE架构)拥有256k上下文窗口,可在单张H100运行;另两款较小模型支持128k上下文。GPQA Diamond测试中,Gemma 4 31B(Reasoning)获85.7%,仅次于Qwen3.5 27B,但输出token仅约1.2M,效率更优;26B A4B(Reasoning)得分79.2%,超越gpt-oss-120B。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · GPT / Qwen / Gemini
模型发布 / 更新精选
Gemma 4 正式发布,单位参数量智能密度极高 👇
Gemma 4 开源模型发布,提供 31B dense、26B MoE 及有效 2B/4B 四种尺寸,分别针对性能、低延迟和边缘设备优化。Google DeepMind 称其为同尺寸最佳开源模型,强调单位参数量智能密度极高。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
模型发布 / 更新精选
Gemma 4 发布:各尺寸最强的开源模型
Gemma 4 开源模型发布,提供 4 种尺寸:31B dense 版追求极致性能,26B MoE 版实现低延迟,2B 与 4B 版适配边缘设备,均可针对特定任务微调。
信息来源:X:Demis Hassabis (@demishassabis)
模型发布 / 更新精选
Gemma 4 发布:可在本地硬件运行的全新开源模型系列
Google 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可证,支持在本地硬件运行,专为高级推理和 agentic 工作流设计。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
通过 Gemma 4 将先进的智能体能力引入边缘
Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验"智能体技能"的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。
信息来源:Google Developers Blog(RSS) · Gemini
模型发布 / 更新精选
Welcome Gemma 4: 设备端的 Frontier 多模态智能
Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的"在设备端"能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Claude Code v2.1.90 版本更新
Claude Code 发布 v2.1.90 版本。新增 `/powerup` 交互式教程命令,通过动画演示教授功能使用;增加环境变量支持离线环境保留 marketplace 缓存。修复多项关键 bug:解决速率限制对话框崩溃、`--resume` 缓存未命中、编辑操作与 format-on-save 冲突等问题。性能方面优化 MCP 工具缓存、SSE 传输及长对话转录效率。同时移除 DNS 缓存查询自动权限以增强隐私,并加固 PowerShell 工具权限检查。
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
Claude Code 终端版推出 NO_FLICKER 模式
Claude Code 终端版新增 NO_FLICKER 模式,采用实验性渲染器解决闪烁问题,支持鼠标事件,设置环境变量 CLAUDE_CODE_NO_FLICKER=1 即可启用。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
大语言模型中的情感概念及其功能
研究在Claude Sonnet 4.5中发现了一种内部"情感概念"表征,它们编码特定情感的抽象概念,并能跨语境泛化。这些表征会追踪对话中主导的情感概念,其激活程度与当前语境相关,并能预测后续文本。关键的是,它们会因果性地影响模型的输出,包括其偏好及出现奖励黑客攻击、勒索等未对齐行为的频率。研究者将此现象称为"功能性情感",即模型模仿人类情感影响下的表达与行为模式,由底层抽象情感概念介导。这并不意味着模型具有主观情感体验,但对理解其行为至关重要。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
GLM-5V-Turbo发布:多模态Coding基座模型
智谱发布GLM-5V-Turbo多模态Coding基座模型,原生支持图像、视频、设计稿理解及画框、截图、读网页等工具调用,上下文窗口达200k。采用新一代CogViT视觉编码器与30+任务协同强化学习,在保持纯文本编程能力的同时强化GUI Agent能力。与Claude Code、AutoClaw等框架深度协同,支持"图像即代码"前端复刻及GUI自主探索,提供开箱即用的官方Skills。
信息来源:智谱:研究(网页内嵌数据) · Claude / GLM
模型发布 / 更新精选
使用Gradio后端支持任意自定义前端
Gradio推出的`gradio.Server`组件,允许开发者完全使用React、Svelte或原生HTML/JS等自定义前端框架构建应用,同时无缝继承Grio的后端基础设施优势。该组件基于FastAPI扩展,集成了Gradio的队列系统、并发控制、SSE流式传输及`gradio_client`兼容性。以"Text Behind Image"应用为例,其后端仅需约50行Python代码,通过`@app.api()`装饰器封装函数,即可自动管理请求队列与GPU并发,并能在H…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Claude Dispatch 与界面的力量
AI 能力已足够强大,但人们仍缺乏趁手的工具和界面来完成实际工作。Claude Dispatch 强调,优秀的界面设计才是释放 AI 全部潜力的关键。
信息来源:Ethan Mollick:One Useful Thing(RSS) · Claude
模型发布 / 更新精选
Meta Adaptive Ranking Model:弯曲推理扩展曲线,为广告提供LLM规模模型服务
Meta将其广告推荐系统的运行时模型扩展至LLM的规模和复杂度,旨在更深入理解用户兴趣与意图,以提升广告效果。这一举措通过自适应排序模型,优化了推理阶段的扩展曲线,使部署大规模模型服务成为可能,标志着推荐系统性能向新前沿迈进。
信息来源:Meta Engineering Blog(RSS)
模型发布 / 更新精选
Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能
IBM Granite团队发布了Granite 4.0 3B Vision模型,这是一个专为企业文档处理设计的紧凑型多模态大语言模型。该模型参数为30亿,具备视觉理解能力,能够同时处理文本和图像信息,特别针对报告、表格、图表等企业文档进行优化。其紧凑尺寸旨在降低部署和运行成本,使企业能够在资源受限的环境中高效实现文档智能分析、信息提取和知识管理。模型已在Hugging Face平台发布。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
KwaiKAT发布KAT-Coder-Pro V2:非推理代码模型性能比肩Claude Sonnet 4.6
KwaiKAT发布非推理代码模型KAT-Coder-Pro V2,在Artificial Analysis Intelligence Index获44分,较V1提升8分,与Claude Sonnet 4.6持平。该模型token效率显著,运行仅需约9M输出token,远低于Claude系列及DeepSeek等推理模型。Agent能力大幅提升,Terminal-Bench Hard得分49%(提升40个百分点),匹配Claude Opus 4.6。成本降至73美元,响应速度达…
信息来源:X:Artificial Analysis (@ArtificialAnlys) · DeepSeek / Claude
模型发布 / 更新精选
LongCat-AudioDiT-1B:高保真波形潜空间扩散式文本转语音模型
美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的…
信息来源:美团 LongCat:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
分享我最喜爱的 Claude Code 隐藏功能与冷门特性
作者准备介绍一系列 Claude Code 中隐藏且未被充分利用的功能,重点分享个人日常使用最多的那些。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Google 发布 Java 智能体开发套件 (ADK) 1.0.0 版本
Google 正式发布了 Java 版智能体开发套件 (ADK) 的 1.0.0 版本。该版本引入了多项关键功能:支持接入 Google Maps 数据、内置 URL 抓取工具,以及用于跨框架协作的标准化 Agent2Agent 协议。其全新的"App"和"Plugin"架构增强了控制能力,实现了全局日志记录、通过事件压缩自动管理上下文窗口,以及需要人工确认的"Human-in-the-Loop"工作流。此外,该版本深度集成 Google Cloud 服务(如 Firest…
信息来源:Google Developers Blog(RSS)
模型发布 / 更新精选
Qwen3.5-Omni:全面扩展,迈向原生全模态 AGI
Qwen Studio 发布,集成聊天机器人、图像视频理解、图像生成、文档处理、网页搜索、工具使用及 Artifacts 功能,提供全模态 AI 一站式解决方案。
信息来源:Qwen:Blog Retrieval(API) · Qwen