AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页10 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性
OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
腾讯混元发布 Hy3 1-bit 与 4-bit 版本
找不到基准测试和下载链接?看这里👇https://huggingface.co/AngelSlim/Hy3-GGUF 我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一个旗舰级 295B 模型,可在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著更低的硬件上体验强大的智能。🚀🚀🚀 迫不及待想看到你们的作品。 #Hy3 #Hy #GGUF #llamacpp
信息来源:X:腾讯混元 (@TencentHunyuan) · Llama / Hugging Face
模型发布 / 更新精选
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?
阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一
阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
信息来源:公众号:通义实验室(千问) · OpenAI / GPT / Qwen
模型发布 / 更新精选
Bonsai 27B:首款可在手机上运行的27B级多模态模型
Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 …
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Qwen
模型发布 / 更新精选
Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来
在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。
信息来源:Google Developers Blog(RSS)
模型发布 / 更新精选
DiffusionGemma 发布:文本扩散模型实现 4 倍加速推理
Google 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成 256 token 块,推理速度最高提升 4 倍。该 26B MoE 模型仅激活 3.8B 参数,量化后适配 18GB VRAM 消费级 GPU,在单张 H100 上达 1000+ tokens/s。
信息来源:Google AI:DEV 作者专属(RSS)
模型发布 / 更新精选
GPT-5.6 sol 价格减半 token 效率翻倍
GPT-5.6 sol 价格减半,且在多数情况下完成相同任务时 token 效率约为 fable 的两倍。 很高兴能以四分之一的价格交付。
信息来源:X:Sam Altman (@sama) · GPT
模型发布 / 更新精选
腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本…
信息来源:公众号:腾讯混元 · Llama
模型发布 / 更新精选
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型
商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元
Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口
月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。
信息来源:Moonshot AI:Kimi Blog · Kimi
模型发布 / 更新精选
德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先
德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德…
信息来源:The Decoder:AI News(RSS)
模型发布 / 更新精选
腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍
腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
信息来源:公众号:腾讯混元
模型发布 / 更新精选
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力…
信息来源:公众号:腾讯混元
模型发布 / 更新精选
腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户
腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备…
信息来源:X:阿易 AI Notes (@AYi_AInotes)
模型发布 / 更新精选
OpenAI 发布 GPT-5.6 系列医疗评估结果
OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 …
信息来源:X:Sam Altman (@sama) · OpenAI / GPT
模型发布 / 更新精选
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型
蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。
信息来源:MarkTechPost(RSS)
模型发布 / 更新精选
GPT-5.6 健康智能升级,Luna 性能提升成本降 25 倍
GPT-5.6 用于健康智能,团队一直专注于这方面的改进: 整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
GigaChat Audio:支持120分钟输入的时间感知音频大语言模型
GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
GPT-5.6 提升健康智能,Luna 性能更强成本更低
GPT-5.6 是健康智能领域的一大进步。 在整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。
信息来源:X:OpenAI (@OpenAI) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.6 Sol 发布,速率限制将重置两次
为庆祝 GPT-5.6 Sol 发布,我们将在接下来 24 小时内(两次)重置 ChatGPT Work 和 Codex 的速率限制。 我们希望你有时间真正尝试有挑战性的任务并掌握它。祝探索愉快!
信息来源:X:Tibo (@thsottiaux) · ChatGPT / GPT
模型发布 / 更新精选
Cognition 推出 SWE-1.7,接近 GPT 5.5 与 Opus 智能水平
Cognition 发布迄今最强模型 SWE-1.7,基于 Kimi K2.7 基座训练,通过强化学习管线改进(基础设施、训练稳定性、数据质量、长程任务技术)实现前沿智能水平并大幅降低成本。在 FrontierCode 1.1 Main 基准上达 42.3%(Kimi K2.7 Code 为 30.1%,GPT-5.5 为 43.0%,Opus 4.8 为 46.5%),Terminal-Bench 2.1 达 81.5%,SWE-Bench Multilingual 达 …
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT / Kimi
模型发布 / 更新精选
GPT-5.6 Sol 是目前最强模型
GPT 5.6 Sol 是我们迄今为止在几乎所有方面最好的模型。 与GPT-5.5相比,在编码、困难上下文与策略任务、搭建网站……以及任何我需要完成的事情上,差异非常显著。这完全要求你提升自己的尝试目标。
信息来源:X:Tibo (@thsottiaux) · GPT
模型发布 / 更新精选
Meta 发布 Muse Spark 1.1 模型
来自 @finkd 的消息 - Muse Spark 1.1 已上线。
信息来源:X:AI at Meta (@AIatMeta)
模型发布 / 更新精选
Meta 发布 Muse Spark 1.1 低价智能体模型
今天我们发布 Muse Spark 1.1--一款价格极低、能力强大的智能体与编程模型。它已通过我们新的 Meta Model API 上线,并集成于 Meta AI 中。
信息来源:X:Mark Zuckerberg (@finkd) · Llama
模型发布 / 更新精选
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码
美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针…
信息来源:公众号:龙猫LongCat(美团)
模型发布 / 更新精选
OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体
OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT-5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
GPT-5.6 系列模型发布:Sol、Terra、Luna
OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fabl…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT / Claude
模型发布 / 更新精选
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍
NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB …
信息来源:MarkTechPost(RSS) · NVIDIA / Hugging Face
模型发布 / 更新精选
蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video
蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。
信息来源:IT之家(RSS)
模型发布 / 更新精选
蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0
蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推…
信息来源:IT之家(RSS)
模型发布 / 更新精选
Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。…
信息来源:MarkTechPost(RSS) · Qwen
模型发布 / 更新精选
GPT-5.6 成为 Microsoft 365 Copilot 首选模型
OpenAI 宣布 GPT-5.6 将作为 Microsoft 365 Copilot 的首选模型,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。该集成使用户能在日常工具中以更少提示轮次创建更高质量文档、进行更深入数据分析、生成更精美演示,并完成跨职能协作。GPT-5.6 在每个 token 上提供更实用的工作产出,性价比更强,并支持按需处理最复杂任务。微软通过 OpenAI API 直接调用该模型服务 Microsoft 365 客户。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型
Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问…
信息来源:Google Research:Blog(网页)
模型发布 / 更新精选
OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟
OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百…
信息来源:The Decoder:AI News(RSS) · OpenAI / GPT / Claude
模型发布 / 更新精选
GPT-5.6 Sol 系列本周四发布
GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知
蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。
信息来源:MarkTechPost(RSS) · Hugging Face
模型发布 / 更新精选
Pulpie:用于清理网络的Pareto最优模型
Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构…
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · NVIDIA / Hugging Face
模型发布 / 更新精选
OpenAI 发布 GPT-Live 新一代全双工语音模型
OpenAI 今日推出 GPT-Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT-5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT-Live-1 和 GPT-Live-1 mini 两个版本。人类评估显示,在 5-10 分钟对话中,GPT-Live-1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、B…
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT / GPT