AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章922
当前页16 / 24
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
地平线开源 HoloMotion-1 4 亿参数机器人小脑大模型,可实现舞蹈、健身、搬箱子等动作
地平线机器人实验室发布了其开源的人形机器人全身控制模型 HoloMotion-1。这是一个拥有 4 亿参数的"小脑"大模型,通过 MoE 稀疏激活与 KV-cache 推理机制,在端侧实现了约 300FPS 的实时推理能力。该模型利用互联网视频、光学动捕、VR 遥操作等多种来源的动作数据进行训练,并在真实机器人上成功展示了舞蹈、爬行、健身、搬箱子等复杂动作的零样本迁移能力。相关代码与技术报告已公开。
信息来源:IT之家(RSS)
模型发布 / 更新精选
引入 Ettin Reranker 系列
Hugging Face 发布六个 Ettin Reranker 重排序模型(17m、32m、68m、150m、400m、1b),基于 Ettin ModernBERT 编码器,蒸馏 self-mxbai-rerank-large-v2 分数训练,在 MTEB(eng, v2) Retrieval 达各自规模 SOTA。模型以 Sentence Transformers CrossEncoder 接口提供,三行代码可调用。同时发布 train-sentence-transf…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Qwen 3.7 预览版
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Qwen
模型发布 / 更新精选
推出Gemini Omni多模态AI模型
谷歌推出原生多模态AI模型Gemini Omni,能够整合视频、图像、音频和文本等多种输入,生成高质量视频内容。其核心能力是通过自然语言对话进行视频编辑,并能保持角色一致性、物理规律与场景连贯性。首个模型Gemini Omni Flash已上线,未来将支持图像和音频输出。Gemini Omni结合了对物理世界的直觉理解与丰富的知识库,支持从写实到叙事的创意生成,并可通过多轮对话持续编辑视频,而不丢失原始场景上下文。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
蚂蚁集团发布万亿参数推理模型Ring-2.6-1T
蚂蚁集团发布万亿参数推理模型Ring-2.6-1T,专为现实世界智能体工作流构建。该模型采用MIT许可,上下文长度通过YaRN技术从128K扩展至256K,并采用Async RL与IcePop混合训练架构。其核心特点是具备双推理努力模式:"high"模式用于快速智能体循环,"xhigh"模式用于深度推理,旨在实现更好的成本与性能平衡。模型已开源,欢迎社区反馈。
信息来源:X:蚂蚁百灵 (@AntLingAGI) · Hugging Face
模型发布 / 更新精选
社区协作再创佳绩,vLLM支持万亿级模型
又一次Day0协作,又一次社区胜利。感谢@vllm_project团队始终可靠的支持~ 🫡🫡
信息来源:X:蚂蚁百灵 (@AntLingAGI)
模型发布 / 更新精选
SANA-WM:一个用于生成1分钟720p视频的26亿级开源世界模型
NVIDIA研究团队发布了SANA-WM,这是一个参数规模达26亿的开源世界模型,专门用于生成长达1分钟、分辨率为720p的视频。该模型已在GitHub页面开源,旨在推动高质量长视频生成的研发。其在Hacker News社区获得了107点热度,显示出业界对该技术进展的关注。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · NVIDIA
模型发布 / 更新精选
Gemini 3.5:具备行动能力的前沿智能
Google发布了Gemini 3.5模型,该模型专注于提升执行复杂任务的能力。其核心特点是支持"代理式工作流",即能够像助手一样自主规划并执行一系列多步骤、复杂的操作,旨在将先进的语言理解与实际问题解决能力相结合。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
蚂蚁集团提出 ARGenSeg-8B:基于自回归图像生成模型的图像分割框架
蚂蚁集团推出 ARGenSeg-8B,一种将多模态理解与像素级感知统一的自回归图像生成分割框架。它利用多模态大语言模型(MLLM)输出视觉 token,并通过通用 VQ-VAE 解码为分割掩码,使分割完全依赖 MLLM 的像素级理解。采用 next-scale-prediction 策略并行生成视觉 token,降低推理延迟。在多个分割数据集上超越此前最优方法,推理速度显著提升。论文已被 NeurIPS 2025 接收,模型已发布在 HuggingFace。
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
Ring-2.6-1T 正式开源:蚂蚁百灵发布万亿级思考模型
蚂蚁百灵开源万亿级思考模型 Ring-2.6-1T,重点强化 Agent 执行能力,在 PinchBench 和 ClawEval 上达到开源 SOTA。模型支持 high 与 xhigh 两档推理强度,并采用异步 Async RL 架构结合升级版棒冰算法提升训练效率。权重已开源至 Hugging Face 和 ModelScope,Chat 体验现已开放。
信息来源:公众号:蚂蚁百灵(Ling) · Hugging Face
模型发布 / 更新精选
IBM 发布 Granite Embedding Multilingual R2 开源多语言嵌入模型
IBM 发布两个 Apache 2.0 开源多语言嵌入模型:97M 参数的紧凑型(granite-embedding-97m-multilingual-r2)在 MTEB Multilingual Retrieval 上得 60.3 分,超越所有开放子 1 亿参数模型;311M 全尺寸模型(granite-embedding-311m-multilingual-r2)得 65.2 分,在 500M 以下开放模型中排第二,并支持 Matryoshka 维度。两者均基于 Mod…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
SenseNova U1技术报告发布,基于MoE架构开放模型权重
由联合创始人兼首席科学家李沐博士领导的团队发布了SenseNova U1技术报告,详细阐述了其架构、训练方案与创新突破。此次开源同步发布了基于混合专家模型(MoE)的新权重,旨在推动AI领域的透明度、可复现性与进一步创新。团队希望通过开放共享促进整个社区的技术发展。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
蚂蚁 inclusionAI 推出万亿参数推理模型 Ring-2.6-1T
蚂蚁 inclusionAI 发布旗舰推理模型 Ring-2.6-1T,参数规模达万亿,面向智能体工作流、工程开发、科研分析等复杂场景。模型从"能回答"升级至"能执行",在多步任务与工具协作中表现更优;支持 high/xhigh 两档推理强度,可灵活平衡效果与成本;采用异步强化学习结合 IcePop 算法提升训练效率。基准测试中,high 模式 PinchBench 得 87.60、ClawEval 63.82、Tau2-Bench 电信场景 95.32;xhigh 模式 …
信息来源:蚂蚁 inclusionAI:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
Krea 2发布访问码,限量体验
Krea 2 访问码发放! K2-PRFUF8 / K2-NRWW9E / K2-CAP48S - 每个码可使用50次。 访问链接如下 👇 【引用 @krea_ai】:this is Krea 2. our first foundation model, built completely from scratch for aesthetic diversity and stylistic control. learn more and get early access 👇
信息来源:X:Krea AI (@krea_ai)
模型发布 / 更新精选
SenseNova-U1 技术报告深度发布:前沿原生多模态模型构建全指南
SenseNova-U1 技术报告详尽披露了构建前沿原生多模态模型的方法,核心包括原生多模态统一建模、无损视觉接口、联合自回归与像素空间流匹配训练、以及原生混合专家骨干网络。报告提供了六阶段训练方案、强化学习后训练与蒸馏的完整实践指南。其开源版本 SenseNova-U1-A3B-MoT 基于混合专家架构,仅激活30亿参数,实现了高效快速的性能。相关资源已全面开放,涵盖技术报告、模型权重、代码和演示平台。
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
Hy3预览版登陆GMI,开源最强模型领跑
Hy3 预览版现已登陆 @gmi_cloud。🙌
信息来源:X:腾讯混元 (@TencentHunyuan)
模型发布 / 更新精选
Claude Opus 4.7快速模式开放研究预览
Claude Opus 4.7的快速模式现已在API和Claude Code中开放研究预览。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
模型发布 / 更新精选
Perceptron Mk1视觉语言模型上线OpenRouter
Perceptron Mk1已在OpenRouter上线,由@perceptroninc开发。 前沿视频与具身推理的视觉语言模型。以动态帧率(最高2 FPS)分析视频,具备32k多模态上下文,采用混合推理和结构化空间基元(点、框、多边形、片段)作为首要输出。
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新精选
Krea 2首款基础模型发布
这是Krea 2。 我们的首个基础模型,完全从零构建,旨在实现美学多样性和风格控制。 了解更多并获取早期访问权限👇
信息来源:X:Krea AI (@krea_ai)
模型发布 / 更新精选
AntLingAGI发布万亿参数模型Ring-2.6-1T
AntLingAGI发布了其万亿参数旗舰"思考模型"Ring-2.6-1T,该模型在5月15日前可通过OpenRouter免费使用。其核心特性包括可调节的思考强度,能动态平衡认知深度、token成本和执行速度;专为智能体优化,适用于高频工作流,提供快速的多步执行和工具调用;并具备深度思考能力,以应对严密的数学逻辑和科学研究任务。模型旨在满足实际生产环境中复杂任务的需求。
信息来源:X:OpenRouter (@OpenRouter)
模型发布 / 更新精选
SenseNova U1图像生成模型登陆ComfyUI平台
SenseNova U1图像生成模型现已在ComfyUI上可运行,并获得包括REBEL AI在内的评测者高度认可。REBEL AI发布的实践教程展示了该模型的部署工作流,并对其图像生成能力进行了真实场景测试。模型支持8步快速推理,生成速度极快,应用场景涵盖人像、超现实艺术、文字标志和生物设计等。相关资源已在Hugging Face、GitHub和Discord平台开放。
信息来源:X:商汤 SenseTime (@SenseTime_AI) · Hugging Face
模型发布 / 更新精选
Qwen-Image-2.0技术报告
Qwen-Image-2.0是一个统一高保真生成与精确编辑的全能图像生成基础模型。它采用Qwen3-VL作为条件编码器,结合多模态扩散变换器进行联合建模,并通过大规模数据整理与多阶段训练实现强化。该模型支持长达1K令牌的指令输入,能生成幻灯片、海报等富文本内容,显著提升多语言文本渲染与排版质量。在生成方面,它增强了细节、纹理真实感与光照一致性,并更可靠遵循复杂指令。人工评估表明,其在生成和编辑任务上均大幅超越前代模型。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
模型发布 / 更新精选
Thinking Machines Lab发布Interaction Models研究预览
Thinking Machines Lab发布interaction models研究预览。该模型从零训练,原生处理音频、视频和文本,采用多流微回合设计实现实时响应,无需外部脚手架。研究预览展示了全新的交互能力,并在智能性与响应性上取得综合SOTA表现。
信息来源:Thinking Machines Lab:官方博客(RSS)
模型发布 / 更新精选
Ring-2.6-1T发布:万亿参数思维模型专为复杂任务设计
Ring-2.6-1T是一款万亿参数的旗舰思维模型,专为现实世界复杂任务和生产环境构建。该模型具备可调节思维努力功能,通过动态计算机制灵活平衡认知深度、token成本和执行速度。它针对代理优化,适用于高频工作流,提供快速多步执行和工具编排,并具有SOTA稳定性。深度思维特性解锁了模型的最大能力上限,特别适合严格数学逻辑和科学研究。
信息来源:X:蚂蚁百灵 (@AntLingAGI)
模型发布 / 更新精选
EMO:为涌现模块化预训练的专家混合模型
EMO是一种新型专家混合模型,通过端到端预训练使模块化结构直接从数据中涌现,无需依赖人类定义的先验。该模型允许在特定任务中仅使用12.5%的专家子集(即8个活跃专家中的部分),同时保持接近全模型的性能;当所有128个专家共同使用时,它仍作为强大的通用模型。EMO具有1B活跃参数和14B总参数,训练数据达1万亿令牌。与标准MoE相比,EMO通过文档级路由约束,鼓励专家形成领域专业化组,从而支持选择性使用而不导致严重性能下降,实现了可组合架构,优化了大型稀疏MoE的内存-准确性…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
万亿参数指令模型Ling-2.6-1T发布
inclusionAI宣布Ling-2.6-1T现已在OpenRouter上线。🚀 这款万亿参数旗舰指令模型专为现实世界智能体打造。它采用"快速思考"方法,在保持AIME26和SWE-bench Verified基准测试顶尖性能的同时,将成本降低约75%。适用于: - 高级编程 - 复杂推理 - 大规模智能体工作流
信息来源:X:蚂蚁百灵 (@AntLingAGI)
模型发布 / 更新精选
Scaling Trusted Access for Cyber with GPT-5.5 and GPT-5.5-Cyber
OpenAI扩展了网络安全领域的可信访问计划,推出了GPT-5.5和专门针对网络安全的GPT-5.5-Cyber模型。此举旨在帮助经过验证的网络安全防御者加速漏洞研究,并加强对关键基础设施的保护。新模型将为安全专业人员提供更强大的AI工具支持。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
通过 API 中的新模型推进语音智能
OpenAI API 推出了新的实时语音模型,能够进行推理、翻译和语音转录。这些模型显著提升了语音交互的自然度与智能水平,支持实时处理与多语言转换。新功能旨在为开发者提供更强大的工具,以构建更流畅、更智能的语音应用体验。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
模型发布 / 更新精选
SenseNova-U1开源8步蒸馏LoRA,推理速度大幅提升
🚀 SenseNova-U1 更新: ⚡ 开源8步蒸馏LoRA:100 NFE降至8 NFE,H100推理时间从23秒缩短至2秒 🧩 现已支持ComfyUI,提供文生图、图像编辑和交错生成的即用工作流 试用链接 👇 https://github.com/OpenSenseNova/SenseNova-U1/
信息来源:X:商汤 SenseTime (@SenseTime_AI)
模型发布 / 更新精选
豆包大模型家族首款全模态理解模型:字节跳动 Doubao-Seed-2.0-lite 升级
字节跳动火山引擎发布豆包大模型家族首款全模态理解模型 Doubao-Seed-2.0-lite 升级版。该模型原生统一支持视频、图像、音频和文本理解,并能进行跨模态联合推理,在物理、医疗等学科推理及细粒度感知上表现超越此前Pro版本。音频方面支持19种语种转写及多语种互译,多项基准测试优于Gemini-3.1-Pro。同时,其Agent、Coding与GUI能力升级,能更稳定处理长任务、胜任深度开发,并实现界面理解与操作执行的闭环。新版本已在火山方舟上线,旨在为企业提供高性…
信息来源:IT之家(RSS) · Gemini / 豆包
模型发布 / 更新精选
Major ChatGPT upgrade rolling out now, in the form of GPT-5.5 Instant:
重大ChatGPT升级现正推出,形式为GPT-5.5 Instant: 这是一次重大升级,以更温暖自然的语调提供更智能、更清晰、更个性化的答案。 同时它也更简洁,这正是我们所了解到的用户需求。我们相信你会喜欢与它对话。
信息来源:X:Greg Brockman (@gdb) · ChatGPT / GPT
模型发布 / 更新精选
High fives to all our users on the new Instant model.
向我们所有使用新即时模型的用户致以热烈的祝贺。
信息来源:X:ChatGPT (@ChatGPTapp) · ChatGPT
模型发布 / 更新精选
Grok 4.3
Grok 4.3 【引用 @xai】:Grok 4.3 现已在 xAI API 上线。这是我们迄今为止最快、最智能的模型。 它在 @ArtificialAnlys 排行榜的智能体工具调用和指令遵循方面位居榜首,并在 @ValsAI 的企业领域(如案例法和公司金融)中排名第一。 Grok 4.3 支持 100 万 token 的上下文窗口,定价为输入每百万 token 1.25 美元,输出每百万 token 2.50 美元。 创建 API 密钥并开始构建:http://con…
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
模型发布 / 更新精选
ChatGPT 更新推出 GPT-5.5 Instant 模型,幻觉减少且答案更个性化
OpenAI 将 ChatGPT 的默认模型更新为 GPT-5.5 Instant。内部测试显示,该模型在医学和法律等高风险主题上产生的幻觉声称减少了 52.5%。新功能"记忆来源"允许用户查看影响特定回答的存储上下文。该模型正立即向所有用户推出,但基于过去聊天记录、文件和 Gmail 的个性化功能将首先在网页版上向 Plus 和 Pro 用户开放。此次更新旨在提升回答的准确性和个性化体验。
信息来源:The Decoder:AI News(RSS) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
GPT-5.5即时版全面推送 更简洁智能
OPENAI 🚨: GPT-5.5 Instant 正在向所有 ChatGPT 用户推出!"gpt-5.5-chat-latest" 也将进入 API。 >; 更加简洁。更好的记忆。更个性化。 即时测试时间 👀
信息来源:X:Testing Catalog (@testingcatalog) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
ChatGPT默认模型升级至GPT-5.5 Instant
OpenAI宣布将ChatGPT的默认模型更新为GPT-5.5 Instant。新版模型在智能水平、图像理解能力和事实准确性方面均有显著提升。其回应风格变得更简洁、直接和自然,同时提供更个性化和清晰的答案。此次升级基于用户反馈,旨在提供更优质的对话体验。
信息来源:X:Eric Mitchell (@ericmitchellai) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
OpenAI推出GPT-5.5 Instant作为ChatGPT新默认模型,实现显著升级
OpenAI正式将GPT-5.5 Instant设置为ChatGPT的新默认模型,该模型在基准测试中表现大幅提升,变得更智能、准确和可靠。其在图像分析、STEM、写作及医学、法律等高精度领域能力增强。核心升级在于个性化功能,能有效利用用户保存的记忆、过往聊天、文件和Gmail上下文,并展示影响回复的记忆来源。该模型将在未来两天内向所有用户推出,个性化改进优先面向网页版Plus和Pro用户,移动版随后跟进;API版本为gpt-5.5-chat-latest。官方表示,升级后的…
信息来源:X:Kim (@kimmonismus) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
GPT-5.5即时版全面推送 更简洁智能
GPT-5.5 Instant 开始向所有 ChatGPT 用户推出。 更简洁。记忆更佳。更个性化。 而且对话体验顺畅得多。真的。
信息来源:X:ChatGPT (@ChatGPTapp) · ChatGPT / GPT
模型发布 / 更新精选
GPT-5.5即时版开始推送升级
GPT-5.5 Instant 正在 ChatGPT 中逐步推出。 这是一次重大升级,以更温暖、更自然的语调为您提供更智能、更清晰、更个性化的答案。 同时它也更加简洁,这正是我们所了解到的用户需求。我们相信您会喜欢与它对话。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
Grok 4.3正式上线API 速度与智能双突破
Grok 4.3 现已在 xAI API 上线。这是我们迄今为止最快、最智能的模型。 它在 @ArtificialAnlys 排行榜上的智能体工具调用和指令遵循方面位居榜首,并在 @ValsAI 的企业领域(如判例法和公司金融)中排名第一。 Grok 4.3 支持 100 万令牌的上下文窗口,定价为输入每百万令牌 1.25 美元,输出每百万令牌 2.50 美元。 创建 API 密钥并开始构建:http://console.x.ai/team/default/api-keys
信息来源:X:SpaceXAI (@SpaceXAI) · Grok