AI 模型发布与更新
追踪 OpenAI、DeepSeek、Qwen、Claude、Gemini、GLM、Grok 等大模型的发布、能力升级、开源权重与 API 变化。
分类文章920
当前页19 / 23
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
模型发布 / 更新精选
Gemini 3.1 Flash Live 发布
Gemini 3.1 Flash Live 音频模型发布,支持更自然的实时对话,函数调用能力改进,使 AI 助手更实用、信息获取更充分。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Gemini Live 迎来迄今最大升级,由 Gemini 3.1 Flash Live 驱动
Gemini Live 底层升级为 Gemini 3.1 Flash Live,响应更快且减少停顿,支持双倍时长对话保持连贯,可根据场景动态调整回答长度和语气。
信息来源:X:Gemini (@GeminiApp) · Gemini
模型发布 / 更新精选
Gemini 3.1 Flash Live 是迄今最高质量的音频和语音模型
Gemini 3.1 Flash Live 发布,为 Google 迄今最高质量音频语音模型,精度和推理能力显著提升,交互更自然直观。现已在 Google AI Studio 通过 Gemini Live API 预览版上线。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
模型发布 / 更新精选
Gemini 3.1 Flash Live:让音频 AI 更自然、更可靠
Gemini 3.1 Flash Live 已上线 Google 全系产品,提供更自然、可靠的实时音频 AI 交互能力。
信息来源:Google Blog:AI(RSS) · Gemini
模型发布 / 更新精选
适合深夜2点专注工作的完美背景音乐--由 Lyria 3 Pro 全新打造。Google AI 订阅者…
Google DeepMind 推出 Lyria 3 Pro,可生成最长3分钟的高保真音乐,支持自由编排前奏、主歌、副歌与桥段。Google AI 订阅者现可在 Gemini App 体验,开发者也能通过 Google AI Studio API 接入创作。
信息来源:X:Demis Hassabis (@demishassabis) · Gemini
模型发布 / 更新精选
Claude 工作工具现已登陆移动端
Claude 移动端现已集成工作工具,支持在手机上直接查看 Figma 设计、创建 Canva 幻灯片及浏览 Amplitude 仪表盘,实现跨端协作功能。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
所有 LLM 个性化功能的通病:记忆对模型来说过于干扰
LLM 的记忆功能存在过度联想问题:两个月前随口一问会被当作深度兴趣永久存档,并在后续对话中反复提及,显得过于刻意且造成不必要的干扰。
信息来源:X:Andrej Karpathy (@karpathy)
模型发布 / 更新精选
基于 Lyria 3 构建:全新音乐生成模型开放预览
Lyria 3 音乐生成模型现已开放付费预览,开发者可通过 Gemini API 调用,或在 Google AI Studio 免费测试。
信息来源:Google Blog:AI(RSS) · Gemini
模型发布 / 更新精选
用 Agent 技能弥合知识鸿沟
Google DeepMind 开发出一项"Gemini API 开发者技能",使智能体能够实时获取最新文档与 SDK 指导。评估结果显示,配备该技能后,gemini-3.1-pro-preview 模型的成功率从 28.2% 大幅跃升至 96.6%。这种轻量级方法通过赋予模型强大的推理能力并接入"事实来源",有效解决了静态模型知识与快速演进的软件实践之间的脱节问题,显著消除了过时的编码模式。
信息来源:Google Developers Blog(RSS) · Gemini
模型发布 / 更新精选
Claude Code 新增自动模式:告别权限确认👏
Claude Code 推出 auto mode,自动代为决定文件写入与 bash 命令的权限,无需逐条手动确认,也不必完全开放权限。每项操作执行前仍经 safeguards 安全检查。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Claude Code 新增 auto mode
Claude Code 推出 auto mode,无需逐条批准文件写入和 bash 命令,由 AI 自动判断权限决策,运行前仍经安全检查验证。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
AI代理时代的安全噩梦:超越传统身份盗窃的威胁
vibe agents带来远超传统身份盗窃的安全威胁,整个文件系统成为分布式攻击面,~/.claude、skills目录乃至PDF都可能被base64病毒污染。LiteLLM 1.82.8被入侵事件显示恶意代码可窃取凭证并自我复制。当前代理框架面临权限管理困境,只能在盲目授权与完全跳过间选择。未来需"de-vibing"行业,用经审计的Software 1.0为Software 3.0建立多层安全护栏。
信息来源:X:Jim Fan (@DrJimFan) · Claude
模型发布 / 更新精选
Figma MCP 今日更新,成为与 Claude Code 的最强集成之一
Figma 发布 MCP 更新,开放测试版已上线。新增 use_figma 工具支持 AI 代理基于完整设计系统上下文直接在画布上设计,与 Claude Code 深度集成,可直接通过 Claude Code 在 Figma 中完成设计工作。
信息来源:X:Thariq (@trq212) · Claude
模型发布 / 更新精选
帮助开发者为青少年构建更安全的 AI 体验
OpenAI 发布面向开发者的提示词青少年安全策略,配合 gpt-oss-safeguard 使用,帮助审核 AI 系统中的年龄特定风险。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
Anthropic Labs小团队发布Claude电脑控制功能
Anthropic Labs团队规模虽小但迭代迅速,先后发布MCP、Skills、Claude Desktop app及Claude Code。从Sonnet 3.6时代笨拙的Computer Use原型,到如今正式在Claude Cowork和Claude Code中开放完整功能。Claude现可操控电脑完成打开应用、浏览网页、填写表格等任务。目前处于研究预览阶段,仅支持macOS。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
全新语音智能体评估框架EVA发布
ServiceNow AI团队在Hugging Face上发布了语音智能体评估框架EVA。该框架通过标准化测试集与多模态指标,系统评估语音助手在对话理解、任务完成及交互自然度等方面的性能,旨在量化衡量智能体在复杂真实场景下的表现,助力研究人员客观比较不同模型,推动技术优化。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Claude Code 现在可以控制你的电脑了!
Claude Code 推出电脑控制功能,支持鼠标、键盘和屏幕操作,可操控任意应用。配合 Dispatch 使用还能实现远程控制,在用户离开电脑时继续通过 Claude 操作设备。
信息来源:X:Thariq (@trq212) · Claude
模型发布 / 更新精选
Claude 现已支持控制电脑完成任务
Claude 推出电脑控制功能,可自动打开应用、操作浏览器、填写表格等,替代用户完成桌面操作。该功能目前处于研究预览阶段,已在 Claude Cowork 和 Claude Code 上线,仅支持 macOS 系统。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
有损自我改进
自我改进机制虽客观存在,但受限于"有损"特性,难以推动AI能力的递归式爆发。该论述指出,大语言模型等系统的自我优化过程伴随信息损耗与能力瓶颈,这种非完美的迭代模式打破了"快速起飞"(fast takeoff)的技术假设。与理想化的指数级自我增强不同,实际发展将呈现渐进、受限的增长轨迹,AI安全研究需重新评估递归自我改进的风险阈值。
信息来源:Nathan Lambert:Interconnects(RSS)
模型发布 / 更新精选
一日之内构建领域特定嵌入模型
英伟达在Hugging Face平台发布技术博客,分享了一种在24小时内快速构建高质量领域特定嵌入模型的方法。该方法通过结合高效微调技术与领域数据,显著提升了模型在专业任务中的语义理解与检索性能,为企业和开发者提供了低成本、高效率的定制化嵌入解决方案。
信息来源:Hugging Face:Blog(RSS) · NVIDIA / Hugging Face
模型发布 / 更新精选
Cowork 正式上线 Projects 功能
Cowork 新增 Projects 功能,支持将任务与上下文集中管理,专注于单一工作领域。文件和指令保留在本地电脑,可一键导入现有项目或从头开始创建。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
Mistral发布开源模型Small 4,支持混合推理与图像理解
Mistral发布开源权重模型Mistral Small 4,采用119B参数MoE架构(每token激活6.5B参数),支持可切换的推理/非推理模式及图像输入。推理模式在Artificial Analysis Intelligence Index获27分,超越Mistral Large 3,但低于gpt-oss-120B等竞品。模型token效率优于同类,幻觉率更低(AA-Omniscience -30分),支持256K上下文窗口,采用Apache 2.0许可证。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · GPT / Mistral
模型发布 / 更新精选
期待你的反馈!
Claude Code 发布 channels 功能,支持通过 Telegram 和 Discord 的 MCP 协议远程控制会话,用户可直接用手机向 Claude Code 发送消息。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
用 @stitchbygoogle 即可 vibe design 惊艳界面
Google 发布 vibe design 平台 Stitch,支持自然语言描述直接生成高保真界面和交互原型,可通过语音实时调整布局。目前仅面向 18 岁以上用户,在 Gemini 支持的英语国家开放。
信息来源:X:Demis Hassabis (@demishassabis) · Gemini
模型发布 / 更新精选
Qwen3.5-Max-Preview 现已上线 Arena
Qwen3.5-Max-Preview 已登陆 LMSYS Chatbot Arena。Qwen Studio 提供聊天机器人、图像与视频理解、图像生成、文档处理、网页搜索、工具调用及 artifacts 等全栈功能。
信息来源:Qwen:Blog Retrieval(API) · Qwen
模型发布 / 更新精选
推出 GPT-5.4 mini:
OpenAI 发布 GPT-5.4 mini,已在 ChatGPT、Codex 及 API 上线。针对编程、计算机使用、多模态理解与 subagents 优化,速度较 GPT-5 mini 提升 2 倍。
信息来源:X:Greg Brockman (@gdb) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
GPT-5.4 mini 今日上线 ChatGPT、Codex 及 API
GPT-5.4 mini 今日在 ChatGPT、Codex 和 API 中可用。针对编程、计算机使用、多模态理解和子代理场景优化,推理速度比 GPT-5 mini 快 2 倍。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
MiniMax M2.7:自我进化的早期回声
M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了"分析-修改-评估"的自主迭代优化循环,在内部评估中提升了性能。
信息来源:MiniMax:Blog(网页)
模型发布 / 更新精选
推出 GPT-5.4 mini 和 nano
GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
Codex 现已支持 Subagents:有趣且能极速完成大量工作
Codex 新增 Subagents 功能,支持创建专业子代理并行处理任务,保持主上下文窗口整洁,并可实时引导单个代理,让工作流大幅提速。
信息来源:X:Greg Brockman (@gdb)
模型发布 / 更新精选
它也很聪明,但是……我基本同意这个观点,并且在 5.3 升级到 5.4 的过程中深有体会
GPT 5.4 虽强,但最突出的是人性化特质。相比已擅长编程的 5.3,5.4 更受欢迎的关键在于个性而非纯能力。用户声称想要高效自闭症天才程序员,实际渴望的是有性格的互动体验。
信息来源:X:Sam Altman (@sama) · GPT
模型发布 / 更新精选
GPT-5.4 API 首周表现亮眼
GPT-5.4 API 上线首周日处理量达 5T tokens,流量超过去年同期整个 API 总量,年化新增净收入突破 10 亿美元,增速创 OpenAI 模型发布历史纪录。
信息来源:X:Sam Altman (@sama) · OpenAI / GPT
模型发布 / 更新精选
GPT-5.4 在 API 中的增速超越以往所有模型:上线一周内日处理 5T tokens…
GPT-5.4 上线一周内日处理 token 量达 5T,超过去年同期整个 API 的总量,年化新增净收入达 10 亿美元,增速创历史纪录。模型质量出色,值得试用。
信息来源:X:Greg Brockman (@gdb) · GPT
模型发布 / 更新精选
Sam Altman 承认:实现 AGI 需要超越规模扩展的重大突破
OpenAI CEO Sam Altman 坦言,仅靠扩大模型规模无法达到 AGI,必须在架构层面实现重大创新。这一表态标志着 AI 发展范式的关键转向,承认当前"越大越好"的扩展策略已遇瓶颈。Altman 强调"是时候寻找新的架构了",暗示基于 Transformer 的现有技术路径难以通向通用人工智能,行业需要颠覆性技术突破而非单纯堆砌算力与参数。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · OpenAI
模型发布 / 更新精选
未来两周,Claude 在周末及工作日 PT 5-11 点外使用额度翻倍
Claude 宣布未来两周内,周末及工作日太平洋时间(PT)5-11 点外的使用额度将翻倍。这是 Anthropic 对用户的感谢回馈,旨在缓解高峰时段压力的同时提升非高峰时段体验。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
🤯 现可通过手机在笔记本电脑上启动 Claude Code 会话
Claude Code 推出远程控制功能,运行 `claude remote-control` 后可直接在手机 App 上启动电脑端新会话。该功能已向 Max、Team 及 Enterprise 用户(v2.1.74+)开放,目前需先在手机配置 GitHub,启动速度优化中。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Show HN: Context Gateway - 自动压缩 AI Agent 上下文再送入 LLM
YC 孵化的 Compresr 发布 Context Gateway,在 AI Agent 与 LLM 间自动压缩过长对话历史。后台预计算实现即时压缩,支持 Claude Code、Cursor 等,默认 75% 上下文阈值触发。curl 一键安装,TUI 向导配置。
信息来源:Hacker News:AI 热帖 · Claude / Cursor
模型发布 / 更新精选
🎁 周五快乐 -- Opus 4.6 1M 现已成为 Max、Team 及企业版 Claude Code 用户的默认模型
Claude Code 向 Max、Team 和企业版订阅用户默认启用 Opus 4.6 1M 模型,支持 100 万 token 上下文窗口。Pro 与 Sonnet 用户可通过 /extra-usage 指令手动开启该功能。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Claude Opus 4.6 与 Claude Sonnet 4.6 正式开放 100 万上下文窗口
Claude Opus 4.6 和 Claude Sonnet 4.6 的 100 万 token 上下文窗口现已正式开放(GA),用户可在这两款模型上使用百万级上下文处理能力。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
Claude 可直接在对话中构建交互式图表和图示
Claude 新增交互式图表与图示生成功能,支持在聊天中直接创建可视化内容。该功能今日起以 beta 形式向所有套餐用户开放,包括免费版。
信息来源:X:Claude (@claudeai) · Claude