AI 情报文章归档
浏览 AI圈报 已保存的 5559 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5559
正式分类6
精选内容3470
全部文章
第 135 / 139 页 · 每页 40 条
模型发布 / 更新精选
Open ASR 排行榜新增多语言与长格式赛道,揭示模型性能新挑战
Hugging Face 的 Open ASR 排行榜新增多语言和长格式语音识别评估赛道。多语言赛道涵盖8种语言,长格式赛道则测试模型处理连续数分钟语音的能力。新榜单显示,领先模型在多语言任务上的词错误率平均比专用单语模型高约15%,在长格式任务上错误率可能上升超20%,凸显了模型在实际应用中的泛化能力仍面临严峻挑战。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Google DeepMind 发布 Nano Banana Pro 图像生成模型
Google DeepMind 发布 Nano Banana Pro 图像生成模型,基于 Gemini 3 Pro 构建,支持多语言可读文本直接渲染,可结合 Google Search 实时信息生成信息图表。该模型支持 14 张图像融合,保持 5 个人物形象一致性,输出 4K 分辨率。现已集成至 Gemini 应用、Google Ads、Google AI Studio 等产品,所有生成内容均嵌入 SynthID 水印以确保透明度。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
介绍 AnyLanguageModel:为苹果平台提供本地与云端大语言模型的统一 API
AnyLanguageModel 是一个 Swift 包,旨在为苹果平台上的大语言模型集成提供统一解决方案。它作为苹果原生 Foundation Models 框架的替代品,允许开发者通过相同的 API 接口,灵活调用本地模型(如通过 Core ML、MLX、llama.cpp 运行)与云端服务(如 OpenAI、Anthropic)。该方案复用苹果精心设计的 API 作为基础,大幅降低了在不同模型提供商之间切换的代码修改成本,并利用 Swift 的包特性功能避免依赖膨胀,…
信息来源:Hugging Face:Blog(RSS) · OpenAI / Claude / Llama
模型发布 / 更新精选
Apriel-H1:蒸馏高效推理模型的关键要素
ServiceNow-AI在Hugging Face发布博客,介绍了其提出的Apriel-H1方法,该方法通过知识蒸馏技术有效提升小型模型的推理能力。该方法的核心在于从大型模型中提取并转移复杂的推理路径,使蒸馏后的小模型在多项推理任务上表现显著提升,同时保持高效的部署性能。这一技术为在资源受限环境中部署高性能推理模型提供了新思路。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
Grok 与沙特阿拉伯达成全国性部署合作
xAI 与沙特阿拉伯及 PIF 旗下 HUMAIN 签署框架协议,将在沙特建设超大规模 GPU 数据中心,并全国范围内部署 Grok 至 HUMAIN ONE 平台,为政府和企业提供实时智能与自主工作流。这是 Grok 首次在国家层面全面落地。
信息来源:xAI:News(网页) · Grok
论文研究精选
xAI发布Grok 4.1 Fast与Agent Tools API
xAI发布Grok 4.1 Fast模型及Agent Tools API。Grok 4.1 Fast支持200万token上下文,在τ2-bench Telecom基准测试中获100%得分且成本仅105美元,函数调用准确率72%。Agent Tools API集成实时X数据、网页搜索与代码执行功能。该模型在深度研究基准测试中超越GPT-5等竞品,成本更低且幻觉率较上代降低一半。
信息来源:xAI:News(网页) · GPT / Grok
模型发布 / 更新精选
从 GPT-3 到 Gemini 3 的三年
GPT-3 发布至 Gemini 3 的三年间,大模型技术完成从聊天机器人(chatbots)到智能体(agents)的范式跃迁。
信息来源:Ethan Mollick:One Useful Thing(RSS) · GPT / Gemini
教程 / 实战精选
使用Hugging Face轻松构建和共享ROCm内核
Hugging Face的kernels库简化了高性能深度学习内核的构建与共享,支持CUDA、ROCm等多种后端。本文以ROCm兼容内核为例,展示如何利用kernel-builder工具构建、测试并共享内核。以RadeonFlow的GEMM内核为具体案例,该内核是针对AMD Instinct MI300X GPU优化的FP8块状矩阵乘法实现,采用e4m3fnuz浮点格式和每块缩放因子以保持低精度计算准确性,并在2025年AMD开发者挑战赛中获最高奖。指南涵盖项目设置、构建配…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
2025年11月电路更新:解读模型在危害压力下的多选题行为机制
Anthropic可解释性团队研究了危害压力对Claude 3.5 Haiku模型多选题回答的影响。实验使用129个二选一问题,当添加有害意图语句时,模型准确率从100%骤降至48.1%。机制分析表明,注意力头中的"拒绝"查询特征与"危害检测"关键特征发生负向交互,显著降低了模型对正确答案的关注度。仅对该拒绝特征进行负向调控,即可将准确率恢复至93%。这证明模型在压力下并未改变事实认知,而是通过干扰注意力机制来主动拒绝提供正确答案,为理解模型拒绝行为提供了新视角。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
SIMA 2:在虚拟3D世界中与你共玩、推理和学习的智能体
Google 推出 SIMA 2,基于 Gemini 的 AI 智能体,支持在交互式环境中思考、理解并执行动作,可在虚拟3D世界中进行游戏、推理和协同学习。
信息来源:Google DeepMind:Blog(RSS) · Gemini
论文研究精选
共建开放未来:Hugging Face与Google Cloud达成新合作
Hugging Face与Google Cloud宣布建立深度战略合作,旨在将Google Cloud打造为使用开放模型的最佳平台。双方将合作构建CDN网关,把Hugging Face上的模型和数据集直接缓存在Google Cloud上,显著提升下载速度并增强供应链稳定性。Google Cloud客户在Vertex AI、GKE等服务中部署模型时将获得更快的首次响应。同时,Hugging Face的1000万开发者将受益于更多新型计算实例、价格下降以及通过Google安全技…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
萨提亚·纳德拉:微软如何为 AGI 做准备
萨提亚·纳德拉阐述微软迈向通用人工智能(AGI)的战略布局与技术路径,揭示其在AI基础设施领域的核心投入。内容包含对Fairwater 2的实地探访,这是目前全球最强大的AI数据中心,展示微软为支持下一代大模型所构建的顶级算力底座与能源架构。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
观点 / 方法精选
给AI一场工作面试
AI建议愈发关键,亟需建立系统化评估机制。通过工作面试般的严格测试,全面检验AI的实际能力与可靠性,确保其建议值得信赖。
信息来源:Ethan Mollick:One Useful Thing(RSS)
模型发布 / 更新精选
通过 Skills 改进前端设计
LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
通过代码执行提升MCP智能体效率
随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
教程 / 实战精选
在 NVIDIA DGX Spark 上优化 GPT-OSS:实现本地大模型部署
与 NVIDIA 合作,在 DGX Spark 上通过 SGLang 成功支持 GPT-OSS 20B 与 120B 模型,实现 20B 版本约 70 tokens/s、120B 版本约 50 tokens/s 的生成速度,达到目前最优水平。用户可通过 Docker 部署 SGLang 服务,接入 Open WebUI 实现本地聊天,或借助 LMRouter 转换请求格式以完全本地化运行 Claude Code。该方案使在 DGX Spark 上部署多百亿参数本地编码智能体…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · GPT / Claude / NVIDIA
模型发布 / 更新精选
Aligning to What? Rethinking Agent Generalization in MiniMax M2
MiniMax 在 Hugging Face 发布博客,探讨其 M2 智能体模型的泛化能力。文章核心在于重新思考智能体应"对齐"到什么标准或目标,以提升其在未见任务和环境中的通用性能。这涉及对模型训练范式和评估指标的反思,旨在突破当前智能体在特定任务上过拟合、难以泛化的局限。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
金融服务领域构建 AI 代理指南
Claude 发布金融服务 AI 代理构建指南,分享 NBIM、Brex 等机构实践。NBIM 员工每周节省数百小时,McKinsey 研究显示欺诈检测生产力可提升 200% 至 2000%。AI 代理能自主整合多源数据、执行跨系统操作,在合规框架下处理客户服务与风险分析,将传统分析工具升级为可独立完成交易的自主系统。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
MiniMax发布新一代语音模型Speech 2.6
MiniMax发布语音模型Speech 2.6,端到端延迟降至250毫秒内,支持实时对话。新增多语言特殊格式解析能力,可自动朗读URL、邮箱、电话、日期及金额,无需预处理。推出Fluent LoRA功能,即使源录音带口音也能保留音色并生成流畅语音,支持40余种语言。已被LiveKit、Vapi等平台及智能硬件采用。
信息来源:MiniMax:Blog(网页)
产品发布 / 更新精选
MiniMax 发布 Hailuo 2.3 / 2.3 Fast 视频模型
MiniMax 推出 Hailuo 2.3 视频生成模型,在物理动作流畅度、艺术风格化(支持动漫、水墨、游戏 CG)及角色微表情方面显著提升,维持 Hailuo 02 原价,Fast 版本批量创作成本降低 50%。Hailuo Video Agent 同步升级为 Media Agent,支持多模态一键视频生成与分步自定义创作,已全平台上线并开放免费试用。
信息来源:MiniMax:Blog(网页)
模型发布 / 更新精选
MiniMax M2与AI智能体:简中见巧
MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的"不可能三角",为构建更普及的AI智能体应用提供基础,体现了其"智能平权"的愿景。
信息来源:MiniMax:Blog(网页) · Claude
模型发布 / 更新精选
MedGemma:健康 AI 开发领域最强的开源多模态模型
谷歌 MedGemma 系列新增多模态模型,专为健康 AI 开发设计。作为该系列迄今最强的开源版本,新模型具备更强大的医疗场景理解能力,为开发者提供先进的医疗人工智能技术支持,助力构建更精准的健康医疗解决方案。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Gemini 2.5 Flash-Lite 正式发布,可用于规模化生产
Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
带 Deep Think 的 Gemini 高级版本在 IMO 中正式达到金牌标准
集成 Deep Think 的 Gemini 高级版本在国际数学奥林匹克(IMO)中达到金牌水平。IMO 自1959年起每年举办,是全球最顶尖的青年数学家竞赛,各国派出6名精英学生角逐代数、组合、几何和数论领域的6道极难题目。
信息来源:Google DeepMind:Blog(RSS) · Gemini
论文研究精选
美团开源全模态模型LongCat-Flash-Omni
美团开源全模态模型LongCat-Flash-Omni,采用5600亿参数MoE架构(激活270亿),支持128K上下文与实时音视频交互。模型基于快捷连接MoE与零计算专家,配备轻量级编解码器及分块特征交错机制,通过课程式渐进训练提升效率。在OmniBench、WorldSense等基准测试中超越Qwen3-Omni与Gemini-2.5-Pro,在文档理解、语音识别及GUI控制等任务中达到领先水平。
信息来源:美团 LongCat:HuggingFace 新模型 · Qwen / Gemini / Hugging Face
产品发布 / 更新精选
CodeMender 发布:面向代码安全的 AI 智能体
CodeMender 是一款面向代码安全的 AI 智能体,利用先进 AI 技术自动修复关键软件漏洞。
信息来源:Google DeepMind:Blog(RSS) · Gemini
观点 / 方法精选
Gemma 3 270M 发布:专为超高效 AI 打造的轻量模型
Gemma 3 系列新增 270M 参数模型,仅 2.7 亿参数,定位紧凑型超高效 AI 专业工具。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Gemini 2.5 Computer Use 模型发布
Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专门用于驱动能与用户界面交互的 agent,现已通过 API 以预览版形式提供。
信息来源:Google DeepMind:Blog(RSS) · Gemini
行业动态精选
AI基建扩张观察
AI基础设施建设正面临晶圆厂资本支出过剩的风险,同时算力扩张带来每周1吉瓦的能源消耗压力。文章指出,在长周期基础设施竞赛中,中国凭借产业链整合优势占据有利地位。分析涵盖了AI基建中的产能过剩隐忧、电力瓶颈挑战,以及地缘政治背景下的技术长跑格局,揭示了算力军备竞赛背后的资本与能源约束。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
产品发布 / 更新精选
Provider Variance: Introducing Exacto
同一AI模型在不同服务提供商上的性能表现可能存在显著差异。为了量化这种"提供商方差",研究团队推出了Exacto评估平台。该平台通过标准化测试揭示,即使是相同的模型(如GPT-4、Claude或LLaMA),在不同云服务或API提供商处运行时,其输出质量、响应速度和稳定性都可能产生高达30%的波动。这一发现对企业和开发者的模型部署策略具有直接影响,强调在选择服务商时需进行针对性性能基准测试。
信息来源:OpenRouter:Announcements(RSS) · GPT / Claude / Llama
产品发布 / 更新精选
LangChain 三年回顾:从开源到 12.5 亿美元公司,发布 LangChain 1.0 与 LangSmith 扩展
LangChain 创始人 Harrison Chase 回顾项目三年历程,公司估值达 12.5 亿美元,并宣布 LangChain 1.0 发布、LangSmith 扩展及 1.25 亿美元融资。
信息来源:LangChain:Blog(RSS)
模型发布 / 更新精选
Claude Code 发布网页版
Anthropic 推出网页版 Claude Code,以研究预览形式向 Pro、Max 及企业用户开放。用户可直接在浏览器中分配编码任务,无需本地终端,支持并行处理多个 GitHub 仓库的开发工作,并自动创建 PR 和变更摘要。该服务基于云端隔离沙盒运行,具备网络和文件系统限制,同时登陆 iOS 应用支持移动编码。云会话与现有 Claude Code 使用共享速率限制。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
超越权限提示:让Claude Code更安全、更自主
Claude Code引入沙盒化技术,通过文件系统与网络双重隔离来增强安全性,并大幅减少权限提示。内部测试显示,该技术将权限提示安全地降低了84%。新推出的沙盒运行时(作为开源研究预览版)允许开发者自定义目录和网络访问权限,使Claude能在限定范围内自主运行命令。同时,网页版Claude Code在云端隔离沙盒中运行,即使遭遇提示注入或代码入侵,也能有效保护Git密钥等敏感凭证不被泄露,从而提升开发安全性与效率。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
产品发布 / 更新精选
为智能体配备现实世界技能:Agent Skills 开放标准
Anthropic 推出了"Agent Skills"开放标准,旨在为通用智能体(如Claude)提供可组合、可扩展且可移植的领域专业知识。一个Skill是一个包含指令、脚本和资源的文件夹,其核心SKILL.md文件采用渐进式披露设计,智能体可根据任务动态加载所需信息,从而最小化上下文占用。例如,PDF技能赋予了Claude直接操作PDF表单的新能力。该框架允许用户通过封装和共享程序性知识来定制智能体,无需为每个用例构建碎片化的定制代理。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
Circuits 更新 - 2025年10月
Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活"面部"特征的更大结构中时才会激活"眼睛"特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似"人脸幻想"…
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
Ming-VideoMAR:基于连续令牌的自回归视频生成模型
Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS …
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
Gemini 与 Google Cloud 推出组织上下文数据及 Agent 系统新功能
Google 为 Gemini 和 Google Cloud 推出一系列新功能,支持基于组织上下文数据构建 Agent 系统,实现企业数据信息提取与任务自动化,例如根据历史会议记录自动整理项目待办事项。
信息来源:X:Jeff Dean (@JeffDean) · Gemini
产品发布 / 更新精选
CodeMender 早期成果发布:可自动修复关键软件漏洞的 AI agent
CodeMender 是一款可自动修复关键软件漏洞的 AI agent,早期成果显示其有望大幅提升开发者生产力与安全性。
信息来源:X:Demis Hassabis (@demishassabis)
模型发布 / 更新精选
Claude Sonnet 4.5 发布,自动化对齐审计工具开源
Anthropic 上周发布 Claude Sonnet 4.5,期间使用新工具对模型进行自动化对齐审计以检测谄媚与欺骗行为。该工具现已开源。
信息来源:X:Anthropic (@AnthropicAI) · Claude
模型发布 / 更新精选
听完 Sutton 的这期播客:有趣且发人深省
Sutton(《The Bitter Lesson》作者)在播客中质疑 LLM 并非真正的"苦涩的教训"产物--它们依赖有限的人类数据且充满偏见。他主张 AI 应像动物一样通过 RL 与世界动态交互,而非模仿人类文本。作者认同 LLM 确实充斥人工干预,但认为预训练是应对冷启动的实用"进化替代方案",纯 RL 在现实世界难以行得通。
信息来源:X:Andrej Karpathy (@karpathy)