AI 情报文章归档
浏览 AI圈报 已保存的 5575 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5575
正式分类6
精选内容3480
全部文章
第 136 / 140 页 · 每页 40 条
论文研究精选
美团开源全模态模型LongCat-Flash-Omni
美团开源全模态模型LongCat-Flash-Omni,采用5600亿参数MoE架构(激活270亿),支持128K上下文与实时音视频交互。模型基于快捷连接MoE与零计算专家,配备轻量级编解码器及分块特征交错机制,通过课程式渐进训练提升效率。在OmniBench、WorldSense等基准测试中超越Qwen3-Omni与Gemini-2.5-Pro,在文档理解、语音识别及GUI控制等任务中达到领先水平。
信息来源:美团 LongCat:HuggingFace 新模型 · Qwen / Gemini / Hugging Face
产品发布 / 更新精选
CodeMender 发布:面向代码安全的 AI 智能体
CodeMender 是一款面向代码安全的 AI 智能体,利用先进 AI 技术自动修复关键软件漏洞。
信息来源:Google DeepMind:Blog(RSS) · Gemini
观点 / 方法精选
Gemma 3 270M 发布:专为超高效 AI 打造的轻量模型
Gemma 3 系列新增 270M 参数模型,仅 2.7 亿参数,定位紧凑型超高效 AI 专业工具。
信息来源:Google DeepMind:Blog(RSS) · Gemini
模型发布 / 更新精选
Gemini 2.5 Computer Use 模型发布
Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专门用于驱动能与用户界面交互的 agent,现已通过 API 以预览版形式提供。
信息来源:Google DeepMind:Blog(RSS) · Gemini
行业动态精选
AI基建扩张观察
AI基础设施建设正面临晶圆厂资本支出过剩的风险,同时算力扩张带来每周1吉瓦的能源消耗压力。文章指出,在长周期基础设施竞赛中,中国凭借产业链整合优势占据有利地位。分析涵盖了AI基建中的产能过剩隐忧、电力瓶颈挑战,以及地缘政治背景下的技术长跑格局,揭示了算力军备竞赛背后的资本与能源约束。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
产品发布 / 更新精选
Provider Variance: Introducing Exacto
同一AI模型在不同服务提供商上的性能表现可能存在显著差异。为了量化这种"提供商方差",研究团队推出了Exacto评估平台。该平台通过标准化测试揭示,即使是相同的模型(如GPT-4、Claude或LLaMA),在不同云服务或API提供商处运行时,其输出质量、响应速度和稳定性都可能产生高达30%的波动。这一发现对企业和开发者的模型部署策略具有直接影响,强调在选择服务商时需进行针对性性能基准测试。
信息来源:OpenRouter:Announcements(RSS) · GPT / Claude / Llama
产品发布 / 更新精选
LangChain 三年回顾:从开源到 12.5 亿美元公司,发布 LangChain 1.0 与 LangSmith 扩展
LangChain 创始人 Harrison Chase 回顾项目三年历程,公司估值达 12.5 亿美元,并宣布 LangChain 1.0 发布、LangSmith 扩展及 1.25 亿美元融资。
信息来源:LangChain:Blog(RSS)
模型发布 / 更新精选
Claude Code 发布网页版
Anthropic 推出网页版 Claude Code,以研究预览形式向 Pro、Max 及企业用户开放。用户可直接在浏览器中分配编码任务,无需本地终端,支持并行处理多个 GitHub 仓库的开发工作,并自动创建 PR 和变更摘要。该服务基于云端隔离沙盒运行,具备网络和文件系统限制,同时登陆 iOS 应用支持移动编码。云会话与现有 Claude Code 使用共享速率限制。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
超越权限提示:让Claude Code更安全、更自主
Claude Code引入沙盒化技术,通过文件系统与网络双重隔离来增强安全性,并大幅减少权限提示。内部测试显示,该技术将权限提示安全地降低了84%。新推出的沙盒运行时(作为开源研究预览版)允许开发者自定义目录和网络访问权限,使Claude能在限定范围内自主运行命令。同时,网页版Claude Code在云端隔离沙盒中运行,即使遭遇提示注入或代码入侵,也能有效保护Git密钥等敏感凭证不被泄露,从而提升开发安全性与效率。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
产品发布 / 更新精选
为智能体配备现实世界技能:Agent Skills 开放标准
Anthropic 推出了"Agent Skills"开放标准,旨在为通用智能体(如Claude)提供可组合、可扩展且可移植的领域专业知识。一个Skill是一个包含指令、脚本和资源的文件夹,其核心SKILL.md文件采用渐进式披露设计,智能体可根据任务动态加载所需信息,从而最小化上下文占用。例如,PDF技能赋予了Claude直接操作PDF表单的新能力。该框架允许用户通过封装和共享程序性知识来定制智能体,无需为每个用例构建碎片化的定制代理。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
Circuits 更新 - 2025年10月
Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活"面部"特征的更大结构中时才会激活"眼睛"特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似"人脸幻想"…
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
模型发布 / 更新精选
Ming-VideoMAR:基于连续令牌的自回归视频生成模型
Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS …
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
Gemini 与 Google Cloud 推出组织上下文数据及 Agent 系统新功能
Google 为 Gemini 和 Google Cloud 推出一系列新功能,支持基于组织上下文数据构建 Agent 系统,实现企业数据信息提取与任务自动化,例如根据历史会议记录自动整理项目待办事项。
信息来源:X:Jeff Dean (@JeffDean) · Gemini
产品发布 / 更新精选
CodeMender 早期成果发布:可自动修复关键软件漏洞的 AI agent
CodeMender 是一款可自动修复关键软件漏洞的 AI agent,早期成果显示其有望大幅提升开发者生产力与安全性。
信息来源:X:Demis Hassabis (@demishassabis)
模型发布 / 更新精选
Claude Sonnet 4.5 发布,自动化对齐审计工具开源
Anthropic 上周发布 Claude Sonnet 4.5,期间使用新工具对模型进行自动化对齐审计以检测谄媚与欺骗行为。该工具现已开源。
信息来源:X:Anthropic (@AnthropicAI) · Claude
模型发布 / 更新精选
听完 Sutton 的这期播客:有趣且发人深省
Sutton(《The Bitter Lesson》作者)在播客中质疑 LLM 并非真正的"苦涩的教训"产物--它们依赖有限的人类数据且充满偏见。他主张 AI 应像动物一样通过 RL 与世界动态交互,而非模仿人类文本。作者认同 LLM 确实充斥人工干预,但认为预训练是应对冷启动的实用"进化替代方案",纯 RL 在现实世界难以行得通。
信息来源:X:Andrej Karpathy (@karpathy)
观点 / 方法精选
我明白你们的意思,但是…
Sam Altman 回应"7万亿治愈癌症却做AI广告"的质疑,解释筹集资金主要用于科研AI与AGI研发,推出个性化广告等消费产品是为赚取算力成本并展示技术,称公司发展路径本就复杂,类似ChatGPT初期也曾遭质疑。
信息来源:X:Sam Altman (@sama) · ChatGPT
产品发布 / 更新精选
每月 100 万次免费 BYOK 请求
所有客户每月可免费获得 100 万次"自带密钥"(BYOK)请求。这一政策将 BYOK 功能从付费服务转变为免费提供的基础配额,大幅降低了企业使用自有密钥管理数据安全的技术与成本门槛。免费额度覆盖了绝大多数中小规模企业的典型月请求量。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
OpenRouter 推出每月100万免费BYOK请求
OpenRouter 向每位客户每月提供100万次"Bring Your Own Key"(BYOK)请求,完全免费。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
Anthropic 工程博客新文:开发者熟知 prompt engineering,但要让 AI agents 发挥最大价值,你需要 context engineering
Anthropic 工程博客发文解释 context engineering。与 prompt engineering 不同,context engineering 通过优化上下文帮助 AI agents 发挥最大效能,文章详解其工作原理。
信息来源:X:Anthropic (@AnthropicAI) · Claude
产品发布 / 更新精选
Sora 2
OpenAI发布Sora应用,集成Sora 2模型,支持快速创作、分享和观看视频,团队称其为"创意领域的ChatGPT时刻"。核心功能包括cameo客串特性,可保持角色一致性并将用户及朋友置入视频。团队同时表达对成瘾性和低质内容("slop feed")风险的担忧,提出四项产品原则:优化长期用户满意度、赋予用户信息流控制权、优先鼓励创作、帮助实现长期目标,并配备深度伪造防护和情绪健康监测等安全措施。
信息来源:Sam Altman:Blog(RSS) · OpenAI / ChatGPT
模型发布 / 更新精选
Claude Code 今晨获多项升级
Claude Code 今晨发布多项功能升级,Claude Developer Platform 同步推出两项上下文管理新功能,具体更新详情可通过官方链接查看。
信息来源:X:Claude (@claudeai) · Claude
产品发布 / 更新精选
真正的 AI Agents 与真正的工作
探讨 AI Agents 在真实工作场景中的定位,指出其核心挑战在于对抗"无限PPT"的形式主义陷阱。强调真正的智能体应当服务于以人为本的实质性工作,而非制造更多文档流程或官僚化产出。
信息来源:Ethan Mollick:One Useful Thing(RSS)
模型发布 / 更新精选
推出 Claude Sonnet 4.5--全球最佳编程模型
Anthropic 发布 Claude Sonnet 4.5,称其为全球最佳编程模型。该模型在构建复杂智能体与计算机使用方面表现最强,推理和数学测试成绩也有显著提升。
信息来源:X:Claude (@claudeai) · Claude
产品发布 / 更新精选
M365 Copilot 推出 Agent Mode,Vibe work 正式落地
M365 Copilot 上线 Agent Mode,可自动编排多步骤任务,正式开启 Vibe work。
信息来源:X:Satya Nadella (@satyanadella)
模型发布 / 更新精选
DeepSeek-V3.2-Exp 发布,引入稀疏注意力提升长文本效率,API 降价超 50%
DeepSeek 发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention(DSA)稀疏注意力机制,在几乎不影响输出效果的前提下大幅提升长文本训练和推理效率,公开评测表现与 V3.1-Terminus 基本持平。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
产品发布 / 更新精选
inclusionAI/dInfer
inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
inclusionAI发布MingTok-Audio:首个统一连续语音分词器
inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错…
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
观点 / 方法精选
为AI智能体实施有效的上下文工程
随着AI应用从单次提示转向构建长期运行的智能体,焦点正从"提示工程"演进为"上下文工程"。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在"注意力预算"限制和"上下文腐化"现象--随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
观点 / 方法精选
Julian 是 AlphaGo、AlphaZero 和 MuZero 的共同一作,虽在 Twitter 上低调,但十多年来始终处于 AI 指数级进步的最前沿
AlphaGo、AlphaZero 和 MuZero 共同一作 Julian Schrittwieser 指出,公众对当前 AI 指数级进步普遍认知不足。他发布博客总结近期研究进展,并预测未来 1-2 年的发展趋势。
信息来源:X:Noam Brown (@polynoamial)
教程 / 实战精选
Launch HN: Webhound (YC S23) - 从网络构建数据集的研究智能体
YC S23 孵化的 Webhound 发布,这是一款研究智能体,可自动从网络抓取多源信息并构建结构化数据集,用于支持数据分析与研究工作。
信息来源:Hacker News:AI 热帖
论文研究精选
丰裕智能(Abundant Intelligence)
Sam Altman 提出我们正进入"丰裕智能"时代,深度学习将持续扩展。OpenAI 发布 Deep Research 功能,并预测 2025 年 AI 智能体将加入劳动力市场,未来几年有望实现超级智能,带来科学加速和前所未有的繁荣。
信息来源:X:Sam Altman (@sama) · OpenAI
行业动态精选
感谢 Jensen 近十年的合作!
OpenAI 与 NVIDIA 宣布合作建设 gigascale AI 工厂,将部署数百万 NVIDIA GPU,提供 10 gigawatts 算力支持 OpenAI 数据中心扩张。双方合作关系已持续近十年。
信息来源:X:Sam Altman (@sama) · OpenAI / NVIDIA
行业动态精选
充裕的智能
计划打造每周可新增1吉瓦算力的AI基础设施工厂,通过芯片、电力到机器人的全栈创新,支撑治愈癌症、全球个性化教育等宏大应用。项目将主要落地美国,未来数月公布合作伙伴,年底披露融资方案。
信息来源:Sam Altman:Blog(RSS)
模型发布 / 更新精选
DeepSeek-V3.1 更新至 Terminus 版本,优化语言一致性与 Agent 能力
DeepSeek-V3.1 已更新至 DeepSeek-V3.1-Terminus 版本,在保持原有能力基础上,缓解了中英文混杂、偶发异常字符等问题,并优化了 Code Agent 与 Search Agent 的表现。官方 App、网页端、小程序与 DeepSeek API 均已同步更新,开源版本已发布至 Hugging Face。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek / Hugging Face
观点 / 方法精选
未来几周将推出计算密集型新产品,部分功能因成本原因将仅限 Pro 订阅者
未来几周将推出新的计算密集型产品,部分功能仅限 Pro 订阅者,部分新产品需额外付费。尽管长期目标仍是降低智能成本并普及服务,但当前希望探索在高计算投入下能实现哪些新可能性。
信息来源:X:Sam Altman (@sama)
模型发布 / 更新精选
12/12 题目全部解决,相当于第一名成绩,GPT-5 解决了其中 11 道
OpenAI 推理系统在 2025 ICPC 世界总决赛中获得 12/12 满分,成绩相当于人类参赛者第一名。其中 11 道题目由 GPT-5 解决。
信息来源:X:Noam Brown (@polynoamial) · OpenAI / GPT
模型发布 / 更新精选
OpenAI 通用推理模型在 2025 ICPC 世界总决赛获满分,排名人类第一
OpenAI 推理系统在 2025 ICPC 世界总决赛中解出全部 12 道算法题,获得 12/12 满分。该成绩在所有人类参赛队伍中排名第一,足以夺得冠军。
信息来源:X:OpenAI (@OpenAI) · OpenAI
模型发布 / 更新精选
Gemini 模型编程能力再提升:Gemini 2.5 Deep Think 在 ICPC 世界总决赛达到金牌水平
Gemini 2.5 Deep Think 高级版本在 2025 年 ICPC 世界总决赛中取得金牌级别成绩,标志着 Gemini 模型编程能力持续精进,在竞赛级编程任务中表现卓越。
信息来源:X:Jeff Dean (@JeffDean) · Gemini
行业动态精选
OpenAI 推理系统在 ICPC 世界总决赛中满分夺冠
OpenAI 推理系统在 2025 年 ICPC 世界总决赛中满分 12/12 完成所有题目,成绩超越所有人类参赛队伍(最佳人类队伍解出 11 题)。这是其模型近两个月内继 AtCoder Heuristics 世界亚军、IMO 金牌、IOI 金牌后的第四项顶级竞赛佳绩。OpenAI 首席科学家表示,下一步挑战是解决更开放、时间跨度更长的问题。
信息来源:X:Jakub Pachocki(OpenAI 首席科学家,@merettm) · OpenAI