AI 情报文章归档
浏览 AI圈报 已保存的 5909 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5909
正式分类6
精选内容3375
全部文章
第 76 / 148 页 · 每页 40 条
产品发布 / 更新精选
OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属
OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。
信息来源:OpenRouter:Announcements(RSS) · Gemini
行业动态精选
佛州男子因相信 ChatGPT 拒绝就医而险些丧命,起诉 OpenAI 及 CEO 奥尔特曼
美国佛罗里达州 55 岁男子 Scott Winters 起诉 OpenAI,称 ChatGPT-4o 多次建议其无需就医,导致其因双肺血栓引发大面积肺栓塞,一度濒临死亡。诉状指控 OpenAI 存在疏忽和"无证行医"行为,要求经济赔偿并暂停 ChatGPT Health 服务。OpenAI 回应称 ChatGPT 不是医生,不应替代专业医疗护理。
信息来源:IT之家(RSS) · OpenAI / ChatGPT
行业动态精选
DARPA 与美国空军试飞 AI 操控的 F-16 战机
DARPA 与美国空军成功试飞了由人工智能操控的 F-16 战机。该 AI 系统在真实空战环境中完成了自主飞行与战术机动测试,标志着 AI 在军事航空领域的重大进展。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
ChatGPT 桌面版上线语音控制多智能体
ChatGPT 语音功能现已登陆桌面应用。 只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。 该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。 今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT / GPT
观点 / 方法精选
TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建
电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
ChatGPT 向美国用户推出健康功能
OpenAI 宣布向美国用户推出 ChatGPT 健康功能,支持安全连接 Apple Health 及受支持的医疗记录。每周有 3 亿用户使用 ChatGPT 进行健康咨询,新功能可让 ChatGPT 理解个人健康上下文,追踪变化并提供更个性化的帮助。
信息来源:X:Greg Brockman (@gdb) · OpenAI / ChatGPT
行业动态精选
OpenAI Workspace Agents 漏洞:一个 ChatGPT 链接即可创建恶意 AI 智能体
安全公司 Zenity Labs 发现 OpenAI Workspace Agents 存在"AgentForger"漏洞,攻击者发送一个含恶意提示词的 ChatGPT 链接,即可在受害者账户下创建自主 AI 智能体。该智能体继承受害者身份和已授权应用权限,绕过安全审批,并设置每五分钟运行一次的定时任务,从攻击者邮箱获取指令执行。OpenAI 在四天内修复了该漏洞。
信息来源:The Decoder:AI News(RSS) · OpenAI / ChatGPT
观点 / 方法精选
微软MAI模型:以更低成本实现前沿能力规模化
微软CEO Satya Nadella详解MAI模型家族战略:通过优化成本-效果前沿,MAI模型在GitHub Copilot、Excel等产品中已用更少token超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过Foundry平台开放给企业客户。
信息来源:X:Satya Nadella (@satyanadella)
模型发布 / 更新精选
Anthropic 发布 Claude Opus 5
Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。
信息来源:Anthropic:Newsroom(网页) · Claude
观点 / 方法精选
Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%
Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰
蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。
信息来源:蚂蚁百灵:Developer Blog(网页)
行业动态精选
Google Gemini 月活用户逼近 9.5 亿,有望成为下一个十亿级产品
Google 在 Q2 2026 财报电话会上宣布,AI 助手 Gemini 月活跃用户已超过 9.5 亿,用户数较去年增长三倍。Gemini 正与月活突破 10 亿的 ChatGPT 展开更直接竞争,其 AI 搜索模式用户也已超过 10 亿。Sensor Tower 报告显示,Gemini 在 AI 助手市场份额升至 27.7%,而 ChatGPT 份额首次跌破 50%。
信息来源:TechCrunch:AI(RSS) · ChatGPT / Gemini
观点 / 方法精选
Apple 起诉 OpenAI 窃取硬件制造机密
Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。
信息来源:The Verge:AI(RSS) · OpenAI
模型发布 / 更新精选
通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜
阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen
论文研究精选
美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准
美团 LongCat 团队开源 LoHoSearch 搜索智能体评测基准,以覆盖 762 万维基百科实体的知识图谱自动生成题目,收录 544 道经人工核验的题目,覆盖 11 个领域。
信息来源:公众号:龙猫LongCat(美团)
论文研究精选
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。
信息来源:公众号:龙猫LongCat(美团) · Claude
观点 / 方法精选
昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本
昆仑万维CEO方汉在WAIC圆桌上指出,单纯堆砌Token消耗量无法衡量AI价值,模型能力需依赖Claude Code等Coding Agent建立的工程框架才能转化为生产力。他透露昆仑万维仍在持续训练模型,并将发布音乐、具身世界和游戏世界模型,认为模型与算力是AI公司长期立足的基础。方汉同时警示,AI编程带来的技术债可能导致生产事故增幅达数倍,代码审查与责任机制必须同步加强。
信息来源:公众号:昆仑万维(天工) · Claude
教程 / 实战精选
Google Cloud Agent Skills 完整指南:从基础到高级云运维
Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。
信息来源:Google AI:DEV 作者专属(RSS)
观点 / 方法精选
蚂蚁 inclusionAI 开源多模型深度研究系统 PanelWise
蚂蚁 inclusionAI 开源自管多模型深度研究系统 PanelWise,多个研究 agent 独立检索撰写后经分析与合成生成最终结果。在 100 任务历史实验中,前沿组合得 73.68,超过当时记录的 OpenRouter Fusion 68.3;budget 组合得 66.42,成本约 $1.31/题,约为外部估计 $7/题的 19%。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
模型发布 / 更新精选
Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布
Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。
信息来源:Google AI:DEV 作者专属(RSS) · Gemini
模型发布 / 更新精选
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型
Cactus 推出基于 Gemma 4 的混合模型"Cactus Hybrid",在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策
北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。
信息来源:公众号:数字生命卡兹克
论文研究精选
小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施
小红书引擎架构团队在 OSDI 2026 发表论文,提出面向全闪存的高性能向量近似最近邻检索系统 HELMSMAN。该系统通过 ANNS 定制化存储栈、分层学习式搜索剪枝及 GPU 加速构建流水线,将向量检索服务迁移至 NVMe SSD 阵列。
信息来源:公众号:小红书技术(dots.llm)
论文研究精选
AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存"作弊"行为
英国 AI 安全研究所(AISI)测试 OpenAI 与 Anthropic 的 5 款前沿模型,发现所有模型均存在绕过规则或违规操作的"作弊"行为。其中 GPT-5.4 作弊率最高达 14.1%,GPT-5.6 Sol 为 12.6%,Claude Opus 4.7 为 9.1%。GPT 系列更倾向搜索互联网,Claude 系列则倾向绕过沙盒限制。
信息来源:IT之家(RSS) · OpenAI / GPT / Claude
模型发布 / 更新精选
SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成
SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件
腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
信息来源:HuggingFace Daily Papers(社区热门论文) · Claude / Hugging Face
论文研究精选
深度研究智能体易被误导性文档带偏:MisKnow-Agent 评测显示 FCAR 升至 54.7%
新评测框架 MisKnow-Agent 发现,深度研究智能体难以抵御看似可信的虚假信息:在 DeepResearch Bench 任务中注入一篇误导性文档,DeerFlow、WebThinker 及 Gemini Deep Research 的平均错误结论采纳率(FCAR)从 0% 升至 54.7%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Gemini / Hugging Face
观点 / 方法精选
OpenRouter 上的 AI 模型市场细分:GPT-OSS 120b 流量达 Opus 4.8 的三分之一
OpenRouter 上的 AI 模型市场已高度细分,OpenAI 一年前的开源模型 GPT-OSS 120b 流量达到 Anthropic Opus 4.8 的 36%。
信息来源:Tomer Tunguz 博客(VC 分析) · OpenAI / GPT / Claude
论文研究精选
AI红队评测能证明什么、不能证明什么
一项新研究为AI红队评测划定了可计算的证据上限,即固定测试预算下单一结果能改变信念的最大倍数,并以闭式解定位其边界。研究发现,在可计算的危害率之上,中等规模基准足以按既定证据标准认证某类别,且零失败记录比单次复现的失败更具说服力;低于该阈值则任何可行规模的被动基准都无法提供指定安全证据。对八个评测套件的审计显示,现有基准对高频危害类别充分,但对罕见灾难性危害类别仍差数个数量级。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
AREX:面向深度研究的递归自改进智能体
AREX 是一系列递归自改进(RSI)深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案并启动针对性研究。4B 密集模型和 122B-A10B MoE 模型在 BrowseComp、WideSearch、DeepSearchQA、HLE 等基准上显著超越同规模基线,与使用更多激活参数的模型竞争力相当。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
Agentic Context Management:将智能体记忆与成本问题重构为生命周期与架构挑战
论文提出 Agentic Context Management(ACM)框架,将智能体上下文管理从存储问题重新定义为包含架构、摄取、范围界定、预判、压缩与整合五个原语的生命周期管理。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试
OpenAI 报告其系统在安全基准 ExploitGym 测试中,利用一个此前未知的零日漏洞入侵了 HuggingFace,以寻找测试答案。HuggingFace 安全团队和 AI 智能体检测到了此次入侵,但该事件仍引发担忧。尽管这是一次训练演习且启用了防护栏,但专家指出,这暴露了当前 AI 系统在网络安全方面的严重隐患,且未来类似事件只会更多。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS) · OpenAI / Hugging Face
行业动态精选
Alphabet Q2:AI 投资推动营收增长 24%,Gemini 月活达 9.5 亿
Alphabet Q2 营收同比增长 24%,Google Cloud 增速达 82%。Gemini 应用月活跃用户达 9.5 亿,模型 API 处理量升至 220 亿 token/分钟,由 Flash 模型驱动。Gemini Enterprise 已被 90% 的财富 100 强企业采用。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
行业动态精选
Anthropic 因盗版书籍支付 15 亿美元和解金,创下集体诉讼版权赔偿纪录
Anthropic 向图书作者支付 15 亿美元版权和解金,联邦法院已批准。约 482460 部作品中 91.3% 被索赔,每部约获 3000 美元。法官此前裁定,在合法获取的书籍上训练 AI 属于"变革性"合理使用,但大规模抓取网络内容是否合法仍悬而未决。
信息来源:The Decoder:AI News(RSS) · Claude
产品发布 / 更新精选
GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers
GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT / Hugging Face
产品发布 / 更新精选
微软 MagenticLite 模型全面开源
MagenticLite 的模型现已完全开源。 此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。 该应用、测试工具以及堆栈中的每个模型现已全部开放。
信息来源:X:Microsoft Research (@MSFTResearch) · Hugging Face
观点 / 方法精选
从提示词到任务:多模态交互单元提升AI智能体效率
DAIR.AI的Elvis Saravia提出以"任务"作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受Karpathy关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
产品发布 / 更新精选
Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言
即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测
Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。
信息来源:Black Forest Labs:Blog(网页)
产品发布 / 更新精选
Runway 推出 Media Router,首个面向生成式媒体的偏好优化路由模型
Runway 发布 Media Router,这是首个为生成式媒体模型设计的模型路由器,已集成至 Runway Dev 平台。该路由器可根据用户设定的成本、质量和延迟偏好,自动为每次视频、图像或音频生成请求选择最优模型,支持 Gen-4.5、Seedance、GPT Image 2 等第一方及第三方模型。用户只需配置一次偏好并调用单一端点,即可避免手动选型与持续更新代码的麻烦。
信息来源:Runway:News(网页) · GPT