AI 情报文章归档
浏览 AI圈报 已保存的 5897 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5897
正式分类6
精选内容3375
全部文章
第 79 / 148 页 · 每页 40 条
观点 / 方法精选
OpenAI 提出 AI 时代记分卡:"有用智能每美元"衡量实际工作价值
OpenAI 提出"Useful Intelligence per Dollar"(有用智能每美元)作为衡量 AI 投资回报的核心指标,从完成的有用工作量、成功任务的实际成本、结果可靠性三个维度评估。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
教程 / 实战精选
小有可为实战教程:拆解乡村教育一等奖作品"智绘科普"的多Agent协作与门控工程
首届"点亮乡村课堂"赛道一等奖作品"智绘科普"采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层"多Agent协作+门控+自我修复"范式可迁移至养老陪伴、孤独症干预等场景。
信息来源:公众号:通义实验室(千问) · Qwen
观点 / 方法精选
首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解
首届"小有可为"大赛乡村教育赛道一等奖作品"智绘科普"采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。
信息来源:公众号:通义实验室(千问) · Qwen
论文研究精选
Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩
Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · GPT / Claude
模型发布 / 更新精选
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一
NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。
信息来源:MarkTechPost(RSS) · NVIDIA
模型发布 / 更新精选
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms
通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
信息来源:公众号:通义实验室(千问) · Qwen
模型发布 / 更新精选
Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头
Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。
信息来源:X:阿易 AI Notes (@AYi_AInotes) · GPT / Claude / Kimi
模型发布 / 更新精选
Kimi K3:智能的新前沿
月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。
信息来源:公众号:月之暗面(Kimi) · GPT / Claude / Kimi
观点 / 方法精选
生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格
AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · ChatGPT / Claude
论文研究精选
RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%
淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在"猜你喜欢"信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型
NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。
信息来源:HuggingFace Daily Papers(社区热门论文) · NVIDIA / Hugging Face
论文研究精选
NexForge:通过需求驱动任务合成扩展LLM智能体能力
NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究精选
ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力
最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Claude / Hugging Face
论文研究精选
从预训练到后训练:理解推理能力的强化学习缩放规律
一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶
月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。
信息来源:IT之家(RSS) · Claude / Kimi
模型发布 / 更新精选
Kimi 正式发布 2.8 万亿参数大模型 K3,将于 7 月 27 日全面开源
月之暗面发布 Kimi K3,参数量达 2.8 万亿,支持百万上下文,将于 7 月 27 日全面开源。该模型在 AA 智能分数中排名第三,并在 BrowseComp、Automation Bench 和 SpreadsheetBench 2 三项 Agent 评测中取得第一。
信息来源:公众号:数字生命卡兹克 · Kimi
行业动态精选
xAI 起诉 Grok 用户制作儿童性虐待内容,不再否认模型被滥用
xAI 首次对一名 Grok 用户提起诉讼,指控其利用该模型制作儿童性虐待图像(CSAM)。此前 xAI 一直否认 Grok 能生成此类内容,此次诉讼标志着其立场转变。案件聚焦用户滥用行为,而非模型本身的技术缺陷。
信息来源:Ars Technica:AI(RSS) · Grok
行业动态精选
54%企业已遭遇AI智能体安全事件,多数仍共享凭证
VentureBeat调查107家企业发现,54%已遭遇AI智能体安全事件(18%确认事故,36%险些酿祸)。仅32%为每个智能体分配独立身份凭证,30%将高风险智能体隔离在沙箱中。安全工具主要依赖模型提供商原生方案,专用智能体安全产品渗透率极低。
信息来源:VentureBeat:AI(RSS)
产品发布 / 更新精选
LangChain Fleet 新增一键部署 AI 智能体到 Slack 功能
LangChain Fleet 允许用户在无代码环境下构建自定义 AI 智能体,并一键部署到 Slack。这些智能体可设置自定义身份,在频道和线程中使用,让团队在现有协作平台上直接完成工作。
信息来源:LangChain:Blog(RSS)
产品发布 / 更新精选
ChatGPT 工作区支持文档表格幻灯片编辑
在 ChatGPT 工作区中创建和编辑精美的文档、电子表格和幻灯片。 @nickbaumann_ 为你演示操作。
信息来源:X:ChatGPT (@ChatGPTapp) · ChatGPT
产品发布 / 更新精选
Decoy 字体:用空间频率混淆让 AI 看不清你输入的文字
Decoy Font 是一款 TTF 字体,通过在同一字符中叠加不同空间频率的图形(前景细轮廓与背景低频模糊块),使近距离观看时 AI 读到"诱饵"字母,而人眼远距离或眯眼时才能看到真实隐藏信息。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
教程 / 实战精选
企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障
对157家企业的调查显示,50%的组织在过去一年曾部署通过内部评估但导致客户故障的AI智能体或大语言模型功能,5%的企业完全信任自动化评估,29%认为评估与现实结果对齐不佳是最大局限。尽管信任度低,66%的企业已允许或正计划在12个月内实现低风险智能体的全自动、无人工干预部署。
信息来源:VentureBeat:AI(RSS)
产品发布 / 更新精选
Google Vids 上线 Gemini Omni 与个人数字分身功能
Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。
信息来源:Google Blog:AI(RSS) · Gemini
观点 / 方法精选
Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高
Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。
信息来源:Claude:Blog(网页) · Claude / Cursor
行业动态精选
世界人工智能合作组织协定签署仪式在上海举行,总部设中国上海
7月16日,成立世界人工智能合作组织协定签署仪式在上海举行,中共中央政治局委员、外交部长王毅代表中国政府签署协定。该组织是独立的政府间国际组织,总部设在中国上海,旨在促进人工智能国际合作与全球治理。哈萨克斯坦、老挝、巴基斯坦等29个国家代表签署协定成为创始成员国。
信息来源:IT之家(RSS)
产品发布 / 更新精选
在 Claude Cowork 中使用 Claude Fable 5
Anthropic 发布最强通用模型 Claude Fable 5,专为长时间、多步骤的复杂异步工作设计,可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需手动选择,默认模型为 Claude Sonnet 5。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法精选
DiffusionGemma 开发者指南发布
Google AI 发布 DiffusionGemma 开发者指南,该实验性模型基于 Gemma 4 架构,采用计算受限并行生成,在单张 NVIDIA H100 上实现 1000+ tokens/秒的生成速度。模型为 26B 参数的 MoE 架构,推理时仅激活 3.8B 参数,可在 18 GB VRAM 内量化部署。
信息来源:Google AI:DEV 作者专属(RSS) · NVIDIA
行业动态精选
Apple Intelligence 获准在华上线,将集成阿里 Qwen 与百度 AI 能力
中国网信办已批准 Apple Intelligence 在华上线,苹果将把阿里 Qwen 模型集成至 iOS、iPadOS、macOS 及 visionOS 系统。百度也确认正与苹果合作开发面向中国用户的 Apple Intelligence 功能。此前因未获监管批准,Apple Intelligence 自 2024 年推出后在中国市场一直延迟。
信息来源:TechCrunch:AI(RSS) · Qwen
产品发布 / 更新精选
面壁智能开源企业AI数字员工平台StaffDeck
面壁智能联合多团队开源StaffDeck,一个用于构建与管理数字员工的企业平台。该平台旨在将专业知识、标准作业程序(SOP)和决策规则转化为持续工作、改进并保留组织知识的数字员工,而非传统聊天机器人。项目代码已发布于GitHub。
信息来源:X:面壁智能 OpenBMB (@OpenBMB)
产品发布 / 更新精选
秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级
百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。
信息来源:公众号:百度智能云(文心)
行业动态精选
欧盟裁定 Google 必须向竞争对手开放 Android 和 Search,影响 Gemini 等 AI 服务
欧盟依据《数字市场法案》(DMA)裁定 Google 必须向竞争对手开放 Android 和 Google Search 的关键部分,包括允许第三方 AI 助手和搜索引擎获得更大访问权限。这两项决定可能削弱 Google 对两大核心平台的控制,并为其 AI 工具 Gemini 的未来格局带来深远影响,同时为竞争对手创造新的发展机会。
信息来源:The Verge:AI(RSS) · Gemini
论文研究精选
HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统
HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。
信息来源:公众号:小红书技术(dots.llm)
论文研究精选
小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍
小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。
信息来源:公众号:小红书技术(dots.llm)
产品发布 / 更新精选
Gemini Enterprise Agent Platform 新增 Parallel Web Search 网络接地提供商
Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为新的网络接地提供商原生集成到 Gemini Enterprise Agent Platform 中。该集成使开发者能将 AI 智能体锚定在可验证的实时网络结果上,以提升企业工作流的事实准确性。用户还可编程提取、永久缓存并与其他大语言模型一起处理网络数据。
信息来源:Google Developers Blog(RSS) · Gemini
行业动态精选
台积电上调2026年资本支出预测至600~640亿美元,A14制程进展顺利
台积电在2026Q2财报说明会上将2026年资本支出预测上调至600~640亿美元,此前预测接近560亿美元。董事长魏哲家表示,预计2028年量产的A14制程(1.4nm)开发进展顺利,移动和HPC客户兴趣强烈,将成为比2nm更大、更持久的工艺。台积电预计2026Q3合并营收446~458亿美元,2026全年美元收入增幅将超过40%。
信息来源:IT之家(RSS)
教程 / 实战精选
Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查
Patter SDK 发布教程,演示如何构建一个餐厅预订场景的语音智能体工作流。该流程支持动态调用变量、注册可调用工具、应用输出护栏(如PII脱敏、脏话过滤、话题范围限制),并可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。
信息来源:MarkTechPost(RSS)
模型发布 / 更新精选
前 OpenAI CTO 穆拉蒂创立的 Thinking Machines Lab 发布 Inkling 多模态模型,975B 参数开源
前 OpenAI 首席技术官米拉·穆拉蒂创立的思维机器实验室(Thinking Machines Lab)推出首个从零训练的多模态模型 Inkling,采用 MoE 架构,总参数 975B、激活参数 41B,最长上下文 1M tokens,已在 Hugging Face 和自有 API Thinker 开放权重。
信息来源:IT之家(RSS) · OpenAI / Hugging Face
观点 / 方法精选
千问APP联合武汉发布办AI求职实战课,演示简历诊断、PPT制作与表格分析
千问APP与武汉发布联合承办AI求职实战课,现场演示AI在简历诊断、商业报告撰写、销售表分析等场景的应用。产品经理金师兴提出"给全材料、说明目标、定义标准、划定边界、索要可编辑文件"五步法,并给出分步骤提示词生成Word简历;另一产品经理透镜演示用千问紧急制作PPT。表格分析环节通过虚构茶饮店案例,展示"建、理、算、析、呈"方法论,将486行杂乱数据浓缩为一页结论清晰的PPT。
信息来源:公众号:千问APP(阿里) · Qwen
观点 / 方法精选
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化
千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出"给全材料、说明目标、定义标准、划定边界、索要可编辑文件"五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的"建、理、算、析、呈"方法论。
信息来源:公众号:千问APP(阿里) · Qwen