AI 情报文章归档
浏览 AI圈报 已保存的 5760 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5760
正式分类6
精选内容3361
全部文章
第 42 / 144 页 · 每页 40 条
论文研究普通
终端智能体评测:脚手架比模型更影响分数
一项针对命令行环境AI智能体的综述发现,模型外围脚手架(scaffold)对基准分数的影响大于模型本身,系统间差异可测量而模型变体间差异不显著。同一脚手架内更强的模型变体未带来额外解决任务数,仅增加延迟。研究建议将脚手架选择视为一级工程决策。
信息来源:X:Rohan Paul (@rohanpaul_ai)
产品发布 / 更新普通
Gemini Enterprise 首批法律与金融插件发布
Google 为 Gemini Enterprise 推出首批面向法律与金融场景的插件,将精选 Apps 与 Skills 按用途组合成捆绑包。未来捆绑包有望扩展至消费版 Gemini,但当前仅发布两个。合作生态涵盖 Accenture、Deloitte、KPMG 等全球系统集成商。
信息来源:X:Testing Catalog (@testingcatalog) · Gemini
观点 / 方法普通
两大实验室将掌控全球算力
Anthropic 和 OpenAI 有望在几年内控制全球大部分可用 FLOPs,因其能更好变现算力并出价超过所有对手。对话还探讨了本十年末超 10 万亿美元 AI 资本支出或引发主权债务危机,以及训练规模经济与算力稀缺推动行业集中化是否可被逆转。
信息来源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue) · OpenAI / Claude / Hugging Face
观点 / 方法普通
Aletheia's Quest 回顾:构建 AI 谎言检测器的经验与教训
EleutherAI 在 Aletheia's Quest 项目中构建了黑盒与白盒两类 AI 欺骗检测器,并分享了过程中的关键经验。项目聚焦于识别模型输出中的不实信息,其方法覆盖了从外部行为观察到内部机制分析的不同路径。回顾总结了检测器在实际应用中的局限与未来改进方向。
信息来源:EleutherAI:Blog
论文研究普通
NVIDIA ACES:技能文档高分不等于运行时有效
NVIDIA 新论文提出 ACES 评估框架,指出技能文档得分高不代表智能体运行时真能受益--技能主要贡献是发现与工作流顺序,而非最终答案质量。ACES 固定任务、模型、沙箱等变量,仅对比有无目标技能两次运行的奖励差,定义为 Skill Lift。在生产技能实测中,结构与裁判评分与 Skill Lift 相关性仅 −0.0181 和 −0.0266,几乎为零。
信息来源:X:Rohan Paul (@rohanpaul_ai) · NVIDIA
产品发布 / 更新普通
OpenAI 自研 Jalapeño 推理芯片公布首批性能数据
OpenAI 公布自研 AI 推理芯片 Jalapeño 的初步性能结果。在 InferenceX 上对三个公开模型的测试显示,其每瓦 AI 工作量提升 1.5-1.9 倍,端到端延迟降低 1.7-3.6 倍,高交互负载性能提升 2.1-4.1 倍。
信息来源:X:Testing Catalog (@testingcatalog) · OpenAI
观点 / 方法普通
新Mac mini AI性能暴涨4倍,起售价涨至899美元
苹果发布新Mac mini,AI性能提升4倍,起售价从599涨至899美元。首发2nm M6芯片采用超核加能效核架构,每个GPU核心配备Neural Accelerator,本地LLM提示处理速度达上一代4.8倍。苹果将其定位为7x24小时常开的本地AI Agent服务器,标配2.5G网口和雷雳5接口。
信息来源:X:阿易 AI Notes (@AYi_AInotes)
模型发布 / 更新普通
MAI-Image-2.6登顶图像编辑榜
Microsoft AI 发布 MAI-Image-2.6-Preview,在 Artificial Analysis 图像编辑排行榜登顶第一,文本生成图像位列第二(仅次于 OpenAI 的 GPT Image 2)。该模型在 19 个分类榜单中拿下 5 个第一,现已在 MAI Playground 和 Microsoft Foundry 私有预览中提供。
信息来源:X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman) · OpenAI / GPT
观点 / 方法普通
不读代码就无法评估模型输出质量
你不能声称"模型已经足够好,我不需要读代码"。因为如果你不读代码,就不可能知道有多少"垃圾"混了进来。我们连线 @0xblacklight 和 @vaibcode 获取独家消息。
信息来源:X:Dex Horthy(HumanLayer)(@dexhorthy)
观点 / 方法普通
HN 头条有多少是 AI 内容?作者两次抽样调查给出答案
一位博主对 Hacker News 头条的 AI 内容占比做了两次抽样调查:2026 年 2 月,每日 Top 5 中多数日子有 4-5 条与 AI 相关;6 月更新数据显示,AI 相关或 AI 生成内容约占每日头条的 50%-60%,高于 2 月的 40%。作者还借助 AI 文本检测工具 Pangram 识别疑似 AI 撰写的文章,并人工复核了标记结果。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新普通
Google 推出 Gemini Enterprise for Legal,自动化合同与法律研究
Google 发布 Gemini Enterprise for Legal,通过 MCP 连接器将 Gemini 模型接入 iManage、DocuSign、Everlaw 等法律系统,可审查合同、开展法律研究并跟踪监管变化,同时遵循现有访问权限。该产品现以预览版提供,隶属新的行业 AI 解决方案系列,Deloitte 等伙伴将销售合同摘要等预置 AI 智能体。
信息来源:The Decoder:AI News(RSS) · Gemini
观点 / 方法普通
MAI-Image-2.6-Preview 登顶图像编辑榜
微软 MAI-Image-2.6-Preview 在 Artificial Analysis 图像编辑排行榜登顶,文本生图位列第二,仅次于 GPT Image 2。该模型于 8 月 10 日发布,支持文生图与图像编辑,在 19 个文本生图分类中拿下 5 个第一。现已上线 MAI Playground 及 Microsoft Foundry 私有预览。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · GPT
观点 / 方法普通
单线程单任务与分类多任务之辨
大家怎么看一个线程只做一个任务,与在一个线程里跑完某一类别的所有任务这两种做法? 你们平时做的是哪种任务?多个并行、长时间横向运行、重复性的,等等。
信息来源:X:Gabriel (@gabriel1)
行业动态普通
Gemini 学生优惠与 Discord 学习工具活动
Gemini 面向符合条件的大学生推出一年免费订阅:美国学生可免费获 Google AI Pro,140 多个国家学生可免费获 Google AI Plus。8 月 28 日周五上午 11:30(太平洋时间)将举办 Discord 活动,介绍学习笔记本、互动测验及新学生中心等学习工具。
信息来源:X:Gemini (@GeminiApp) · Gemini
产品发布 / 更新普通
Keenable AI 发布 AI 原生网络索引与搜索 API
Keenable AI 正式发布,打造 AI 原生的开放网络知识索引,让模型和智能体可查询、推理并持续学习实时网络。其 Web Search API 与 Web Query Language 已上线,9 月底前免费。公司获 Accel 和 Conviction 2600 万美元种子轮融资,团队来自 Yandex Search、Amazon AGI、X 和 Perplexity。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
教程 / 实战普通
如何让 Grok 机器人计划运行更持久:6 个实用技巧
Eric Zakariasson 分享了让 Grok 机器人运行更持久的 6 个技巧:优先使用事件触发而非定时任务,卡住时及时通知人工介入,能用连接器就少用浏览器操作,技能描述需详略得当,编码任务交给云端智能体或 CLI,并及时清理一次性监控任务。这些方法能减少无效运行、提升效率并降低成本。
信息来源:X:Eric Zakariasson (@ericzakariasson) · Grok
观点 / 方法普通
Replit 推出 Free Mode 与 Routines 功能
Replit 中的 Free Mode + Routines(直播深度解析)https://x.com/i/broadcasts/1MJgNbMgNgWGL
信息来源:X:Replit (@Replit)
论文研究精选
Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果
Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
产品发布 / 更新精选
Claude in Chrome 正式全面上线
Anthropic 宣布 Claude in Chrome 现已面向所有付费 Claude 套餐全面开放,Claude 可在浏览器中自主执行操作,无需逐步审批。系统通过安全分类器在每次操作前验证其安全性及是否符合用户请求,并强化了针对提示注入攻击的防御。最新评测显示,在启用探测与安全分类器后,自 Opus 4.8 起的所有模型均未出现攻击成功案例。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法普通
The Case for Cloning Your Coworkers
信息来源:Every:最新文章(网页)
教程 / 实战精选
Warp 如何在 Claude 上构建自我改进的智能体
Warp 在 Claude 平台上构建了基于 Agent Skills 的自我改进循环,通过基础技能与改进技能两个文件型技能,将人类反馈转化为对智能体的持续优化。该模式已应用于其整个开源仓库,覆盖数百名贡献者与数千次代码审查。团队建议以原则而非规则编写技能,并强调低摩擦反馈与改进技能的可复用性。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
GlucoFM:面向连续血糖监测的基础模型
Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。
信息来源:Google Research:Blog(网页)
观点 / 方法普通
微软研究:AI或成重塑文明首工具
我们把当今世界的运作方式视为常态。但事实并非如此。Doug Burger、Amy Luers 与 Ishai Menache 探讨了一个严峻的观点:现代文明是建立在化石燃料与指数增长之上的历史反常现象,而 AI 可能是第一个能够重塑它的工具。https://msft.it/6013azL6Z
信息来源:X:Microsoft Research (@MSFTResearch)
产品发布 / 更新普通
Claude Cowork 内置浏览器上线:Claude 可在桌面应用中自主浏览网页
Anthropic 在 Claude Cowork 桌面应用中为 Claude 新增内置浏览器,可自动导航网页、阅读页面、点击并填写表单,无需扩展或额外设置。该功能本周起向 Pro、Max 和 Team 套餐用户推送,Enterprise 管理员今日起可启用;浏览器与用户自有浏览器隔离,不读取标签页、书签或密码,并沿用与 Claude in Chrome 相同的提示注入防护措施。
信息来源:Claude:Blog(网页) · Claude
观点 / 方法普通
Google Search 升级家居装饰的 5 种方法
Google Search 推出五种家居装饰实用功能:AI Mode 可上传房间照片并生成家具摆放效果图,Lens 支持识别复古单品并查找相似商品,Circle to Search 无需切换应用即可圈选心仪装饰,Search Live 提供 DIY 安装的逐步指导,产品列表可对比价格并追踪降价提醒。近月"home decor inspo"搜索量上涨 300%。
信息来源:Google Blog:AI(RSS)
产品发布 / 更新普通
黄仁勋赠DGX Station,本地运行前沿模型
在DGX Spark上向Jensen展示Portable Computer早期演示时,他慷慨地送了我们一台DGX Station--一台强大的本地计算机,甚至可以运行GLM 5.3这样的前沿模型。无限制的前沿智能即将在你的本地硬件上运行!
信息来源:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas) · GLM
观点 / 方法普通
高盛合伙人谈AI致认知萎缩风险
高盛合伙人 Chris Churchman,负责该行旗舰AI项目之一: AI可能造成"认知萎缩"。银行从业者可能在形成自身判断力之前,就对模型产生依赖。 但事实是,投行初级员工所做的许多工作,恰恰是AI能做得更好的事情。 --- 完整视频见评论 https://x.com/WallStRollup/status/2092032357649862900/video/1
信息来源:X:Rohan Paul (@rohanpaul_ai)
观点 / 方法普通
法国税务部门遭黑客攻击
法国公共财政总局确认遭入侵,67.8万条个人及企业数据泄露,包括姓名、家庭商数、参考税收入及预扣税率。攻击者访问已于6月底被切断但未检测到数据外泄,直至8月12日数据被出售才被发现。同一黑客还声称入侵地籍数据服务器,涉及超200万人,巴黎检察院已立案调查。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新普通
Perplexity 推本地智能体栈 Portable Computer
Perplexity 推出本地优先智能体栈 Portable Computer,运行于 NVIDIA DGX Spark,提供一键本地推理设置与优化的智能体体验。Elvis Saravia 看好本地智能体前景,认为始终在线、本地运行的个性化 AI 智能体存在巨大市场。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · NVIDIA
论文研究普通
MIT 新工具无需历史数据即可预测极端天气
MIT 研究人员开发出名为 Extreme Event Aware(η-learning)的工具,可生成某地区历史记录中从未出现但统计上可能发生的极端天气事件地图,并附带持续时间、强度和影响面积估算。
信息来源:Artificial Intelligence News(RSS)
产品发布 / 更新普通
Cursor 永久上调 Grok 模型用量
我们刚刚提高了 Cursor 中 Grok 模型的包含用量! 随着 Grok 4.6 的发布,需求一直在增长。上个月我们已经通过增加算力将限额翻倍。现在我们再次永久提高限额。 尽情使用吧!
信息来源:X:Lee Robinson (@leerob) · Grok / Cursor
模型发布 / 更新精选
WeatherNext 预测气旋:提前五天预警五级飓风
Google AI 发布 WeatherNext 气旋预测模型,可同时预测风暴路径、强度和规模,比现有系统多提供一整天的预警时间。该模型在 2025 飓风季实战测试中,提前五天预测飓风 Melissa 在牙买加的五级登陆,系美国国家飓风中心首次实时使用 AI 模型。模型单场风暴可生成多达 1000 次模拟,代码与权重已开源。
信息来源:X:Google AI (@GoogleAI)
模型发布 / 更新普通
Qwen3.8-Flash-Next 发布引期待
谁已经等不及了?https://huggingface.co/Qwen/Qwen3.8-Flash-Next
信息来源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue) · Qwen / Hugging Face
行业动态普通
Cohere CEO 参加德国联邦内阁会议谈 AI
很荣幸本周参加德国联邦内阁闭门会议,讨论德国的重点领域,包括如何赋能产业并确保 AI 竞争力。衷心感谢总理 @_FriedrichMerz 的邀请。
信息来源:X:Aidan Gomez(Cohere CEO,@aidangomez)
观点 / 方法普通
AI检测器是知识垄断的守门工具
Rohan Paul 引用 Brian Roemmele 观点:AI 检测器被卖给大学体系,以保护其对知识生产的垄断。AI 让任何人都能生成合格文本,该系统便用"AI 垃圾"标签污名化非官方渠道产出,打压独立研究者和学生。Pantagram 等公司靠出售此服务并炫耀精英履历牟利。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
阿里智能体记忆新法:上下文当编程任务
阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Qwen
观点 / 方法精选
Dylan Patel:Anthropic 与 OpenAI 到 2028 年将控制全球大部分算力
在最新一期播客中,SemiAnalysis 创始人 Dylan Patel 与 Dwarkesh Patel 讨论实验室经济学,预计 Anthropic 和 OpenAI 到 2028 年将控制全球大部分可用 FLOPs,因其能更好变现算力并出价高于其他方。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS) · OpenAI / Claude
产品发布 / 更新普通
OpenAI 首款推理芯片 Jalapeño 性能数据公布
OpenAI 公布首款自研推理芯片 Jalapeño 的实测性能:在基于 GPT-OSS 120B 的公开基准 InferenceX 上,其每千瓦峰值吞吐量更高、token 延迟更低,并在 DeepSeek R1 和 Kimi K2 上表现强劲。AI 参与设计使其从初始设计到流片仅用九个月,计划年底前部署,Gen 2 和 Gen 3 已在开发中。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT / DeepSeek
教程 / 实战普通
如何窃取 AI 模型的私有推理过程
MATS Research、ELLIS Institute Tübingen 与马克斯·普朗克智能系统研究所的团队在 2026 年 8 月测试了 Anthropic、OpenAI 和 Google 提供给客户的加密推理块是否真正保护推理隐私。研究发现这些加密机制存在漏洞,攻击者可能通过特定手段窃取模型的私有推理内容。该研究揭示了当前加密推理方案在隐私保护上的不足。
信息来源:ByteByteGo(RSS) · OpenAI / Claude
观点 / 方法普通
TrueForge 上线一周即爆火引热议
1/ TrueForge 上线不到一周。 它已获得近 4K GitHub 星标、250+ fork、333+ 在线提及,并在 X 上以 2.8K 帖子登上趋势榜。 对于一个 AI 智能体框架来说,这关注度相当高。 但更有趣的是它为何能引起共鸣:
信息来源:X:Kim (@kimmonismus)