AI 情报文章归档
浏览 AI圈报 已保存的 5963 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5963
正式分类6
精选内容3375
全部文章
第 69 / 150 页 · 每页 40 条
产品发布 / 更新精选
Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用
Google Sheets 发布新功能 Sheets canvas,基于 Gemini 构建,用户只需用自然语言提示词即可将表格数据转化为交互式仪表盘、学习追踪器、座位表等"迷你应用"。
信息来源:Google Blog:AI(RSS) · Gemini
行业动态精选
Claude 文本水印机制如何运作
未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 撰写的可能性,这是 Anthropic 为遵守欧盟《AI 法案》而实施的变更。该方法基于 Google DeepMind 的 SynthID-Text 技术,对输出质量、创造力和可读性无实际影响,读者无法区分水印文本与普通文本,且不增加额外 token 或成本。
信息来源:Anthropic:Newsroom(网页) · Claude / Gemini
产品发布 / 更新精选
Qwen3.8-2.4T-A95B 开源,硅基流动即日上线
阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。
信息来源:X:硅基流动 SiliconFlow (@SiliconFlowAI) · Qwen
产品发布 / 更新精选
DeepSeek Harness v0.1 开发者预览版发布
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
信息来源:X:DeepSeek (@deepseek_ai) · DeepSeek
产品发布 / 更新精选
Cursor 推出 builds:云智能体启动速度提升至 3 倍
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
信息来源:Cursor Blog · Cursor
模型发布 / 更新精选
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。
信息来源:DeepSeek:API 更新日志 · DeepSeek
教程 / 实战精选
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
模型发布 / 更新精选
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
信息来源:公众号:小红书技术(dots.llm)
模型发布 / 更新普通
Google DeepMind 正式发布 Gemini 3.7 Flash:官方页标注 GA,上线 App/AI Studio/API/Antigravity
Google DeepMind 8-13 正式发布 Gemini 3.7 Flash,官方模型页状态标注为 General availability,已上线 Gemini 应用、Google AI Studio、Gemini API、Antigravity 及 Gemini Enterprise。定位编程、智能体与知识工作的高性价比 workhorse,支持文本/图像/视频/音频/PDF 多模态,官方称在 Flash 级速度下具备进阶推理;引入期定价至 2026-12-31…
信息来源:AI Insight · Gemini
产品发布 / 更新精选
WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式
WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。
信息来源:公众号:数字生命卡兹克
论文研究精选
新兴多智能体系统的模式与问题
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
观点 / 方法精选
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
信息来源:公众号:数字生命卡兹克 · DeepSeek / Claude / Grok
教程 / 实战精选
AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。
信息来源:GitHub Blog
模型发布 / 更新精选
微软首发自研推理模型MAI-Thinking-1
我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。
信息来源:X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)
模型发布 / 更新精选
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型
MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
信息来源:MiniMax:Blog(网页)
观点 / 方法精选
我写了一本 AI 教科书--AI 还要多久才能写得更好?
作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。
信息来源:Nathan Lambert:Interconnects(RSS) · GPT / Kimi
产品发布 / 更新精选
Meta 开源 Muse Glimmer 登陆 OpenRouter
Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线! 这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。 https://openrouter.ai/meta/muse-glimmer-30b
信息来源:X:OpenRouter (@OpenRouter) · Llama
模型发布 / 更新精选
LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。
信息来源:IT之家(RSS) · NVIDIA
行业动态精选
Research Gold 号称"100%人类撰写、绝不使用AI",实则全程由AI驱动
面向医学研究者的网站 Research Gold 宣称其服务"100%由人类撰写、绝不使用AI",并列出多名博士审稿人。但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称"Sarah"的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
观点 / 方法精选
零基础用户半天上手AI的12步实操流程
文章给出一套零基础用户半天上手AI的12步实操流程:准备内存不低于16G的电脑,订阅ChatGPT并安装Codex或使用WorkBuddy,用语音输入法以【背景、痛点、需求】框架向AI交代任务,经苏格拉底提问澄清需求后投喂文件让AI直接完成,最后沉淀为可复用Skill。文中建议Codex选GPT-5.6 Sol最高模型,WorkBuddy选Kimi K3。
信息来源:公众号:数字生命卡兹克 · ChatGPT / GPT / 豆包
模型发布 / 更新精选
xAI 发布 Grok 4.6,强化长时运行智能体能力
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
信息来源:xAI:News(网页) · GPT / Grok
模型发布 / 更新精选
Cursor 与 SpaceXAI 联合发布 Grok 4.6
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
信息来源:Cursor Blog · GPT / Grok / Cursor
产品发布 / 更新精选
OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
Mojo 1.0 正式发布:为生态系统增长提供稳定基础
Mojo 语言正式发布 1.0 版本,提供稳定、可用于生产环境的语言基础,自 2023 年首次发布以来已发展成通用语言。自开源标准库以来,近 200 名贡献者合入超 1,100 个拉取请求,改动超 200,000 行代码。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
行业动态精选
ChatGPT 与 Gemini 双双突破 10 亿用户
OpenAI 与 Google 的聊天机器人均跨过 10 亿用户门槛。OpenAI 在 8 月 6 日的博文中披露 ChatGPT 月活用户超 10 亿,Google CEO 皮查伊则宣布 Gemini 月活达 10 亿,成为其史上增长最快的产品。OpenAI 称 ChatGPT 在 7 月周活用户已达 10 亿,而 Gemini 在 2 月月活为 7.5 亿,增长势头更猛。
信息来源:The Verge:AI(RSS) · OpenAI / ChatGPT / Gemini
产品发布 / 更新精选
Runway Seedance 2.5 上线,支持50角色参考
完整阵容,完整曲目,一次生成一个。 Seedance 2.5 已在 Runway 上线,支持 50 个独特角色参考,以及最长 30 秒、与音乐同步的片段。点击下方链接即可开始使用。
信息来源:X:Runway (@runwayml)
观点 / 方法精选
将 GitHub Copilot 置于中间人(MitM)代理之后后,我学到了什么
作者通过 mitmproxy 对 VS Code 中的 GitHub Copilot 进行中间人代理拦截,逆向分析其网络流量与内部架构。文章指出这些 AI 应用普遍基于 Electron 构建,共享相似的网络栈,因此探测结果可迁移至其他同类应用。作者借此揭示了 Copilot 的运行时行为,并分享了配置代理的具体步骤。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
ChatGPT 桌面端支持导入其他智能体工作数据
你现在可以将其他智能体的工作内容与 ChatGPT Work 和 Codex 保持同步。 可导入项目、聊天记录、技能和插件,查看导入历史,并可在设置中选择开启自动更新。 现已在 ChatGPT 桌面应用中提供。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI / ChatGPT
行业动态精选
研究人员发现可读取ChatGPT等模型加密推理过程的API漏洞
Alexander Panfilov团队发现OpenAI、Anthropic、Google等主要AI提供商API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话发现62个API密钥、33个邮箱和33个密码。通过越狱,Anthropic的Haiku 4.5可逐字转写Opus 4.8的原始推理;解码10000条推理轨迹的API成本约720美元。
信息来源:The Decoder:AI News(RSS) · OpenAI / ChatGPT / Claude
行业动态精选
Gemini月活破10亿,成谷歌增长最快产品
每月已有超过 10 亿人使用 @Geminiapp 激发新想法、完成工作。这是我们有史以来增长最快的产品,也是第 14 个达到 10 亿用户里程碑的产品。 感谢 @JoshWoodward 和整个 Gemini 团队,也感谢每一位与我们同行的伙伴--未来还有更多精彩!
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
论文研究精选
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力
Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。
信息来源:Google Blog:AI(RSS) · Gemini
论文研究精选
Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11-16 倍的 LLM 推理加速
研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · Llama
观点 / 方法精选
Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能
Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
论文研究精选
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
信息来源:Google Research:Blog(网页) · GPT / Gemini
产品发布 / 更新精选
Claude in Chrome 侧边栏升级为 Claude Cowork 会话
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Gemini 助力 Database Migration Service 加速 PostgreSQL 迁移
Google Cloud 在 Database Migration Service(DMS)中推出由 Gemini 驱动的 AI 辅助代码转换,可将 Oracle 或 SQL Server 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL 代码。
信息来源:Google Cloud:Databases(RSS) · Gemini
行业动态精选
消息称英伟达开发万亿参数开源 AI 模型 Nemotron 4,目标挑战全球顶级
英伟达正在研发新一代开源 AI 模型系列 Nemotron 4,规模最大的模型预计至少拥有 1 万亿个参数,旨在与全球最先进的开源模型竞争。英伟达尚未确定发布日期,最终训练也未完成,员工认为该模型最早可能在今年秋末准备就绪。此举意在通过开放模型生态扩大 AI 应用范围,并推动市场对其 GPU 算力的需求。
信息来源:IT之家(RSS) · NVIDIA
教程 / 实战精选
跨会话传消息后,Codex 和 Claude 如何重构 vibe coding 工作流
Codex 和 Claude 新增跨 Session 传消息功能后,新对话可从之前所有对话中选择可用消息,省去交接文档和 git 备份。作者据此重构工作流:主对话守住目标与决策,分支对话独立探索新想法,完成后由主对话读取完整记录。Codex 通过复制会话 ID 精确寻址,Claude Code 则用内置 session management 搜索对话历史,但桌面端只能搜索当前可访问的会话记录。
信息来源:公众号:卡尔的AI沃茨 · Claude
模型发布 / 更新精选
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · OpenAI / NVIDIA / Hugging Face
论文研究精选
统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。
信息来源:LMSYS:Blog(Chatbot Arena 团队)