AI 情报文章归档
浏览 AI圈报 已保存的 5963 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5963
正式分类6
精选内容3375
全部文章
第 67 / 150 页 · 每页 40 条
观点 / 方法普通
编程是否已解决?Lauren Tan:远未完成
Lauren Tan 认为,若编程仅指敲代码,AI 智能体确实已解决;但编程本质是用代码解决问题,智能体缺乏约束反而制造更多问题。她强调人类工程师仍需主导方向,智能体降低了工程门槛,英语正成为新的编程语言。
信息来源:X:Lauren Tan (@poteto)
行业动态精选
第二届世界人形机器人运动会开幕:2056 台机器人齐聚"冰丝带",666 支队伍竞技 51 赛项
第二届世界人形机器人运动会今晚在国家速滑馆"冰丝带"开幕,666 支队伍、2056 台机器人参赛,队伍数量较首届增长 138%,机器人数量翻了两番。天工 Ultra 在百米预赛跑出 9.39 秒,打破博尔特 9.58 秒的人类世界纪录;荣耀"闪电"以 41.95 秒完成 400 米,同样破人类纪录。本届赛项增至 51 项,多项竞技赛取消人工遥控,全程全自主运行。
信息来源:IT之家(RSS)
观点 / 方法普通
Current Robotics,人形智能始于人|绿洲生命力
信息来源:elsewhere:文章(RSS)
产品发布 / 更新精选
蚂蚁百灵为SGLang推出权重缓存守护进程
今天,我们为 SGLang 推出 Weight Cache Daemon。🚀 在 Ling-2.6-1T FP8 上,它将权重加载时间缩短至约 0.63 秒,比磁盘加载快约 780 倍,并将引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟。其工作原理如下。
信息来源:X:蚂蚁百灵 (@AntLingAGI)
教程 / 实战精选
AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期
Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型
面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。
信息来源:X:面壁智能 OpenBMB (@OpenBMB)
论文研究精选
每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究
一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp
DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Opus-4.8。该模型通过 API 提供,图片按 token 计费,一张最多占 384 tokens,价格与 V4-Flash 一致。同期上线的 Files API 免费,支持图片上传后通过 file_id 复用。
信息来源:公众号:DeepSeek(深度求索) · DeepSeek
模型发布 / 更新普通
DeepSeek 上线 V4-Flash-Vision-Exp 实验性多模态 API,同步推出 Files API
DeepSeek 8-21 宣布 DeepSeek-V4-Flash-Vision-Exp 已在 API 平台可用:这是可接图的实验性多模态模型,文本能力对齐 V4-Flash,用模型名 deepseek-v4-flash-vision-exp 调用,图片可用 base64、外部 URL 或 Files API 传入。同一更新上线 Files API(一次上传后按 file_id 复用)及 DeepSeek Harness 配套更新。官方 changelog 标为 expe…
信息来源:AI Insight · DeepSeek
论文研究普通
NVIDIA 发布 AVO 在 ARC-AGI-3 公开集评测:183 关满分,非新模型权重
NVIDIA 技术博客 8-21 发布内部长程自主编码 agent 架构 AVO(Agentic Variation Operators)在交互推理基准 ARC-AGI-3 公开集上的评测:在全部 25 个环境、183 个关卡上取得 100 RHAE 满分,AVO 内部使用 Claude Opus 5 作为模型。博文明确不覆盖半私有与私有竞赛集,也不是新模型或权重发布;此前 AVO 主要用于 GPU kernel 优化。
信息来源:AI Insight · Claude / NVIDIA
产品发布 / 更新普通
SpaceXAI Grok 4.6 登陆 Google Cloud Vertex AI:继 Bedrock 后又一云渠道
SpaceXAI 8-21 宣布 Grok 4.6 已在 Google Cloud Vertex AI 与 Vertex Model Garden 上线,开发者可调用。这是该模型继 Amazon Bedrock 之后又一云平台正式落地,并非新权重发布;官方 x.ai 页与 Google 侧均可核实。
信息来源:AI Insight · Grok
产品发布 / 更新普通
Anthropic:Claude Security 代码扫描由 Claude Mythos 5 驱动,Enterprise 公开测试
Anthropic 8-21 宣布,Claude Enterprise 客户可在公开测试中用 Claude Security 以 Claude Mythos 5 扫描代码仓库;模型在后台运行,仅返回带 CWE 分类、置信度与严重度评级及建议补丁的发现,每个补丁须经人工审核后方可实施。同一发布设立 3500 万美元 Defender Advantage Fund 支持开源安全。合作伙伴集成与 Cyber Verification Program 扩面仍属后续计划。
信息来源:AI Insight · Claude
观点 / 方法精选
都Agent时代了,我还是想分享给你这12个我最常用的Prompt
作者整理出12个最常用的Prompt,按问清问题、学习、解决问题、决策、认识自己5个场景分类,全部可单独复制使用且无需安装任何Skill。每个Prompt都配有可直接套用的模板,将【】内内容替换为个人信息即可,适配当前所有主流AI。
信息来源:公众号:数字生命卡兹克
论文研究精选
测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
本地AI模型已能胜任89%日常查询,数据中心将走向个人化
斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。
信息来源:Tomer Tunguz 博客(VC 分析)
模型发布 / 更新精选
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
信息来源:Hugging Face:Blog(RSS) · Llama / Hugging Face
论文研究精选
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%
蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
信息来源:LMSYS:Blog(Chatbot Arena 团队)
产品发布 / 更新精选
Claude Mythos 5 网络安全能力扩展至更多防御者
Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量
AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。
信息来源:Google Cloud:Databases(RSS)
教程 / 实战精选
Claude Code 初创公司指南:五大规则与创始人洞见
Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出"人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化"五大规则。
信息来源:Claude:Blog(网页) · Claude
模型发布 / 更新精选
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
信息来源:IT之家(RSS) · Qwen
产品发布 / 更新普通
Anthropic 将 Computer Use、Browser Use、Skills API、Files API 上线正式版
Anthropic 8-20 宣布 Computer Use、新增 Browser Use 工具、Skills API 与 Files API 在 Claude 平台正式一般可用。Computer Use 支持单轮多动作(点击、输入、截屏等);Browser Use 基于页面结构而非仅像素坐标定位网页元素;Skills API 支持上传与版本化技能;Files API 支持一次上传按 file_id 复用并可设过期。Vertex AI 上的对应更新仍为 coming soo…
信息来源:AI Insight · Claude
模型发布 / 更新精选
Ling-3.0 tiny & flash Base Models 正式开源
蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。
信息来源:公众号:蚂蚁百灵(Ling)
产品发布 / 更新精选
MiniMax Design 发布:从操作像素到操作语义和表达意图
MiniMax 推出 MiniMax Design,一款将多模态模型能力转化为生产力的 Harness,可理解目标、拆解任务并调用模型与 Skills,完成从素材处理到最终交付的完整流程。该产品围绕原生多模态视频模型 H3 构建,擅长处理目标明确的商业内容任务,并提供 Agent 3D 导演台、自动剪辑与字幕功能,支持接入 ComfyUI 等开源生态工作流。
信息来源:公众号:MiniMax(稀宇科技)
行业动态精选
消息称 OpenAI 首席财务官告知员工:公司最迟将于 2027 年上市
OpenAI 首席财务官萨拉·弗里亚尔在全员大会上告知员工,公司最迟将于 2027 年完成上市,若业务持续向好也可能更早。OpenAI 已于 6 月秘密提交 IPO 招股书,本季度整体年化营收增长 35%,企业级业务年化营收增长 50%,AI 编程与办公产品周活跃用户突破 2000 万。
信息来源:IT之家(RSS) · OpenAI
产品发布 / 更新精选
FastMetal 让 Mac 本地 30 秒生成视频
一段 5 秒 480P 视频,完全在 Mac 上生成,耗时 30 秒。无需 CUDA,无需云端,仅占用 3.9 GiB 内存。 FastMetal 将 FastWan-QAD 系列带到 Apple Silicon。DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8。 三个模型:1.3B 支持 480P,5B 支持 720P,14B 追求画质。 📷 博客:http://haoailab.com/blogs/fastmetal 📷 代码:h…
信息来源:X:Sky Computing Lab (@haoailab) · Hugging Face
产品发布 / 更新精选
Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。
信息来源:Mistral AI:News(网页) · Mistral
产品发布 / 更新精选
Claude Platform 正式上线 Computer Use、Skills API 与 Files API,新增浏览器操作工具
Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 全面可用,并新增浏览器操作工具,让智能体可操作软件、调用团队技能并返回成品文件。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Anthropic 如何开展 AI 教学
Anthropic 发布 Claude Academy,为全球数百万用户提供 AI 教学资源,帮助其安全、有效地使用 AI。该学院课程借鉴其内部员工培训方法,包括 4D AI Fluency Framework 及"ever-boarding"持续学习项目,并强调以问题为中心、培养持久思维模式而非特定操作行为。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
百度千帆上架GLM-5.3
百度千帆今日上架智谱开源旗舰模型GLM-5.3,API定价与智谱官方保持一致。该模型与上代同架构、同参数,依靠后训练Scaling在代码与网络安全能力上表现超预期,AA综合智能指数取得60分,与Kimi K3并列开源模型第一。开发者可通过API调用或订阅Token Plan企业版接入Claude Code等AI工具使用。
信息来源:公众号:百度智能云(文心) · Claude / GLM / Kimi
模型发布 / 更新精选
Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失
Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
产品发布 / 更新普通
SpaceXAI Grok 4.6 在 Amazon Bedrock 一般可用:云渠道落地,非新权重
SpaceXAI/xAI 旗舰模型 Grok 4.6(本体 8-12 发布)于 8-19 在 Amazon Bedrock 对支持区域一般可用,开发者可在 Bedrock 直接调用。这是云平台渠道落地,并非新模型或新权重发布;官方 x.ai 页与 AWS what-new 页均确认。
信息来源:AI Insight · Grok
产品发布 / 更新精选
GLM-5.3上线:AA智能指数60分并列开源第一,成本更低
GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。
信息来源:公众号:智谱(GLM) · GPT / Claude / GLM
行业动态精选
OpenRouter 宣布加入 Stripe
OpenRouter 宣布与 Stripe 合并,以加速推动全球经济增长。OpenRouter 目前每日处理来自 400 多个 AI 模型的 10+ 万亿 token,服务超 1000 万开发者与公司,自成立以来推理量每年至少增长 10 倍。合并后 OpenRouter 将继续以原名、原使命独立运营,产品与路线图不变,路由决策仍以用户利益为先,交易预计在未来数周内完成。
信息来源:OpenRouter:Announcements(RSS)
产品发布 / 更新精选
Grok Build 全面上线网页与移动端,所有套餐可用
Grok Build 现已面向所有套餐开放,支持网页、iOS 和 Android 端使用。用户描述应用、游戏或网站后,Grok 可在聊天中实时生成可运行版本。该功能自 7 月推出 Early Beta 以来,新增了发布分享、接入 X 及调用 Grok 自身模型等能力,发布的应用可获得 grok.me 链接并支持自定义域名、导出到 GitHub 等。
信息来源:xAI:News(网页) · Grok
产品发布 / 更新精选
Mojo 语言正式开源,编译器与工具链全面开放
Mojo🔥 语言现已正式开源,采用 Apache 2.0 许可证(含 LLVM 例外),编译器、工具链及全部源码已发布至 modular GitHub 仓库。Mojo 上周刚达成 1.0 版本(源码稳定),此次开源涵盖整个编译器与工具链。目前暂不接受编译器相关贡献,计划年底前开放,标准库自 2024 年起已接受社区贡献。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
Claude 现已支持 Gmail 邮件与 Google Drive 文件管理
Claude 现在可以在 Gmail 中发送邮件,并管理 Google Drive 中的文件。 让 Claude 回复某个邮件线程,它会起草并发送回复。你可以控制何时需要你的批准。 从连接器菜单中选择连接 Gmail 或 Google Drive 即可试用。所有付费套餐均可用。
信息来源:X:Claude (@claudeai) · Claude
论文研究精选
智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准
智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。
信息来源:Hugging Face:Blog(RSS) · GPT / DeepSeek / Hugging Face
论文研究精选
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法
LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · DeepSeek / NVIDIA
观点 / 方法精选
OpenAI 在"关键网络能力"时代放缓模型开发节奏
OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的"关键网络安全能力"阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / Hugging Face