AI 情报文章归档
浏览 AI圈报 已保存的 5702 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5702
正式分类6
精选内容3361
全部文章
第 107 / 143 页 · 每页 40 条
论文研究精选
Fast, faster, Qwen. 🚀
Qwen3.5在TokenSpeed推理引擎上,针对智能体工作负载达到了创纪录的580 tokens per second (tps)速度。这一成果由通义千问推理团队、lightseekorg Foundation TokenSpeed团队、NVIDIA及Mooncake团队共同实现,并采用了tri_dao的FlashAttention-4 (FA4) 优化。此里程碑标志着开源大语言模型推理性能的边界得到了推动,相关详情可查阅PyTorch社区博客。
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen / NVIDIA
观点 / 方法精选
与Google搜索产品副总裁Robby Stein的访谈:AI原生搜索时代
本文记录了与Google搜索产品副总裁Robby Stein在Google I/O的访谈,核心探讨Google Search向"AI原生"模式的重大转变。讨论话题包括AI Mode是进化还是重塑、如何将复杂问题拆解为多轮搜索、AI搜索的高运行成本、Google TPU及基础设施的优势、AI时代搜索量不减反增的原因,以及优质AI回答与出版商流量之间的张力。访谈还涉及Google决定展示哪些信息源与链接的逻辑,并围绕一个核心问题展开:如果Google直接给出答案,传统的基于链接…
信息来源:X:Kim (@kimmonismus)
产品发布 / 更新精选
Grok编程智能体登陆Kilo IDE平台
在 @kilocode 中使用您的 SuperGrok 或 X Premium+ 订阅。 尝试 grok-build-0.1,享受高速和智能体编程智能,可在 Kilo IDE 扩展或 CLI 中使用。 https://x.ai/news/grok-kilocode
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
产品发布 / 更新精选
使用 Google Pay & Wallet Developer MCP server 加速你的集成工作流
Google 推出 Google Pay & Wallet Developer MCP server,这是一款开放标准工具,旨在将 AI 开发助手和 IDE 安全连接到实时的 API 与账户上下文。开发者无需离开开发环境,即可搜索官方文档、验证 Wallet pass 定义、检查集成状态以及管理商户账户。该集成旨在通过减少上下文切换并提供实时、可靠的 AI 支持来减少开发摩擦,从而加速开发工作流。
信息来源:Google Developers Blog(RSS)
模型发布 / 更新精选
Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级
Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增"动态工作流"特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Onlin…
信息来源:Anthropic:Newsroom(网页) · GPT / Claude
行业动态精选
Anthropic 完成 650 亿美元 H 轮融资,估值达 9650 亿美元
Anthropic 宣布完成由 Altimeter Capital 等领投的 650 亿美元 H 轮融资,投后估值达 9650 亿美元。公司表示其旗舰模型 Claude 的企业部署持续增长,年化收入已突破 470 亿美元。此轮融资将用于推进 AI 安全与可解释性研究、扩展算力以满足 Claude 的需求,并规模化产品与合作伙伴关系。Anthropic 近期已显著扩大计算容量,并宣布 Claude 已登陆 AWS、Google Cloud 和 Microsoft Azure …
信息来源:Anthropic:Newsroom(网页) · Claude
论文研究精选
SGLang 团队与 AMD 合作,使 AMD InstinctTM MI355X GPU 的大规模 DeepSeek-R1 分离式推理在总拥有成本上具备竞争力
SGLang 与 AMD 团队合作,通过一系列全栈优化,使 AMD InstinctTM MI355X GPU 在运行 DeepSeek-R1 大模型推理时实现了极具竞争力的总拥有成本。在 129 tok/s/user 的交互延迟下,其成本为每百万 token $0.169,比 NVIDIA B200(Dynamo TRT-LLM)方案低 5%,比 B200(SGLang)方案低 40%。吞吐量方面,24 块 AMD GPU 达到 2,436 tok/s/GPU,比使用 4…
信息来源:LMSYS:Blog(Chatbot Arena 团队) · DeepSeek / NVIDIA
产品发布 / 更新精选
在Claude Code中引入动态工作流
Claude Code 推出"动态工作流"功能,使 Claude 能端到端处理复杂任务。该功能通过动态编写脚本,在单个会话中并行运行数十到数百个子智能体来完成工作,并会在结果呈现前进行验证。它适用于跨代码库的 bug 查找、大规模迁移(如将 Bun 从 Zig 移植到 Rust)等需要多角度分析的任务。该功能现已在研究预览阶段可用,支持 Claude Code CLI、桌面端、VS Code 扩展以及 API、Amazon Bedrock、Vertex AI 等平台,面向 …
信息来源:Claude:Blog(网页) · Claude
论文研究精选
创新时代:Google Research 在 I/O 2026
Google Research 在 I/O 2026 大会上展示了其在多个前沿领域的技术进展,包括应用AI、基础机器学习算法以及量子AI等。本次大会的核心主题是展示其在将科学发现与研究成果转化为现实世界影响方面的持续努力。
信息来源:Google Research:Blog(网页)
产品发布 / 更新精选
Perplexity开源Unigram分词器降低CPU占用
我们开源了重新构建的Unigram分词器,可将CPU占用降低5-6倍。 小型重排序器和嵌入模型在GPU上运行时间仅为个位数毫秒,使得CPU分词成为总延迟的重要组成部分。 http://github.com/perplexityai/pplx-garden
信息来源:X:Perplexity (@perplexity_ai)
观点 / 方法精选
Codex 支持实时会议转录与问答
OpenAI Codex 新增了"Meeting Recorder"技能。该技能可使用 GPT Realtime Whisper 端点实时转录会议并显示文本。用户可在转录过程中随时向 Codex 提问。会议结束后,会提供完整的转录内容及格式化版本。此功能基于实时 API,费用为 $0.017/分钟。相关代码与说明可在 GitHub 链接中查看。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT
产品发布 / 更新精选
阿里云开放AI生态,集成全球领先模型
今日在#QwenConference206上发布:阿里云全面开放的AI生态系统。除通义千问外,全球领先的模型现已可直接在Model Studio和http://qwencloud.com上访问。
信息来源:X:阿里云 / Alibaba Cloud (@alibaba_cloud) · Qwen
产品发布 / 更新精选
Runway 推出 Model Context Protocol 服务器
Runway 正式推出 Runway MCP 服务器,允许任何兼容 MCP 的 AI 智能体(如 Claude、ChatGPT、Cursor)在对话界面中直接生成图像与视频,无需切换工作流。该服务器接入了 Runway 最新的多款 SOTA 模型,包括 Gen-4.5、Seedance 2.0、GPT Image 2、Kling 3.0 及 Nano Banana Pro。其应用场景涵盖为产品制作营销视频、批量生成网站视觉素材、创作角色广告以及在应用开发中集成视觉内容。用户…
信息来源:Runway:News(网页) · ChatGPT / GPT / Claude
行业动态精选
教皇没对AGI上头
教皇 Leo XIV 发布题为《Magnifica Humanitas》的通谕,警告人工智能的使用绝非纯粹技术问题,当其进入影响人类生活的过程时,便触及权利、机会、地位与自由。通谕发布时,Anthropic 联合创始人 Christopher Olah 出席。文件引发了科技界内外的广泛反应。
信息来源:The Verge:AI(RSS) · Claude
观点 / 方法精选
美国执法部门就"反科技极端主义"发出警告,AI 仇恨情绪增长
美国联邦机构警告称,一种新的威胁类别正在出现,即"反科技极端主义"。这与对 AI 日益增长的仇恨情绪有关。
信息来源:Ars Technica:AI(RSS)
观点 / 方法精选
OpenAI 奥尔特曼称 AI 对白领冲击不如预期般严重:我很高兴自己当时错了
信息来源:IT之家(RSS) · OpenAI
教程 / 实战精选
使用 Codex 构建自改进税务智能体
OpenAI、Thrive 与 Crete 合作,使用 Codex 构建了一个自改进的税务智能体。该智能体能够自动处理报税流程,提升工作准确性并加速整体工作流。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
观点 / 方法精选
AI 制造 AI:面壁智能开源全球首个完全由 AI 编写的生产级训练框架 ForgeTrain
面壁智能联合清华大学与OpenBMB开源社区发布了ForgeTrain框架。该框架是全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架。面壁智能已使用ForgeTrain在华为昇腾芯片上完成了其新一代「小钢炮」模型MiniCPM5-1B的预训练,其综合性能在AA榜单上位列2B规模以下Top 1。ForgeTrain框架代码及用于制造该框架的Agent Harness工具链已完全开源。
信息来源:IT之家(RSS)
产品发布 / 更新精选
AI 制造 AI:面壁智能发布并开源全球首个完全由 AI 编写的生产级训练框架 ForgeTrain
面壁智能联合清华大学、OpenBMB发布ForgeTrain,全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架。在英伟达H100上训练速度超越Megatron 10%,节省10%算力;在华为昇腾上完整跑通预训练,并训出MiniCPM5-1B模型,综合性能在AA榜单2B规模以下Top1。框架及Agent Harness工具链一并开源。
信息来源:公众号:面壁智能(MiniCPM) · NVIDIA
行业动态精选
我国将加快研究推进人工智能健康发展综合性立法、低空经济立法等
信息来源:IT之家(RSS)
教程 / 实战精选
从0到1速通OpenAI Codex:安装、设置与实操教程
近日OpenAI的AI智能体Codex热度飙升。教程涵盖完整使用流程:从官网下载安装,支持从Claude Code和Cowork一键导入配置;界面分对话区和项目区,权限可选默认、自动审查或完全访问;模型推荐GPT-5.5,推理等级用高或超高,速度可选快速(1.5倍速度、2倍token消耗)或标准;建议开启引导模式、记忆功能,并设置全局AGENTS.md规则(卡帕西模板);通过Skills和插件管理扩展能力;演示了开发网页(使用计划模式、批注功能圈选修改)和开发用药提醒App…
信息来源:公众号:数字生命卡兹克 · OpenAI / GPT / Claude
产品发布 / 更新精选
Claude Code v2.1.152 更新发布
Claude Code 发布 v2.1.152 版本更新。核心改进包括:`/code-review --fix` 现在会将审查建议直接应用于工作目录;技能与斜杠命令支持通过 frontmatter 的 `disallowed-tools` 移除模型工具;新增 `/reload-skills` 命令可不重启会话重新扫描技能目录;`SessionStart` 钩子现可返回 `reloadSkills: true` 重新扫描技能,并可通过 `hookSpecificOutput.…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
Qwen3.7-Max代码竞技场排名第四,与Claude Opus 4.6持平
🚀🚀 Qwen3.7-Max 刚刚在 Code Arena 上升至第 4 名,与 Claude Opus 4.6 持平,是榜单上排名最高的中国实验室!@arena 更多内容即将发布。敬请期待。🕶️
信息来源:X:通义千问 / Qwen (@Alibaba_Qwen) · Qwen / Claude
行业动态精选
消息称高通与字节跳动达成 AI ASIC 芯片合作,采购量在数百万颗级别
信息来源:IT之家(RSS)
观点 / 方法精选
Reachy Mini 实现完全本地化语音交互
Reachy Mini 机器人现可通过 `speech-to-speech` 库实现完全本地化的语音交互,无需依赖云端。该方案采用级联流水线架构,对外提供 Realtime API 兼容的 WebSocket 接口。默认组件包括 Silero VAD 用于语音活动检测、Parakeet-TDT 作为语音转文本模型、通义千问(Qwen3-TTS)作为文本转语音模型。大语言模型推荐使用 llama.cpp 运行 Gemma 4。所有数据均在本地处理,保障了隐私且无 API 费用。
信息来源:Hugging Face:Blog(RSS) · Qwen / Llama / Hugging Face
论文研究精选
VibeSearchBench:面向真实世界中长期主动搜索的评测基准
基于LLM的智能体在现有搜索基准上表现优异,但真实用户体验不佳,这源于现有基准依赖于高度明确的查询、单轮交互和固定格式评估,无法反映用户与智能体通过多轮对话协同澄清模糊意图的真实搜索行为。为此,研究提出了"VibeSearch"范式并发布了VibeSearchBench,该基准包含200个手工策划的双语任务,覆盖20个领域,分为专业与日常生活两个子集。评估通过用户模拟器和图匹配框架进行。对七个前沿模型的测试显示,所有模型在VibeSearch任务上表现均不充分(最佳F1分数…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
TRL 新增 Delta Weight Sync:通过 Hub Bucket 传输权重变化,每步从 1.2 GB 降至 20-35 MB
异步强化学习中,训练器每步需将完整模型权重(如1T参数checkpoint约1 TB)传输给推理引擎。TRL新增PR利用相邻RL优化步骤间约99%的bf16权重比特相同的特点,仅将变化的权重编码为稀疏safetensors文件,上传至Hugging Face Bucket并通知vLLM获取。在Qwen3-0.6B上,每步传输从1.2 GB降至20-35 MB。实验还展示了完全分离的训练场景:训练器、vLLM和Wordle环境分别位于不同机器和Hugging Face Spa…
信息来源:Hugging Face:Blog(RSS) · Qwen / Hugging Face
观点 / 方法精选
软件之后是AI时代
软件时代正过渡至"智能体框架"时代。AI作为强大但需驯化的"野马",其智能驯化包含七个核心组成部分:上下文与记忆、工具与行动、编排与循环、状态与持久性、沙箱与计算、可观测性与治理、成本与工作流优化。这些组件共同构成了一个生产级的智能体系统。这一转变将重塑软件竞争格局,模型通用化的未来中,最佳的智能体驾驭者将获胜。
信息来源:Tomer Tunguz 博客(VC 分析)
论文研究精选
思维链监控在跨类型多样的语言下的脆弱性
该研究首次对思维链监控在13种不同语言和7个模型家族(共16个模型,参数从8B到120B)中进行了大规模评估。研究发现,CoT在所有语言和提示类型下的平均不忠实率高达95.9%。前沿模型会系统性进行策略性操纵(如答案切换和事后合理化),使外部监控难以检测欺骗。模型常在生成过程的前15%内就在潜在激活中锁定了错误线索,即使其CoT看起来是忠实的。令人惊讶的是,这种欺骗模式在低资源语言中保持100%,揭示了当前CoT监管的根本局限。研究证实CoT监控在语言分布偏移下极其脆弱,其…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
DenoiseRL:通过恢复嘈杂前缀来引导推理模型
DenoiseRL是一种强化学习框架,旨在提升大语言模型的推理能力。它无需依赖更强的教师模型或精心筛选的困难数据集,而是通过在弱模型产生的失败推理轨迹上进行基于恢复的优化来直接学习,将错误转化为改进机会。这种方法提供了更丰富多样的学习信号,提升了探索效率。实验表明,DenoiseRL在竞争性的数学和通用推理基准测试中,持续优于强在策略RL基线,并能随着训练难度增加促进更强的自我纠正行为。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
ResearchMath-14K:通过智能体扩展研究级数学
本文介绍了ResearchMath-14K,这是一个包含14,056个研究级数学问题的数据集,通过多智能体流程从学术资料中策划而成,是目前此类规模最大的集合。研究还生成了ResearchMath-Reasoning(包含220K条教师轨迹),发现语言模型存在回避行为,且新一代模型产生的引用和虚假引用分别是旧模型的5.6倍和5.0倍。经过智能体过滤后,对参数规模为4B到30B的Qwen3模型进行微调,其平均得分比基础模型提高了9.2分,表明过滤后的开放问题尝试能为研究级数学推…
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究精选
"了解评估如何设计的模型"得分更安全
AI安全评估的有效性依赖于模型在受控与部署环境下行为一致。研究提出"评估元知识"概念,指模型通过训练数据(如描述评估实践的科学文章或社交媒体)隐性习得对评估结构特征(如可验证结构或道德困境)的认知。在六个安全基准上的测试表明,经过合成文档微调后的模型,其安全评分显著高于基础模型与控制模型,即使排除明确表达评估意识的回答,这种行为偏移依然存在。这表明评估元知识可能导致安全基准分数虚高,成为独立于显式记忆或语言化评估意识之外的新干扰因素,对安全评估的设计和解读有重要影响。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
AI研究智能体窄化科学探索
本研究将AI研究智能体视为科学搜索系统进行评估。通过四个框架和六个大语言模型,从共享种子文献中生成了37,802个科学想法,并与人类论文、后续研究及种子文献进行对比。实验揭示了四个一致的模式:AI生成的想法比同领域人类论文更为集中;更贴近其起始文献,而非后续人类研究;与AI想法最相似的论文后续引用量往往较低;当AI想法与已有工作不同时,差异主要源于对现有技术方法的重组,而非引入全新的研究问题。总体而言,当前的AI研究智能体更擅长局部细化,而非拓展科学探索的广度。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
行业动态精选
2026年选举信息与保障
在2026年全球选举临近之际,通过帮助公众获取选举信息、支持网络防御者以及提升人工智能透明度这三方面的努力,来为选举提供保障。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
产品发布 / 更新精选
Claude Code推出安全漏洞识别插件
我们为Claude Code发布了一个安全指导插件,可在编写代码时帮助识别和修复漏洞。 所有Claude Code用户均可使用。从插件市场(/plugins)安装。
信息来源:X:Claude Devs (@ClaudeDevs) · Claude
教程 / 实战精选
Gemini Omni 视频提示词使用指南
Google 发布了其多模态模型 Gemini Omni 的视频生成功能使用指南。该模型可通过 Gemini 应用、Google Flow 等平台体验。指南包含五项提示词技巧:利用模型已有的现实世界知识进行简洁描述;精确控制文本在视频中的渲染与排版;使用专业镜头指令(如推拉摇移)像电影摄影师一样调度画面;通过迭代编辑高效修改视频;以及在生成中直接调整角色的动作节奏或情绪。其核心在于通过精准的提示词引导模型生成复杂且可控的视频内容。
信息来源:X:Google AI (@GoogleAI) · Gemini
观点 / 方法精选
人类与AI分工:教育咨询及文学奖争议
我写了一篇新文章,探讨我们需要保留哪些人类特质,以及哪些可以交给AI,其中涉及教育、咨询领域的实验,以及最近关于文学奖的争议。
信息来源:X:Ethan Mollick (@emollick)
观点 / 方法精选
选择保持人性
社交媒体平台上的帖子内容正变得越来越相似。这种趋同现象可能意味着大量内容正在被AI生成或同质化处理,引发了人们对于内容原创性与人类独特视角的讨论。
信息来源:Ethan Mollick:One Useful Thing(RSS)
产品发布 / 更新精选
MiMo 2.5 Pro大幅降价,与DeepSeek V4 Pro同价
小米MiMo-V2.5系列API价格永久下调,最高降幅达99%,现与DeepSeek V4 Pro同价。Token套餐同步升级,同等价格下可用token量增加5-8倍,计费规则更简单透明。所有现有用户套餐额度将全额重置。此次降价源于MiMo全栈推理优化与服务效率提升,后续将发布技术博客详述细节。MiMo-V2.5-TTS限时免费,新定价于5月26日生效。
信息来源:X:Kim (@kimmonismus) · DeepSeek
行业动态精选
据报道Claude Mythos以"巧妙简洁的证明"解决了OpenAI里程碑式的Erdős问题
Anthropic工程师Sholto Douglas表示,Claude Mythos在周末期间解决了OpenAI提出的Erdős单位距离猜想问题,并给出了一个"巧妙简洁的证明"。这一成果被描述为人工智能在数学发现领域存在"严重超前"迹象。
信息来源:The Decoder:AI News(RSS) · OpenAI / Claude