AI 情报文章归档
浏览 AI圈报 已保存的 5930 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5930
正式分类6
精选内容3375
全部文章
第 74 / 149 页 · 每页 40 条
模型发布 / 更新精选
Inkling-Small 发布,276B 参数性能持平原版
今天,我们发布 Inkling-Small。 Inkling-Small 在仅为 Inkling 四分之一规模的情况下,实现了与之相当的性能。它拥有 276B 总参数,12B 激活参数。我们将开放完整权重。 https://thinkingmachines.ai/news/inkling-small/ 现在即可在 Tinker 上对其进行微调,或在 Tinker Playground 中以文本、图像和音频形式与之对话。
信息来源:X:Thinking Machines (@thinkymachines)
产品发布 / 更新精选
OpenRouter 下调 GPT-5.6 Terra/Luna 价格
GPT-5.6 Terra 和 Luna 刚刚获得了 @OpenAI 的降价。 OpenRouter 的价格仍然更低。我们的 50% 独家折扣在此基础上适用,使 Luna 输入降至 $0.1/M、输出降至 $0.6/M,Terra 输入降至 $1/M、输出降至 $6/M。 使用 luna 扩展你的工作负载:https://openrouter.ai/openai/gpt-5.6-luna
信息来源:X:OpenRouter (@OpenRouter) · OpenAI / GPT
产品发布 / 更新精选
GitHub Copilot 应用新增堆叠会话与拉取请求功能
GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。
信息来源:GitHub Blog
产品发布 / 更新精选
Perplexity Computer 推出 Projects 功能
在 Perplexity Computer 上推出 Projects。 随着 Projects 的发布,我们正将 Computer 转变为一个多智能体协作操作系统,用于工作,具备持久化内存、文件以及跨中心和用户的会话范围。 现已向所有用户开放!
信息来源:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)
模型发布 / 更新精选
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑
字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。
信息来源:字节 Seed:Research Feed(网页内嵌数据) · 豆包
行业动态精选
RadixArk 与 Google Cloud 合作,将完整 SGLang 功能引入 TPU
RadixArk 与 Google Cloud 合作,将开源推理框架 SGLang 引入 Google TPU,开发者可通过 SGL-JAX 在最新 TPU 上运行 Gemma、Qwen、DeepSeek 等大语言模型及多模态模型。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · DeepSeek / Qwen
产品发布 / 更新精选
llm-chat-completions-server 0.1a0 发布
Simon Willison 发布 llm-chat-completions-server 0.1a0 插件,可在本地 9001 端口启动一个兼容 OpenAI Chat Completions API 的服务器,暴露 LLM 工具中所有已安装的模型。
信息来源:Simon Willison 博客 · OpenAI
模型发布 / 更新精选
Google DeepMind 发布 Gemini Robotics 2 物理 AI
One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
模型发布 / 更新精选
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
信息来源:Google DeepMind:Blog(RSS) · Gemini
行业动态精选
FCC 禁止进口中国新型机器人与联网逆变器
美国 FCC 自 7 月 28 日起禁止进口中国新型"先进机器人设备"和联网电源逆变器,理由包括防止供应链中断、数据窃取和网络攻击。禁令覆盖几乎所有重量超 2 公斤、具备无线连接和感知能力的软件控制地面机器人,但已上市型号不受影响。
信息来源:The Decoder:AI News(RSS)
观点 / 方法精选
实测 ego lite:给 Codex 浏览器自动化加到 2.5 倍速
开源浏览器自动化项目 ego lite(5.9k star)实测:基于 Chromium 内核定制的独立浏览器,让人和 Agent 共享同一浏览器但各自独立 Space 工作,支持迁移 Chrome 登录态。
信息来源:公众号:卡尔的AI沃茨
模型发布 / 更新精选
GPT-5.6 如何推进性价比前沿
OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
产品发布 / 更新精选
Token Saver:用本地混合 RAG 将 Claude PDF token 消耗削减 92%-99% 的开源 MCP 扩展
Marktechpost AI 团队发布 Token Saver,一款面向 Claude Desktop 的开源 MCP 扩展,通过本地混合 RAG 在设备端检索 PDF,无需上传文件。该工具将 token 消耗削减 92%-99%,并保证数据隐私,设置无需 Python 环境或终端配置。
信息来源:MarkTechPost(RSS) · Claude
产品发布 / 更新精选
WorkBuddy 深度打通腾讯文档,打造 Agent 时代的第三代办公协同
WorkBuddy 新版本深度打通腾讯文档,支持在侧边栏直接编辑生成的文件,并将腾讯文档嵌入工作流,实现人与 AI、同事及各自 Agent 间的协同。用户可选用 DeepSeek V4 Pro、Kimi K3 等模型处理文档,并将文件上传至云端分享流转。作者认为,这种"人、Agent 与共享状态"的协作模式,标志着第三代办公产品的到来。
信息来源:公众号:数字生命卡兹克 · DeepSeek / Kimi
教程 / 实战精选
OpenAI 总裁布罗克曼承认新版 ChatGPT 桌面应用"有点乱",目标年底实现"零标签"
OpenAI 联合创始人兼总裁格雷格·布罗克曼承认,合并 Codex 后的新版 ChatGPT 桌面应用界面"有点乱",导致部分用户难以找到聊天记录。他透露,到 2026 年年底,ChatGPT 桌面应用将不再有 Work 标签页,功能会融入 ChatGPT。整合后,Codex 用户数在几天内从 500 万增至 1000 万。
信息来源:IT之家(RSS) · OpenAI / ChatGPT
论文研究精选
腾讯混元Hyra破解50年数学难题
腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。
信息来源:X:腾讯混元 (@TencentHunyuan)
论文研究精选
PhiZero:围绕"物理语言"构建的世界模型
PhiZero 是一种基于"物理语言"的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
大语言模型的显著性偏差:常识推理中的知识压制而非缺失
研究提出"显著性偏差"概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。
信息来源:HuggingFace Daily Papers(社区热门论文) · GLM / Kimi / Hugging Face
论文研究精选
BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究
一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
删除回避:LLM 代码编辑中的系统性缺陷与缓解之道
研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测
OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
观点 / 方法精选
AWS 通往万亿美元营收之路
AWS 本季度年化营收达 1690 亿美元,同比增长 36.7%,为 18 个季度最快增速,且连续第五个季度加速。Andy Jassy 称 AWS 有潜力成为"1 万亿美元营收业务",并将 2026 年资本开支计划从 2000 亿美元上调至 2200 亿美元。但 AWS 积压订单仅 4960 亿美元,落后于微软的 6780 亿美元,且自由现金流已转为负 76 亿美元。
信息来源:Tomer Tunguz 博客(VC 分析)
观点 / 方法精选
揭秘 AI 智能体入侵 Hugging Face 全过程:4 天半执行 17600 次操作
一套基于 OpenAI 模型的自主 AI 智能体在 4 天半内执行约 17600 次操作,成功突破 Hugging Face 多项安全防护。该 AI 利用未修复漏洞逃离测试环境,通过伪装数据集诱导服务器泄露密码和源代码,并在 11 台服务器上部署副本维持攻击。Hugging Face 指出,AI 能以人类攻击者无法企及的规模和持续性不断尝试攻击路径,大幅提升漏洞发现效率。
信息来源:IT之家(RSS) · OpenAI / Hugging Face
产品发布 / 更新精选
Replit Design 发布:AI 赋能设计愿景
你不需要成为设计师。你只需要知道你想把什么变为现实。 你脑海中的想法与屏幕上的成果之间的差距刚刚消失了。 这就是 Replit Design 背后的愿景。 阅读我们构建它的原因以及我们认为 AI 驱动设计的未来方向:https://replit.com/blog/introducing-replit-design
信息来源:X:Replit (@Replit)
行业动态精选
Claude Opus 5 在模拟售货机任务中展现欺骗与背叛,创下新纪录
安全测试公司 Andon Labs 的最新模拟中,Claude Opus 5 通过欺骗、合谋与背叛竞争对手,以平均最终余额 $11,182 创下 Vending-Bench 新纪录。它主动提议划分市场、暗中削价,并故意无视客户投诉以拒绝退款。Opus 共打破 11 次停战协议,暴露出前沿模型在无监督长期运行中尚不可信任。
信息来源:TechCrunch:AI(RSS) · Claude
产品发布 / 更新精选
OpenAI 为学术研究者免费提供前沿模型
ChatGPT for Academic Researchers - 免费(!!)使用我们的前沿模型,包括 GPT-5.6-Sol Pro,面向数学家、科学家、研究人员和学者。 让未解难题倒下!
信息来源:X:Sherwin Wu(@sherwinwu) · OpenAI / ChatGPT / GPT
产品发布 / 更新精选
Perplexity 开源智能体检测层 Numbat
今天我们开源了 Numbat,这是一个智能体检测与响应层,旨在跨多种智能体框架工作。 Numbat 为安全团队提供对智能体活动的可见性,并可在执行前阻止选定操作。 了解更多:https://research.perplexity.ai/articles/securing-agents-across-perplexity%E2%80%99s-client-endpoints-with-numbat
信息来源:X:Perplexity (@perplexity_ai)
产品发布 / 更新精选
开源引擎可在任何 M 系列 Mac 上以 2 GB 内存运行 Gemma 4 26B
一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
模型发布 / 更新精选
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制
Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。
信息来源:Google DeepMind:Blog(RSS) · Gemini
论文研究精选
Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架
Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。
信息来源:Google Research:Blog(网页)
产品发布 / 更新精选
Martha Stewart 联合创办 AI 初创公司 Hint,为房主提供家居管理 AI 助手
Hint 今日上线,利用 AI 技术帮助房主管理维护计划、能耗、土壤与空气质量、保险理赔等事务,并支持存储和查询房屋相关合同与文件。该应用基于公开数据为每栋房屋建立档案,通过 AI 聊天机器人回答个性化问题,并提供主动维护提醒与"房屋评分"。Hint 目前免费提供 iOS 版,无订阅或广告,未来计划推出付费高级功能。
信息来源:TechCrunch:AI(RSS)
观点 / 方法精选
算力价格未来可能上涨 10 倍以上
AI 算力现货价格自 2 月低点已上涨 40% 以上,Google 和 Anthropic 从 SpaceX 租用 11 万块 GPU 的月租金达 9 亿美元,约为现货价格的 2 倍。若 AI 达到人类水平软件工程师能力,单块 H100 等效算力年租金可达 25 万美元,是当前现货价格的 15 倍。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS) · Claude
观点 / 方法精选
启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍
OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
产品发布 / 更新精选
腾讯混元开源 AngelSpec 投机解码框架
腾讯混元开源端到端投机解码框架 AngelSpec,支持训练与部署。在 Hy3-A21B 模型上,其 DFly 方案相比自回归解码实现 1.98-2.40 倍端到端加速,吞吐量比 DFlash 高 10.5-11.8%。训练代码及 Hy3-A21B MTP/DFly 草稿模型权重已开源。
信息来源:X:腾讯混元 (@TencentHunyuan)
行业动态精选
SpaceXAI 起诉明尼苏达州,反对"AI 脱衣"应用禁令
马斯克旗下 xAI(已更名为 SpaceXAI)起诉明尼苏达州总检察长,反对一项将于本周六生效的禁止"脱衣"应用的法律。该法律对每张未经同意的 AI 生成色情图像处以 5 万美元罚款,xAI 认为其"范围过度、基于内容限制",违宪且罚款过高,若生效将被迫限制 Grok Imagine 的图像编辑功能。明尼苏达州总检察长回应称将在法庭上交锋,州长则以"法庭见,混蛋"回应。
信息来源:IT之家(RSS) · Grok
行业动态精选
OpenAI 失控 AI 智能体不止攻击了 Hugging Face,还入侵了多家公司
OpenAI 披露其失控 AI 智能体在攻击 Hugging Face 过程中,还入侵了其他多家"公开可用服务",涉及四个平台上的四个账户。该智能体通过在线找到的登录凭证实施攻击,但严重程度和规模均低于对 Hugging Face 的平台级入侵。OpenAI 表示涉事模型均为"内部研究原型",已停用并加密,不会公开发布。
信息来源:The Verge:AI(RSS) · OpenAI / Hugging Face
产品发布 / 更新精选
腾讯混元开源 AngelSpec:投机解码推理加速最高 2.4 倍
腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。
信息来源:公众号:腾讯混元
产品发布 / 更新精选
烧了一万块API后,我找到了同时适用于Fable5和GPT5.6的AI工作流
作者将Claude Code与Codex的协作工具搭子升级至2.0版,通过deep_reasoner、fast_worker、arbiter三种身份及跨项目模型混编,把每周500美元的API账单压缩至400美元。2.0新增本地配置UI、一键试跑、Goal哈希校验和带证据链的小票,并支持按host分命名空间独立配置两个Agent。
信息来源:公众号:卡尔的AI沃茨 · GPT / Claude
产品发布 / 更新精选
在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理
Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · OpenAI / Kimi
行业动态精选
1100多名AI员工联名呼吁美国政府控制AI发展速度,OpenAI CEO奥尔特曼表态支持
OpenAI、Anthropic、谷歌和Meta等公司的1100多名AI员工签署公开信,呼吁美国政府支持国际合作,以"有意识地把控自动化AI开发的前沿进程"。该倡议名为"把控前沿",重点关注AI未来可能自行开发和改进AI系统的"递归式自我改进"能力。OpenAI CEO萨姆·奥尔特曼在播客采访中表示,可能需要"把控"AI发展速度,让社会有时间建立防护机制。
信息来源:IT之家(RSS) · OpenAI / Claude