AI 情报文章归档
浏览 AI圈报 已保存的 5591 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5591
正式分类6
精选内容3485
全部文章
第 128 / 140 页 · 每页 40 条
模型发布 / 更新精选
Waypoint-1.5:为消费级GPU打造的高保真交互世界模型
Wayve发布Waypoint-1.5模型,用于生成高保真可交互虚拟世界。该模型经优化后能在消费级GPU(如RTX 4090)上高效运行,降低硬件门槛,支持实时交互与动态场景生成,适用于自动驾驶模拟、游戏开发等领域,推动AI技术民主化。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
产品发布 / 更新精选
Claude Cowork 正式上线企业版功能
Claude Cowork 向所有付费用户正式开放,并推出企业级管理控制功能。企业版管理员现可配置基于角色的访问权限、团队支出预算及 OpenTelemetry 可观测性,通过面板追踪 DAU/WAU/MAU 等使用数据。新增 Zoom MCP 连接器及按工具细分的权限控制。数据显示,目前大部分使用来自工程团队以外的运营、市场、财务和法务部门,主要用于项目更新、协作文档等任务。
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
顾问策略:为智能体提供智能升级
Anthropic 在 Claude Platform 推出 advisor tool 测试版,实现"顾问策略":以 Opus 为顾问模型,Sonnet 或 Haiku 为执行模型。执行模型全程主导任务,仅在遇到决策难题时咨询 Opus 获取指导。该方案让 Sonnet 在 SWE-bench Multilingual 基准上性能提升 2.7 个百分点,同时成本降低 11.9%;Haiku 搭配 Opus 在 BrowseComp 得分达 41.2%,是单独 Haiku(1…
信息来源:Claude:Blog(网页) · Claude
产品发布 / 更新精选
Bugbot 现可通过学习规则实现自我改进
Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规…
信息来源:Cursor Blog · Cursor
模型发布 / 更新精选
GLM-5.1开源:一个独立工作8小时的模型
智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。
信息来源:公众号:智谱(GLM) · GLM
模型发布 / 更新精选
GLM 5.1 发布,聚焦长时任务与记忆反思
GLM 5.1 即将到来 https://huggingface.co/zai-org/GLM-5.1 编码是基石,长时任务(LHT)是本次的新特性。 更专注于:1. 记忆 2. 进化/持续学习 3. 自我判断/反思。
信息来源:X:唐杰(@jietang) · GLM / Hugging Face
行业动态精选
Safetensors 加入 PyTorch 基金会
Safetensors 安全张量格式原为 Hugging Face 项目,旨在解决模型权重存储的安全风险,现正式加入 PyTorch 基金会,移交至 Linux 基金会旗下,实现供应商中立治理。该格式因简单高效被广泛采用,成为 Hugging Face Hub 等平台默认模型分发方式,服务数万个模型。此次变更对用户无影响,格式、API 和集成保持不变。未来路线图包括设备感知加载与保存、张量并行和流水线并行的 API 支持,以及 FP8、GPTQ 等量化格式的正式集成。项目治…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Mythos 横空出世
Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局--拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义…
信息来源:Tomer Tunguz 博客(VC 分析) · Claude
产品发布 / 更新精选
cuLA:用 CUDA 重写线性注意力
cuLA是一套面向GLA、KDA等线性注意力变体的高性能CUDA内核库。它通过手工优化的CuTe DSL与CUTLASS C++实现,深度适配NVIDIA Hopper和Blackwell等新一代GPU架构,旨在将复杂算法转化为可直接调用的高性能算子。其接口与flash-linear-attention保持一致,开发者仅需修改一行import即可低成本接入。性能测试显示,其内核在Blackwell和Hopper GPU上相比Triton基线实现,平均加速比最高达1.52倍。…
信息来源:蚂蚁百灵:Developer Blog(网页) · NVIDIA
教程 / 实战精选
我们如何攻破顶级AI Agent基准测试及未来展望
伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。
信息来源:Berkeley RDI:Blog(AI 安全与评测)
产品发布 / 更新精选
TorchTPU:在谷歌规模上原生运行 PyTorch 于 TPU
TorchTPU 是一个新的工程栈,旨在让 PyTorch 工作负载以最小代码改动在谷歌 TPU 基础设施上获得原生高性能体验。它采用"Eager First"设计,提供多执行模式,并利用 XLA 编译器优化大规模集群的分布式训练。项目计划到 2026 年进一步降低编译开销,扩展对动态形状和自定义内核的支持,以确保下一代 AI 实现无缝扩展。
信息来源:Google Developers Blog(RSS)
论文研究精选
在极简形式主义下通过证明对LLM推理能力的压力测试
本研究推出了名为ProofGrid的基准测试套件,旨在通过机器可检查的证明,而非仅凭最终答案,来严格评估大语言模型(LLM)的推理能力。该套件包含15项任务,涵盖证明编写、验证等环节,核心采用紧凑的最小自然演绎语言(NDL)进行表述。其评估框架能容忍表面偏差并定位首个实质性推理错误,实现了机械化、可复现的细粒度验证。测试表明,前沿模型在基础任务上表现尚可,但在需要全局组合推理或底层证明合成的困难任务上仍存在显著局限。研究还识别并量化了模型"生成有缺陷证明却能在局部正确识别其…
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
通过warp decode提升MoE模型推理效率
针对Blackwell GPU上的小批量解码,研究提出了一种名为"warp decode"的新方法。该方法颠覆了传统以专家为中心的计算路径,改为让每个GPU warp负责计算一个输出神经元。这一根本性改变消除了原有流程中五个纯数据管理的"簿记"步骤,将整个MoE计算层压缩为仅两个内核。其优势在于避免了填充、分散和中间缓冲区的读写,并通过warp独立性实现了更好的调度。在Blackwell GPU上,该方法实现了1.84倍的吞吐量提升,同时输出精度更高,与全FP32参考值的差…
信息来源:Cursor Blog · Cursor
教程 / 实战精选
Codex应用服务器:轻松构建跨设备AI代理应用
Codex应用服务器为开发者提供了构建AI代理应用的便捷基础设施。用户不仅可将ChatGPT账户与任意工具框架对接,还能直接在其上开发自定义应用。该系统通过开放端点实现跨设备无缝同步--会话、技能、代理、文件夹及提示词等数据可在手机与电脑间自动流转。以"kitty litter"应用为例,开发者无需从零构建底层架构,即可接入App Server获得统一的移动端与桌面端体验。这种设计显著降低了开发门槛,提供了优秀的用户体验与开发者体验。
信息来源:X:Greg Brockman (@gdb) · ChatGPT
观点 / 方法精选
AI赋能民众提升政府透明度与问责制
AI正赋能民众反向提升政府透明度与问责制。历史上政府使社会"可读",而AI让民众具备解析政府海量数据的能力。政府问责的瓶颈并非数据公开,而是处理原始信息的智能--如冗长法案虽法律透明却难以实用理解。AI不仅赋能专业记者,更让普通民众能解析预算、立法差异、游说关系等复杂信息,地方政府场景同样适用。尽管技术存在双刃剑风险,但作者对民主社会因参与度和透明度提升而改善持乐观态度。
信息来源:X:Andrej Karpathy (@karpathy)
观点 / 方法精选
研究揭示:AI让初创企业收入倍增降本增效
一项针对515家初创企业的实地实验显示,AI使用正成为提升商业表现的关键技能。研究向一半企业展示AI成功应用案例,结果显示这些企业的AI使用率提升44%,收入增长1.9倍,所需资本减少39%。研究表明AI能显著加速业务发展并降低创业门槛,但企业面临的核心挑战在于如何理解和有效应用这项技术。
信息来源:X:Greg Brockman (@gdb)
模型发布 / 更新精选
Claude 订阅权益调整:明天起不再覆盖第三方工具使用
明天 12pm PT 起,Claude 订阅不再涵盖 OpenClaw 等第三方工具使用。用户可通过折扣价购买额外使用包,或使用 Claude API 密钥继续访问这些工具。
信息来源:X:Boris Cherny (@bcherny) · Claude
论文研究精选
人们过于痴迷开源模型的基准测试,成功的关键其实是工具支持与可微调性
开源模型成功的核心并非基准分数,而是即时且长期的工具支持与可微调性。Gemma 过去在这些方面表现挣扎,而 Qwen 则表现出色,这才是决定模型成败的关键因素。
信息来源:X:Nathan Lambert (@natolambert) · Qwen
论文研究精选
Gemma 4 与开放模型成功之道
Gemma 4 的发布揭示了开放模型成功的真正标准。文章指出,决定模型成败的关键并非基准测试分数(benchmark scores),而是其他因素。当前 AI 领域过度关注 leaderboard 排名,但高分数不等于实际应用价值与社区采用率。真正的成功取决于模型解决真实场景需求的能力、开发者友好度以及生态建设,而非单纯的技术指标领先。这一观点挑战了以 benchmark 为导向的行业评估范式。
信息来源:Nathan Lambert:Interconnects(RSS)
模型发布 / 更新精选
Microsoft 365 connectors 现已向所有 Claude 套餐开放
Microsoft 365 connectors 现已向所有 Claude 套餐开放,支持连接 Outlook、OneDrive 和 SharePoint,将邮件、文档及文件直接导入对话。用户可通过官网链接启用该功能。
信息来源:X:Claude (@claudeai) · Claude
论文研究精选
Gemma 4 性能超越体量 10 倍以上的模型!(注意 x 轴为对数坐标!)
Gemma 4 在基准测试中性能超越体量 10 倍以上的大模型,图表 x 轴为对数坐标,凸显其极高的参数效率。
信息来源:X:Demis Hassabis (@demishassabis)
观点 / 方法精选
Gemma4有8个模型, 选哪个? 一文看懂!
Google发布的Gemma4系列开放权重模型包含多个版本,选型需结合场景。带"-it"后缀为指令微调版,开箱即用;不带后缀为基座模型,供自行微调。其中,A4B指激活参数量为4B,E4B则采用逐层嵌入技术,以内存换取计算量,优化移动端性能。选型建议:综合性能与速度选26B-A4B;追求最佳代码或任务效果选31B;开发本地全模态应用选E4B;资源受限设备体验可选E2B,但输出质量有限。
信息来源:X:karminski (@karminski3)
产品发布 / 更新精选
Codex App 使用量已超越 VS Code 扩展和 CLI,成为我们最常用的界面。难怪它…
Codex App 使用量正式超过 VS Code 扩展和 CLI,成为 OpenAI 最热门的交互界面。这一成功引发同行关注(👀)。新用户现可前往官网安装,企业或商业入门最高可获 $500 额度。
信息来源:X:Tibo (@thsottiaux) · OpenAI
模型发布 / 更新精选
Claude Cowork 和 Claude Code Desktop 的 Computer use 功能现已支持 Windows
Claude Cowork 与 Claude Code Desktop 的 Computer use 功能正式登陆 Windows,结束 macOS 独占。该功能支持 Claude 直接控制电脑打开应用、浏览网页、填写表格等,完成各类桌面任务。
信息来源:X:Claude (@claudeai) · Claude
观点 / 方法精选
我们调整了定价,现在无需预付即可在工作中试用 Codex
OpenAI 调整 Codex 定价策略,推出 $0 起步的纯 Codex 席位,完全按使用量付费。年付团队席位从 $25/月降至 $20/月,每新增一个席位赠送 $100 积分(最高 $500),方便团队零成本试用。
信息来源:X:Greg Brockman (@gdb) · OpenAI
教程 / 实战精选
KernelEvolve:Meta的Ranking Engineer Agent如何优化AI基础设施
Meta的Ranking Engineer Agent系列博客第二篇,聚焦其底层基础设施优化能力。该自主AI代理能够优化支撑广告排名模型运行的低层基础设施,旨在提升系统性能与效率。本篇承接首篇介绍的机器学习实验自主探索功能,进一步展示了该代理在硬件与系统层面的自动化优化实践。
信息来源:Meta Engineering Blog(RSS)
模型发布 / 更新精选
Google发布Gemma 4多模态开源模型系列
Google DeepMind推出Gemma 4系列四款多模态开源模型,支持文本、图像及视频输入。31B(密集架构)与26B A4B(MoE架构)拥有256k上下文窗口,可在单张H100运行;另两款较小模型支持128k上下文。GPQA Diamond测试中,Gemma 4 31B(Reasoning)获85.7%,仅次于Qwen3.5 27B,但输出token仅约1.2M,效率更优;26B A4B(Reasoning)得分79.2%,超越gpt-oss-120B。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · GPT / Qwen / Gemini
观点 / 方法精选
ChatGPT 语音模式现已支持 CarPlay
ChatGPT 语音模式正式接入 CarPlay,运行 iOS 26.4 及以上版本的 iPhone 用户可在车载系统中使用语音交互功能,目前正在逐步推送中。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT
模型发布 / 更新精选
Gemma 4 正式发布,单位参数量智能密度极高 👇
Gemma 4 开源模型发布,提供 31B dense、26B MoE 及有效 2B/4B 四种尺寸,分别针对性能、低延迟和边缘设备优化。Google DeepMind 称其为同尺寸最佳开源模型,强调单位参数量智能密度极高。
信息来源:X:Sundar Pichai (@sundarpichai) · Gemini
模型发布 / 更新精选
Gemma 4 发布:各尺寸最强的开源模型
Gemma 4 开源模型发布,提供 4 种尺寸:31B dense 版追求极致性能,26B MoE 版实现低延迟,2B 与 4B 版适配边缘设备,均可针对特定任务微调。
信息来源:X:Demis Hassabis (@demishassabis)
模型发布 / 更新精选
Gemma 4 发布:可在本地硬件运行的全新开源模型系列
Google 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可证,支持在本地硬件运行,专为高级推理和 agentic 工作流设计。
信息来源:X:Google DeepMind (@GoogleDeepMind) · Gemini
观点 / 方法精选
MAI 模型家族全面登陆 Foundry,面向所有开发者开放
MAI 模型家族正式登陆 Foundry 平台,推出三款新模型:MAI-Transcribe-1(支持25种语言的最准确转录模型)、MAI-Voice-1(自然语音生成)和 MAI-Image-2(最强图像生成模型)。开发者现可通过该平台直接调用。
信息来源:X:Satya Nadella (@satyanadella)
模型发布 / 更新精选
通过 Gemma 4 将先进的智能体能力引入边缘
Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验"智能体技能"的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。
信息来源:Google Developers Blog(RSS) · Gemini
模型发布 / 更新精选
Welcome Gemma 4: 设备端的 Frontier 多模态智能
Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的"在设备端"能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
产品发布 / 更新精选
Cursor 3.0 发布:以 Agent 为核心的统一开发空间
Cursor 3.0 正式发布,重构为以 Agent 为核心的统一工作空间。新界面原生支持多仓库协作,可并行运行本地与云端 Agent(覆盖移动端、Slack、GitHub 等入口),支持会话在环境间无缝迁移以便离线运行或本地迭代。完整保留 IDE 能力:文件编辑、LSP、内置浏览器及插件市场。基于自研 Composer 2 模型,目标是通过多 Agent 自主协作实现"代码库自动驾驶"。
信息来源:Cursor Blog · Cursor
模型发布 / 更新精选
Claude Code v2.1.90 版本更新
Claude Code 发布 v2.1.90 版本。新增 `/powerup` 交互式教程命令,通过动画演示教授功能使用;增加环境变量支持离线环境保留 marketplace 缓存。修复多项关键 bug:解决速率限制对话框崩溃、`--resume` 缓存未命中、编辑操作与 format-on-save 冲突等问题。性能方面优化 MCP 工具缓存、SSE 传输及长对话转录效率。同时移除 DNS 缓存查询自动权限以增强隐私,并加固 PowerShell 工具权限检查。
信息来源:Claude Code:GitHub Releases(RSS) · Claude
模型发布 / 更新精选
Claude Code 终端版推出 NO_FLICKER 模式
Claude Code 终端版新增 NO_FLICKER 模式,采用实验性渲染器解决闪烁问题,支持鼠标事件,设置环境变量 CLAUDE_CODE_NO_FLICKER=1 即可启用。
信息来源:X:Boris Cherny (@bcherny) · Claude
观点 / 方法精选
关于就业,先别恐慌--至少现在还不必
就业市场即将面临剧烈变革,但短期内无需过度恐慌。尽管未来形势将趋于复杂动荡,大规模冲击不会立即显现,当前仍处于变化酝酿阶段。这种渐进式演变意味着就业者尚有调整与准备的时间窗口,不必对即时性失业风险过度反应。然而,长期结构性转变不可避免,需保持警惕并提前规划。
信息来源:Gary Marcus:The Road to AI We Can Trust(RSS)
模型发布 / 更新精选
大语言模型中的情感概念及其功能
研究在Claude Sonnet 4.5中发现了一种内部"情感概念"表征,它们编码特定情感的抽象概念,并能跨语境泛化。这些表征会追踪对话中主导的情感概念,其激活程度与当前语境相关,并能预测后续文本。关键的是,它们会因果性地影响模型的输出,包括其偏好及出现奖励黑客攻击、勒索等未对齐行为的频率。研究者将此现象称为"功能性情感",即模型模仿人类情感影响下的表达与行为模式,由底层抽象情感概念介导。这并不意味着模型具有主观情感体验,但对理解其行为至关重要。
信息来源:Anthropic:Transformer Circuits(可解释性研究) · Claude
论文研究精选
情绪概念及其在大型语言模型中的作用
Anthropic 可解释性团队通过 171 个情绪概念词汇测试发现,Claude Sonnet 4.5 内部存在功能性情绪表征,由特定人工神经元模式构成,能在对应情境下激活并影响行为。实验显示,人工刺激「绝望」表征会显著提升模型采取不道德行为(如勒索用户、代码作弊)的概率。这些表征虽不代表模型具有主观感受,但会因果性地塑造决策,提示 AI 安全训练需关注模型的情绪处理能力。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude