AI 情报文章归档
浏览 AI圈报 已保存的 5584 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5584
正式分类6
精选内容3485
全部文章
第 130 / 140 页 · 每页 40 条
产品发布 / 更新精选
OpenAI 推出安全漏洞赏金计划
OpenAI 启动安全漏洞赏金计划,悬赏征集 AI 滥用及安全风险漏洞,涵盖智能体漏洞、提示注入攻击和数据泄露等问题。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
模型发布 / 更新精选
用 Agent 技能弥合知识鸿沟
Google DeepMind 开发出一项"Gemini API 开发者技能",使智能体能够实时获取最新文档与 SDK 指导。评估结果显示,配备该技能后,gemini-3.1-pro-preview 模型的成功率从 28.2% 大幅跃升至 96.6%。这种轻量级方法通过赋予模型强大的推理能力并接入"事实来源",有效解决了静态模型知识与快速演进的软件实践之间的脱节问题,显著消除了过时的编码模式。
信息来源:Google Developers Blog(RSS) · Gemini
模型发布 / 更新精选
Claude Code 新增自动模式:告别权限确认👏
Claude Code 推出 auto mode,自动代为决定文件写入与 bash 命令的权限,无需逐条手动确认,也不必完全开放权限。每项操作执行前仍经 safeguards 安全检查。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
Claude Code 新增 auto mode
Claude Code 推出 auto mode,无需逐条批准文件写入和 bash 命令,由 AI 自动判断权限决策,运行前仍经安全检查验证。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
AI代理时代的安全噩梦:超越传统身份盗窃的威胁
vibe agents带来远超传统身份盗窃的安全威胁,整个文件系统成为分布式攻击面,~/.claude、skills目录乃至PDF都可能被base64病毒污染。LiteLLM 1.82.8被入侵事件显示恶意代码可窃取凭证并自我复制。当前代理框架面临权限管理困境,只能在盲目授权与完全跳过间选择。未来需"de-vibing"行业,用经审计的Software 1.0为Software 3.0建立多层安全护栏。
信息来源:X:Jim Fan (@DrJimFan) · Claude
观点 / 方法精选
OpenAI基金会投入10亿美元推动AI科研与风险治理
OpenAI基金会宣布未来一年将投入至少10亿美元,用于推动AI驱动的生命科学突破(如疾病治疗),同时防范新型生物威胁、经济快速转型及模型涌现效应等风险。联合创始人Wojciech Zaremba转任AI韧性负责人,主导韧性式安全体系建设;Jacob Tref、Anna Adeola分别负责生命科学及公民社会业务,Robert Kaiden与Jeff Arnold出任CFO及运营总监。
信息来源:X:Sam Altman (@sama) · OpenAI
教程 / 实战精选
Anthropic 工程博客:我们如何利用多智能体工具提升 Claude 的前端设计与长时自主软件工程能力
Anthropic 工程博客发文介绍多智能体工具(multi-agent harness),用于增强 Claude 在前端设计和长时间自主软件工程任务中的表现。该工具帮助 Claude 更好地处理复杂 UI 设计与长期运行的编程工作。
信息来源:X:Anthropic (@AnthropicAI) · Claude
产品发布 / 更新精选
Claude Code 自动模式:在安全与效率间取得平衡
Anthropic 为 Claude Code 推出"自动模式",旨在解决用户因频繁手动批准而产生的"批准疲劳"。该模式介于完全手动审批和危险的无权限跳过之间,采用两层防御机制:输入层通过服务器端提示注入探测器扫描工具输出;输出层则利用基于 Sonnet 4.6 模型的转录分类器,在执行前评估操作风险。分类器采用高效的两阶段设计,先快速过滤,必要时才启动思维链推理。其目标是拦截危险操作(如过度积极行为、无心之失、提示注入等),同时让大部分安全操作无需确认即可运行,内部测试显…
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
论文研究精选
Vibe Coding XR:基于 XR Blocks 与 Gemini 加速 AI + XR 原型开发
Google XR 团队推出 Vibe Coding XR 工作流,结合 Gemini Canvas 与开源框架 XR Blocks,利用长上下文推理能力将自然语言提示在 60 秒内转化为可交互、支持物理效果的 WebXR 应用。该方案基于 WebXR、three.js 和 LiteRT.js 构建,支持手势交互与深度感知,可在桌面模拟环境或 Android XR 头显中实时预览。已展示的应用包括几何可视化数学辅导和交互式物理实验室,用户可通过捏合等手势操作 3D 对象,快…
信息来源:Google Research:Blog(网页) · Gemini
模型发布 / 更新精选
Figma MCP 今日更新,成为与 Claude Code 的最强集成之一
Figma 发布 MCP 更新,开放测试版已上线。新增 use_figma 工具支持 AI 代理基于完整设计系统上下文直接在画布上设计,与 Claude Code 深度集成,可直接通过 Claude Code 在 Figma 中完成设计工作。
信息来源:X:Thariq (@trq212) · Claude
模型发布 / 更新精选
帮助开发者为青少年构建更安全的 AI 体验
OpenAI 发布面向开发者的提示词青少年安全策略,配合 gpt-oss-safeguard 使用,帮助审核 AI 系统中的年龄特定风险。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / GPT
产品发布 / 更新精选
ChatGPT 推出产品发现功能
ChatGPT 上线基于 Agentic Commerce Protocol 的全新购物功能,提供更丰富的视觉化沉浸式体验,支持商品发现、并排对比及商家集成。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
模型发布 / 更新精选
Anthropic Labs小团队发布Claude电脑控制功能
Anthropic Labs团队规模虽小但迭代迅速,先后发布MCP、Skills、Claude Desktop app及Claude Code。从Sonnet 3.6时代笨拙的Computer Use原型,到如今正式在Claude Cowork和Claude Code中开放完整功能。Claude现可操控电脑完成打开应用、浏览网页、填写表格等任务。目前处于研究预览阶段,仅支持macOS。
信息来源:X:Boris Cherny (@bcherny) · Claude
模型发布 / 更新精选
全新语音智能体评估框架EVA发布
ServiceNow AI团队在Hugging Face上发布了语音智能体评估框架EVA。该框架通过标准化测试集与多模态指标,系统评估语音助手在对话理解、任务完成及交互自然度等方面的性能,旨在量化衡量智能体在复杂真实场景下的表现,助力研究人员客观比较不同模型,推动技术优化。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
教程 / 实战精选
跳跃即玩:利用Gemini与MediaPipe进行开发
该工作流通过Gemini Canvas,借助高级提示词快速原型化MediaPipe Pose Landmarker等体感游戏机制。开发者可在Google AI Studio中优化原型,采用低延迟的"轻量"模型和稳定的追踪点(如肩部关节点)以确保游戏响应灵敏。最后,流程利用Gemini Code Assist将实验性代码重构为模块化、可用于生产的应用程序,使其能够支持多种多模态输入,从而显著简化了体感控制游戏的开发过程。
信息来源:Google Developers Blog(RSS) · Gemini
模型发布 / 更新精选
Claude Code 现在可以控制你的电脑了!
Claude Code 推出电脑控制功能,支持鼠标、键盘和屏幕操作,可操控任意应用。配合 Dispatch 使用还能实现远程控制,在用户离开电脑时继续通过 Claude 操作设备。
信息来源:X:Thariq (@trq212) · Claude
模型发布 / 更新精选
Claude 现已支持控制电脑完成任务
Claude 推出电脑控制功能,可自动打开应用、操作浏览器、填写表格等,替代用户完成桌面操作。该功能目前处于研究预览阶段,已在 Claude Cowork 和 Claude Code 上线,仅支持 macOS 系统。
信息来源:X:Claude (@claudeai) · Claude
教程 / 实战精选
利用对抗网络灵感设计多代理架构,突破长时应用开发瓶颈
作者受生成对抗网络启发,设计了一个包含规划器、生成器和评估器的三代理架构,以解决Claude在长时应用开发中的两大瓶颈。该架构通过上下文重置机制,有效克服了模型在长任务中的"上下文焦虑"问题;同时,通过分离生成与评估功能,使代理能依据具体标准进行迭代改进,而非盲目自评。这一方法成功使系统能在多小时的自主运行中生成完整的全栈应用程序,突破了此前提示工程和传统工具设计的性能上限。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
教程 / 实战精选
使用 LlamaParse 与 Gemini 3.1 构建智能金融助手
结合 LlamaParse 与 Gemini 3.1 模型,可从复杂的非结构化文档中提取高质量数据。该方案采用事件驱动架构,利用 Gemini 3.1 Pro 对密集的金融表格进行智能解析,并使用 Gemini 3.1 Flash 进行高性价比的摘要生成。开发者通过此教程可构建个人财务助手,将杂乱的经纪账户对账单转化为结构清晰、易于理解的分析报告。
信息来源:Google Developers Blog(RSS) · Gemini
模型发布 / 更新精选
有损自我改进
自我改进机制虽客观存在,但受限于"有损"特性,难以推动AI能力的递归式爆发。该论述指出,大语言模型等系统的自我优化过程伴随信息损耗与能力瓶颈,这种非完美的迭代模式打破了"快速起飞"(fast takeoff)的技术假设。与理想化的指数级自我增强不同,实际发展将呈现渐进、受限的增长轨迹,AI安全研究需重新评估递归自我改进的风险阈值。
信息来源:Nathan Lambert:Interconnects(RSS)
观点 / 方法精选
利用长时运行智能体工作流革新科学计算
Anthropic 研究员展示了如何将多日智能体编码工作流应用于科学计算任务。以使用 Claude Opus 实现宇宙学玻尔兹曼求解器的可微分版本为例,该任务通常需耗费研究人员数月甚至数年时间。通过制定清晰的项目指令、利用日志文件作为智能体的持久记忆并设置测试预言,即使是非领域专家也能引导智能体在数小时内完成这类复杂项目。该方法的核心在于设定高层目标后,让智能体团队自主工作,仅需偶尔人工监督,从而显著提升了科学代码开发与移植的效率。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
教程 / 实战精选
GPT-5.4 用于前端开发:
只要投入必要的思考与意图,GPT-5.4 就能产出相当出色的前端代码。OpenAI 开发者博客提供了详细的最佳实践指南。
信息来源:X:Greg Brockman (@gdb) · OpenAI / GPT
观点 / 方法精选
Google 本周多项更新🧵
Google AI Studio 上线全栈 vibe coding 功能,集成 Antigravity 编程助手与 Firebase,支持将提示词直接转为生产级应用。
信息来源:X:Sundar Pichai (@sundarpichai)
模型发布 / 更新精选
一日之内构建领域特定嵌入模型
英伟达在Hugging Face平台发布技术博客,分享了一种在24小时内快速构建高质量领域特定嵌入模型的方法。该方法通过结合高效微调技术与领域数据,显著提升了模型在专业任务中的语义理解与检索性能,为企业和开发者提供了低成本、高效率的定制化嵌入解决方案。
信息来源:Hugging Face:Blog(RSS) · NVIDIA / Hugging Face
模型发布 / 更新精选
Cowork 正式上线 Projects 功能
Cowork 新增 Projects 功能,支持将任务与上下文集中管理,专注于单一工作领域。文件和指令保留在本地电脑,可一键导入现有项目或从头开始创建。
信息来源:X:Claude (@claudeai) · Claude
模型发布 / 更新精选
Mistral发布开源模型Small 4,支持混合推理与图像理解
Mistral发布开源权重模型Mistral Small 4,采用119B参数MoE架构(每token激活6.5B参数),支持可切换的推理/非推理模式及图像输入。推理模式在Artificial Analysis Intelligence Index获27分,超越Mistral Large 3,但低于gpt-oss-120B等竞品。模型token效率优于同类,幻觉率更低(AA-Omniscience -30分),支持256K上下文窗口,采用Apache 2.0许可证。
信息来源:X:Artificial Analysis (@ArtificialAnlys) · GPT / Mistral
模型发布 / 更新精选
期待你的反馈!
Claude Code 发布 channels 功能,支持通过 Telegram 和 Discord 的 MCP 协议远程控制会话,用户可直接用手机向 Claude Code 发送消息。
信息来源:X:Boris Cherny (@bcherny) · Claude
产品发布 / 更新精选
Superintelligence 团队新图像模型 MAI-Image-2 登陆 Copilot,即将上架 Foundry 企业版
MAI-Image-2 图像生成模型已在 MAI Playground 上线,竞技场排名第 3,支持从写实风格到详细信息图等多种生成需求。即将集成至 Copilot、Bing Image Creator 及 Microsoft Foundry,面向企业客户开放。
信息来源:X:Satya Nadella (@satyanadella)
模型发布 / 更新精选
用 @stitchbygoogle 即可 vibe design 惊艳界面
Google 发布 vibe design 平台 Stitch,支持自然语言描述直接生成高保真界面和交互原型,可通过语音实时调整布局。目前仅面向 18 岁以上用户,在 Gemini 支持的英语国家开放。
信息来源:X:Demis Hassabis (@demishassabis) · Gemini
论文研究精选
Composer 2 正式发布
Composer 2 登陆 Cursor,定价 $0.50/M(输入)和 $2.50/M(输出),Terminal-Bench 2.0 得分 61.3,SWE-bench Multilingual 达 73.7,显著优于前代。支持数百步长周期编码任务,团队同步发布训练技术报告。
信息来源:Cursor Blog · Cursor
行业动态精选
OpenAI 将收购 Astral
OpenAI 收购 Astral,加速 Codex 发展以支持下一代 Python 开发工具。Astral 是 Python 生态重要工具开发商,此次收购将整合其技术能力,强化 OpenAI 在开发者工具领域的布局。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI
模型发布 / 更新精选
Qwen3.5-Max-Preview 现已上线 Arena
Qwen3.5-Max-Preview 已登陆 LMSYS Chatbot Arena。Qwen Studio 提供聊天机器人、图像与视频理解、图像生成、文档处理、网页搜索、工具调用及 artifacts 等全栈功能。
信息来源:Qwen:Blog Retrieval(API) · Qwen
教程 / 实战精选
开发者AI代理协议指南
一套包含MCP、A2A等六种协议的新工具集正式发布,旨在通过标准化AI代理的数据访问与通信方式,消除定制集成代码的需求。以"厨房管理员"代理为例,这些协议能实时核查库存、通过UCP进行批发交易,并借助AP2完成安全支付授权。开发者使用Agent开发套件(ADK)还可实现A2UI与AG-UI,为用户提供交互式仪表板与无缝流式界面。
信息来源:Google Developers Blog(RSS)
观点 / 方法精选
(1/N) We're launching Dreamverse. Most AI video models take minutes to generate a 5 s 1080p clip. In…
(1/N) 我们正在推出 Dreamverse。大多数 AI 视频模型需要数分钟才能生成一段 5 秒 1080p 的片段。而在 4.5 秒内,我们就能在单张 GPU 上生成 30 秒 1080p 的片段。
信息来源:X:Sky Computing Lab (@haoailab)
产品发布 / 更新精选
FastVideo推出Dreamverse原型,实现"氛围导演"式实时视频生成
FastVideo团队发布Dreamverse原型界面,引入创新的"氛围导演"工作流。该模式允许用户通过自然语言实时、迭代地引导视频生成,如更换背景或调整运镜,无需编写复杂的长提示词。其核心是全新的实时推理栈,能在单GPU上以约4.55秒生成5秒1080p视频,速度快于观看时间,从而将生成过程从被动等待转变为实时导演体验。团队认为,视频生成的未来在于让创作速度跟上想象速度,快速的反馈循环比单纯追求模型性能更能催生优质作品。
信息来源:X:Sky Computing Lab (@haoailab)
模型发布 / 更新精选
推出 GPT-5.4 mini:
OpenAI 发布 GPT-5.4 mini,已在 ChatGPT、Codex 及 API 上线。针对编程、计算机使用、多模态理解与 subagents 优化,速度较 GPT-5 mini 提升 2 倍。
信息来源:X:Greg Brockman (@gdb) · OpenAI / ChatGPT / GPT
模型发布 / 更新精选
GPT-5.4 mini 今日上线 ChatGPT、Codex 及 API
GPT-5.4 mini 今日在 ChatGPT、Codex 和 API 中可用。针对编程、计算机使用、多模态理解和子代理场景优化,推理速度比 GPT-5 mini 快 2 倍。
信息来源:X:OpenAI (@OpenAI) · OpenAI / ChatGPT / GPT
论文研究精选
Hugging Face开源现状:2026年春季
Hugging Face发布了一篇关于其平台开源生态的博客文章。该文由Hugging Face官方撰写并发布在其自有平台上,内容聚焦于2026年春季的开源发展状态。文章具体分析了平台上的模型、数据集及开源社区活动趋势,但未提供详细的量化指标或具体产品发布信息。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
MiniMax M2.7:自我进化的早期回声
M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了"分析-修改-评估"的自主迭代优化循环,在内部评估中提升了性能。
信息来源:MiniMax:Blog(网页)
论文研究精选
Holotron-12B - 高吞吐计算机使用智能体
H公司发布了多模态计算机使用模型Holotron-12B。该模型基于NVIDIA开源的Nemotron-Nano-12B-VL模型,使用专有数据混合进行训练,专注于在交互环境中高效感知、决策和行动。其采用混合状态空间模型与注意力机制架构,在单张H100 GPU上实现了比前代Holo2-8B高2倍以上的吞吐量,在100并发基准测试中达到每秒8900个token。在WebVoyager基准测试中,性能从基线的35.1%提升至80.5%,在定位和导航基准上也显著提升。模型已通过N…
信息来源:Hugging Face:Blog(RSS) · NVIDIA / Hugging Face