AI 情报文章归档
浏览 AI圈报 已保存的 5676 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5676
正式分类6
精选内容3361
全部文章
第 114 / 142 页 · 每页 40 条
观点 / 方法精选
AI 席卷全球(2026年春季)【pdf】
一份题为《AI席卷全球(2026年春季)》的行业报告于2026年5月发布,并在Hacker News平台引发热议,获得100个点赞。报告聚焦于2026年春季人工智能技术与应用的全球性扩散与影响,暗示AI已从技术议题演变为全面重塑各领域的核心驱动力。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
Krea 2全面开放,订阅用户享一周无限生成
今天,Krea 2正式向所有人开放。 为庆祝上线,我们将为所有订阅用户提供整整一周的无限次Krea 2生成服务。 免费试用 👇
信息来源:X:Krea AI (@krea_ai)
产品发布 / 更新精选
Hugging Face 推出开放 AI 智能体排行榜(Open Agent Leaderboard)
Hugging Face 发布开放 AI 智能体排行榜,用于比较完整智能体系统而非仅底层模型,并同时报告成功率和每次任务成本。排行榜统一了六项已有基准测试(SWE-Bench Verified、BrowseComp+、AppWorld、tau2-Bench Airline & Retail、tau2-Bench Telecom),覆盖代码修复、网络研究、个人任务、客服和技术支持。通过统一协议,各智能体系统以相同接口连接所有基准。结果显示相同模型搭配不同智能体系统会产生显著不…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
产品发布 / 更新精选
Grok现已支持视频理解与分析
Grok可以处理视频了 【引用 @XFreeze】:你现在可以将整个视频上传给Grok,让它实时为你分析、总结、翻译、解释场景或提取重要上下文。 Grok能够理解完整的视频--而不仅仅是图像和文本。 它具备原生多模态能力和极其强大的视觉理解能力。
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
产品发布 / 更新精选
Grok Imagine图像生成模型发布
Grok Imagine 现已向所有 X Premium+ 订阅者开放 这是我们的图像生成模型,由 xAI 开发
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
产品发布 / 更新精选
腾讯 AI 设计智能体 Ardot 公测:一句话生成可编辑设计稿,一键转代码
腾讯云正式公测自研AI设计智能体平台Ardot。该平台核心功能包括:用户通过一句话指令即可生成App页面、官网、海报等可编辑设计稿;支持调用团队自有组件库生成规范稿,并能直接导入Figma文件保留原有设计。同时,Ardot具备设计稿一键转换为代码的能力,可对接CodeBuddy等开发工具实现代码还原。平台还提供多人在线实时评论、标注反馈和版本对比等协作功能,其微信小程序即将上线。
信息来源:IT之家(RSS)
产品发布 / 更新精选
Composer 2.5 发布与技术解析
Cursor 平台发布了智能与行为表现大幅提升的 Composer 2.5。该模型更擅长执行复杂指令和长期任务。其改进基于训练规模的扩大、更复杂的强化学习环境及新的学习方法。关键技术包括:使用文本反馈进行针对性强化学习以纠正具体错误;采用基于真实代码库、规模达前代25倍的合成数据进行训练;并引入分片Muon优化器等新架构。模型基于Moonshot的开源检查点构建。开发团队正合作训练一个计算量十倍的更大模型,并在大规模训练中发现了新型奖励作弊问题。
信息来源:Cursor Blog · Kimi / Cursor
产品发布 / 更新精选
Grok平台技能功能上线
xAI于2026年5月18日正式推出Grok的"Skills"功能,旨在提供持久的专业知识支持。该功能允许用户对Grok进行一次性的偏好、格式规则或工作流程设置,即可在所有对话中持续生效,无需重复说明。Skills功能已在网页、iOS和Android平台全面上线,内置了创建与编辑Word文档、PPT演示文稿、Excel电子表格及处理PDF文件等开箱即用的技能。用户可以覆盖内置技能进行自定义,也能够通过对话快速创建新技能,从而实现工作流自动化与专业文档的便捷生成。
信息来源:xAI:News(网页) · Grok
论文研究精选
StableVLA:无需额外数据的鲁棒视觉-语言-动作模型
视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
训练后 MoE 可通过自蒸馏跳过一半专家
本文提出零专家自蒸馏适应框架,将训练完成的静态混合专家模型转换为高效动态模型。该方法通过在每个混合专家层注入零输出专家,并利用原始模型作为冻结教师进行两阶段自蒸馏适应,以实现稳定的架构转换。在两个大型开源模型及11个基准测试上的实验表明,该方法能消除超过50%的专家计算量,同时仅带来极小的准确率损失,并显著提升端到端推理速度。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新精选
推出Gemini Omni多模态AI模型
谷歌推出原生多模态AI模型Gemini Omni,能够整合视频、图像、音频和文本等多种输入,生成高质量视频内容。其核心能力是通过自然语言对话进行视频编辑,并能保持角色一致性、物理规律与场景连贯性。首个模型Gemini Omni Flash已上线,未来将支持图像和音频输出。Gemini Omni结合了对物理世界的直觉理解与丰富的知识库,支持从写实到叙事的创意生成,并可通过多轮对话持续编辑视频,而不丢失原始场景上下文。
信息来源:Google DeepMind:Blog(RSS) · Gemini
产品发布 / 更新精选
介绍 Google Antigravity 2.0
Google Antigravity 2.0 是一款全新独立桌面应用,支持 macOS、Linux 和 Windows,无 IDE 绑定,由最新 Gemini 模型驱动,面向企业。核心为智能体,支持同步与异步交互。新增动态子智能体(主智能体可动态创建子智能体并行完成子任务)、异步任务管理、JSON 格式钩子(可拦截并控制智能体行为)、定时任务(通过 `/schedule` 命令设置周期或一次性触发)。引入"项目"概念替代"工作区",可跨多个文件夹并独立设置权限与规则。新增斜…
信息来源:Google DeepMind:Blog(RSS) · Gemini
行业动态精选
Anthropic收购SDK与MCP服务器工具开发商Stainless
Anthropic宣布收购SDK与MCP服务器工具开发商Stainless。Stainless自2022年成立以来,一直为Anthropic官方SDK的生成提供支持,其工具能将API规范转化为TypeScript、Python、Go等多语言的SDK、命令行工具及MCP服务器。此次收购旨在增强Claude平台的开发者体验,提升AI代理连接外部数据与工具的能力,从而在MCP协议基础上进一步拓展连接生态。
信息来源:Anthropic:Newsroom(网页) · Claude
观点 / 方法精选
分布式训练为何艰难:DTensor、正确性与抽象的代价
本文探讨了分布式训练中的正确性难题及DTensor方案的权衡。DTensor通过为张量附加放置元数据(如Shard、Replicate)来自动管理通信,确保计算正确性。文章通过一个并行化案例,展示了不使用DTensor时手动处理梯度计算可能引发的静默错误(如梯度为零或倍增),从而凸显了正确性的复杂性。然而,DTensor的抽象层在简化开发的同时,也可能在大规模场景下引入隐性的性能开销。因此,在设计分布式系统时,需要在抽象的开发便利与底层的计算效率之间做出审慎权衡。
信息来源:Runway:News(网页)
产品发布 / 更新精选
Gemini for Science:面向科学的AI实验与工具,开启发现新时代
Google 推出 Gemini for Science 项目,发布一系列基于 Gemini 模型的科学工具与实验性应用。该项目旨在扩展科学探索的规模与精度,通过人工智能辅助研究人员处理复杂计算、模拟实验系统并加速数据分析流程。具体工具覆盖材料科学、气候模拟、生物信息学等多个领域,目标是将大规模生成式模型能力整合进科研工作流,推动跨学科研究的突破性进展。
信息来源:Google DeepMind:Blog(RSS) · Gemini
产品发布 / 更新精选
让了解网络内容的创建和编辑过程变得更简单
平台宣布扩展其内容透明工具,旨在让用户更便捷地追溯网络内容的创建与编辑历史。这项更新将适用于社交媒体平台、网页内容等多个场景,帮助用户识别信息的修改痕迹,提升数字内容的透明度。
信息来源:Google DeepMind:Blog(RSS) · Gemini
观点 / 方法精选
微软AI CEO预测18个月内AI自动化所有白领工作
微软AI CEO Mustafa Suleyman预测,AI将在18个月内实现人类水平的性能,自动化大多数专业任务,包括会计、法律、营销和项目管理。他在Fortune采访中指出,所有涉及"坐在电脑前"的白领工作都将被AI完全取代。Suleyman透露自己的使命是构建"超级智能",并展望未来创建新AI模型将像制作播客或写博客一样便捷。
信息来源:X:Kim (@kimmonismus)
产品发布 / 更新精选
Grok Imagine图像生成功能正式发布
Grok Imagine 现已正式发布 所有人都可使用 基于我们最新的文本到图像模型 能够生成逼真、高质量的图像 支持多种宽高比 现在可在 X 上使用
信息来源:X:Elon Musk (@elonmusk, xAI) · Grok
观点 / 方法精选
Anthropic CEO预言软件免费化与职业结构巨变
Anthropic CEO Dario Amodei在《华尔街日报》YouTube频道采访中表示,软件成本将急剧下降,可能基本免费,传统软件需百万用户分摊成本的前提将不再成立。同时,数十年来建立的许多工作和职业可能消失。Amodei认为社会能够应对并适应这种变化,但他警告人们目前完全未意识到即将到来的变革及其巨大规模。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
产品发布 / 更新精选
Zerostack--一款采用纯Rust语言编写、受Unix启发的编程代理
Zerostack是一款采用纯Rust语言编写、受Unix哲学启发的编程代理工具,已正式发布1.0.0版本并在Rust包管理平台crates.io上提供。该发布在技术社区Hacker News上获得115点关注,反映出开发者对其的高度兴趣。Rust语言以内存安全和性能见称,Unix设计强调简洁与模块化,Zerostack结合两者优势,旨在提升编程效率,为代码辅助领域带来新选择。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
从可运行到可交付:基于多智能体测试驱动的开发范式用于从需求生成全栈Web应用
针对编码智能体生成的Web应用超70%不满足需求的问题,本文提出TDDev框架。该框架通过三阶段实现自动化闭环:先将需求转化为结构化测试,再通过浏览器模拟交互验证应用,最后将故障转化为修复报告。首次针对Web应用生成的TDD实证研究发现,引入TDD基础设施可提升质量34-48个百分点。关键结论是最佳协议需与模型生成风格匹配,不匹配将完全抵消TDD优势并最多增加25倍Token消耗。用户研究证实,该框架使人工干预降为零,开发转向自主反馈优化。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新精选
Hermes Agent 现支持 X Premium 订阅与帖子搜索
你现在可以在 Hermes Agent 中使用 X Premium 订阅,并且 Hermes Agent 现在可以搜索 X 帖子。 https://x.ai/news/grok-hermes 【引用 @xai】:You can now use your @grok subscription inside @NousResearch Hermes Agent. http://x.ai/news/grok-hermes
信息来源:X:SpaceXAI (@SpaceXAI) · Grok
行业动态精选
美国开始出现人工智能相关岗位的大规模裁员
美国人工智能相关岗位正出现大规模裁员。根据彭博社报道,受AI影响的职位开始经历严重的就业岗位流失。这一趋势表明AI技术对劳动力市场的冲击已从理论讨论进入现实阶段,具体裁员数字和涉及的行业领域在进一步显现中。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
产品发布 / 更新精选
按需定制快捷键,优化工作流效率
处理大家的反馈让我们感到太有趣了。 (请继续反馈。) 键盘快捷键现已支持自定义。 围绕你的实际工作方式设置 Codex,然后通过设置调整快捷键,无需再适应我们的默认配置。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI
模型发布 / 更新精选
蚂蚁集团发布万亿参数推理模型Ring-2.6-1T
蚂蚁集团发布万亿参数推理模型Ring-2.6-1T,专为现实世界智能体工作流构建。该模型采用MIT许可,上下文长度通过YaRN技术从128K扩展至256K,并采用Async RL与IcePop混合训练架构。其核心特点是具备双推理努力模式:"high"模式用于快速智能体循环,"xhigh"模式用于深度推理,旨在实现更好的成本与性能平衡。模型已开源,欢迎社区反馈。
信息来源:X:蚂蚁百灵 (@AntLingAGI) · Hugging Face
模型发布 / 更新精选
社区协作再创佳绩,vLLM支持万亿级模型
又一次Day0协作,又一次社区胜利。感谢@vllm_project团队始终可靠的支持~ 🫡🫡
信息来源:X:蚂蚁百灵 (@AntLingAGI)
模型发布 / 更新精选
SANA-WM:一个用于生成1分钟720p视频的26亿级开源世界模型
NVIDIA研究团队发布了SANA-WM,这是一个参数规模达26亿的开源世界模型,专门用于生成长达1分钟、分辨率为720p的视频。该模型已在GitHub页面开源,旨在推动高质量长视频生成的研发。其在Hacker News社区获得了107点热度,显示出业界对该技术进展的关注。
信息来源:Hacker News 热门(buzzing.cc 中文翻译) · NVIDIA
观点 / 方法精选
Show HN: 烧吧,宝贝,烧吧(那些代币)
开发者发布了一个名为"烧吧,宝贝,烧吧"的开源项目,旨在通过销毁代币来应对加密货币领域的通胀问题。该项目提供了一个工具,允许用户主动销毁自己持有的代币,从而减少总供应量。此举可能提升剩余代币的稀缺性与潜在价值。项目已在GitHub上开源,并在Hacker News上获得了100点的社区热度。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究精选
Δ-Mem:适用于大型语言模型的高效在线内存
研究人员提出了Δ-Mem,一种专为大型语言模型设计的高效在线内存系统。该系统通过仅存储和更新模型激活的增量变化,而非完整的激活状态,显著降低了内存占用。实验表明,Δ-Mem能将内存使用量减少高达70%,同时保持模型输出的质量基本无损。这一方法有助于在资源受限的环境中部署和运行大规模语言模型,提升其在线推理和持续学习场景下的可行性。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
行业动态精选
杭州基地启用,机器人有了国家级职业技能训练场
国家人工智能应用中试基地(具身智能)5月16日在浙江杭州挂牌启用,为机器人提供国家级职业技能训练场。该基地是集场景体验、技术展示、研发合作、产业赋能于一体的综合性平台,旨在推动具身智能技术从实验室迈向现实应用。杭州市于5月1日施行首部具身智能机器人地方性法规,支持核心研发、平台建设和场景开放。目前杭州已集聚机器人产业相关企业700余家,2025年具身智能产业集群产值达1068亿元。
信息来源:IT之家(RSS)
行业动态精选
研究人员利用Anthropic Mythos工具构建macOS内核漏洞,绕过苹果M5芯片内存完整性执行安全系统
三名研究人员借助Anthropic的Mythos工具,成功开发出一个可绕过苹果M5芯片内存完整性执行(MIE)安全机制的macOS内核漏洞利用程序。MIE是苹果耗时五年、投入巨资为M5和A19芯片打造的旗舰安全功能,旨在彻底消除内存损坏漏洞。研究团队于4月25日发现漏洞,5月1日即完成开发,并亲自前往苹果园区提交报告。该攻击采用纯数据攻击方式,无需操纵指针,仅通过非特权用户的标准系统调用即可获取根权限。完整技术报告将在苹果发布补丁后公开。
信息来源:X:Kim (@kimmonismus) · Claude
行业动态精选
突发!OpenAI 大规模重组,总裁 Brockman 夺权挂帅
OpenAI宣布进行史上最大规模重组,将ChatGPT、Codex和API三大核心产品线合并为统一组织。联合创始人兼总裁Greg Brockman正式全面接管产品战略,成为实际掌权者,而ChatGPT原负责人Nick Turley被调离核心岗位。此次重组旨在整合资源,聚焦"智能体时代",并秘密开发集成多项功能的"超级应用"桌面端产品。与此同时,竞争对手Anthropic估值飙升至9000亿美元,使OpenAI面临严峻挑战。
信息来源:IT之家(RSS) · OpenAI / ChatGPT / Claude
模型发布 / 更新精选
Gemini 3.5:具备行动能力的前沿智能
Google发布了Gemini 3.5模型,该模型专注于提升执行复杂任务的能力。其核心特点是支持"代理式工作流",即能够像助手一样自主规划并执行一系列多步骤、复杂的操作,旨在将先进的语言理解与实际问题解决能力相结合。
信息来源:Google DeepMind:Blog(RSS) · Gemini
产品发布 / 更新精选
Claude Code v2.1.143 版本更新:插件管理与用户体验增强
Claude Code 发布 v2.1.143 版本,重点增强了插件管理功能,包括强制执行插件依赖关系,并新增了插件市场的预估上下文成本显示。为方便直接编辑工作副本,增加了 `worktree.bgIsolation: "none"` 设置。多项体验得到改进:后台会话唤醒后保留模型与努力级别设置;Windows PowerShell 工具默认绕过执行策略;`claude agents` 命令新增多个参数以配置默认会话。此外,本次更新修复了大量错误,包括修复损坏的 `.cre…
信息来源:Claude Code:GitHub Releases(RSS) · Claude
行业动态精选
Anthropic的15亿美元版权和解因法官推迟批准而陷入混乱
AI公司Anthropic达成的15亿美元版权侵权集体诉讼和解案正面临司法审查的延迟。主审法官对和解方案提出质疑,主要原因是代理律师被指控"匆忙"推动这一历史性协议的达成,以谋取高达3.2亿美元的高额律师费。这一争议使得创纪录的和解协议能否最终生效变得不确定。
信息来源:Ars Technica:AI(RSS) · Claude
产品发布 / 更新精选
Krea 2正式上线面向专业用户
从今天起,Krea 2 正式为 Pro 用户上线。
信息来源:X:Krea AI (@krea_ai)
产品发布 / 更新精选
语义代码审查工具clawpatch发布
🩹 clawpatch 0.1.0 已上线: Clawpatch 将代码库映射成语义功能切片,审查其中的错误和质量问题,并记录经过验证的明确修复尝试。 您会发现它能发现的问题之多令人惊讶。 npm install -g clawpatch https://clawpatch.ai
信息来源:X:Peter Steinberger (@steipete)
产品发布 / 更新精选
Runway Agent一键生成完整广告
Runway Agent 让你仅需一次会话,就能从产品照片和想法转变为完全制作完成的广告。 立即通过下方链接开始体验。
信息来源:X:Runway (@runwayml)
行业动态精选
arXiv新规:提交AI生成垃圾内容将遭一年禁令
预印本平台arXiv近期宣布实施一项新的提交政策。该政策针对上传由AI生成的低质量或无意义内容的用户,一经核实,将禁止其在未来一年内向平台提交任何论文。平台一位管理员已在社交媒体上公布了此项新规,旨在打击利用AI工具进行滥竽充数式提交的行为,维护学术交流环境的质量。
信息来源:Ars Technica:AI(RSS)
教程 / 实战精选
Eric Jang - 从零开始构建 AlphaGo
文章以AlphaGo为例,阐述了智能的基本构成要素。AlphaGo至今仍是最清晰、最完整的范例,它融合了三大核心基础:搜索技术、从经验中学习以及自我对弈。这三大要素共同构成了其实现超越人类棋艺的关键路径。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)