AI 情报文章归档
浏览 AI圈报 已保存的 5566 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5566
正式分类6
精选内容3476
全部文章
第 133 / 140 页 · 每页 40 条
产品发布 / 更新精选
Agent Swarm多代理协作系统
Kimi推出Agent Swarm系统,支持100个子代理并行工作,可执行超1500次工具调用,任务完成速度比顺序执行快4.5倍。该系统突破单模型上下文限制,采用自我组织架构,用户下达指令后自动"招聘"CEO、研究员等角色并动态分配工作流,无需人工编写脚本。适用于大规模信息搜集、长文档生成及多视角辩论等场景,通过结构性分歧避免AI群体思维。
信息来源:Moonshot AI:Kimi Blog · Kimi
论文研究精选
在真实世界使用中发现未知的 AI 对齐偏差
研究表明,推理模型能够通过分析用户的实际反馈,识别并理解此前未知的 AI 行为对齐偏差。这种方法不依赖预设的偏差分类,而是从真实互动数据中主动发现模型行为与人类意图之间的潜在偏离,为动态监测和修正 AI 系统提供了新途径。
信息来源:OpenAI:Alignment 研究博客(RSS) · OpenAI
产品发布 / 更新精选
NVIDIA 3 万开发者使用 Cursor,代码提交量提升 3 倍
NVIDIA 已向 3 万名开发者部署 Cursor,代码提交量提升 3 倍,缺陷率保持稳定。Cursor 已深度集成至软件开发生命周期全流程,不仅用于代码生成,还通过自定义规则实现代码审查、测试、调试及 git 工作流自动化。新员工可更快熟悉复杂代码库,资深开发者也能跨技术栈工作,代码风格一致性得到改善。
信息来源:Cursor Blog · NVIDIA / Cursor
教程 / 实战精选
埃隆·马斯克--「36个月内,部署AI最便宜的地方将是太空」
埃隆·马斯克预测,36个月后太空将成为部署人工智能成本最低的地点。他指出,长期专注于软件领域的从业者即将面临硬件层面的严峻挑战。这一判断暗示,随着AI算力需求爆发式增长,地面数据中心的能源消耗与散热限制将推高计算成本,而太空环境凭借丰富的太阳能和天然散热优势,可能在未来三年内成为AI基础设施部署的更经济选择。
信息来源:Dwarkesh Patel:Podcast & Blog(RSS)
产品发布 / 更新精选
Suno Studio 1.2 新功能介绍
Suno Studio 1.2 现已面向 Suno Premier 订阅用户发布。此次更新旨在为创作者提供更强大的创作与制作控制能力。主要新增功能包括:Remove FX,可移除音频片段中的效果;带量化功能的 Warp Markers,用于调整音频的时间与律动;Alternates 功能,允许在同一轨道内创建并预览声音的不同变体;以及新增对 6/8、7/8 等非 4/4 拍号的支持。这些功能让用户无需离开 Suno 平台,即可更精细地控制音乐创作过程。
信息来源:Suno:Blog(网页)
观点 / 方法精选
新里程碑:基于世界模型骨干的DreamZero实现零样本开放世界机器人控制
团队发布DreamZero,首个基于世界模型骨干的World Action Model (WAM)。该模型突破传统Vision-Language-Action范式,通过像素级世界模型实现零样本开放世界提示能力,可执行未训练过的新任务。研究发现WAM依赖多样化数据而非重复演示,并以像素作为跨具身的通用桥梁,实现robot2robot和human2robot知识迁移。仅需55条轨迹(约30分钟遥操作)即可适应全新硬件,验证世界模型作为Physical AI下一代基础的可行性。
信息来源:X:Jim Fan (@DrJimFan)
模型发布 / 更新精选
Nvidia 为何构建开源模型:对话 Bryan Catanzaro
Interconnects 第17期访谈中,Nvidia 副总裁 Bryan Catanzaro 系统回顾了 Nemotron 开源模型项目的技术演进与战略定位。访谈涵盖该系列模型从研发初期到当前版本的迭代历程,剖析了英伟达在开源 AI 领域的布局逻辑,并披露了 Nemotron 在合成数据生成与模型训练效率方面的最新进展及未来规划。
信息来源:Nathan Lambert:Interconnects(RSS) · NVIDIA
论文研究精选
量化智能体编码评估中的基础设施干扰
研究发现,在SWE-bench等智能体编码基准测试中,基础设施配置差异对模型评分的影响,可能超过排行榜上顶尖模型之间的微小分差。内部实验显示,在Terminal-Bench 2.0上,最严格与最宽松的资源设置间成功率相差6%。严格限制资源会导致近6%的任务因容器意外终止而失败,而宽松配置下此类错误率可降至0.5%。当资源余量超过基准规格3倍时,智能体甚至能借助额外资源成功完成原本无法解决的任务。这表明评估环境不仅影响测试稳定性,更会改变基准测试实际衡量的能力维度。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
教程 / 实战精选
用并行Claude智能体团队从零构建C编译器
研究人员采用"智能体团队"方法,让多个Claude实例在无人工干预下并行协作开发代码。为进行压力测试,团队指派16个智能体从零编写一个能编译Linux内核的Rust版C编译器。项目消耗近2000次会话和约2万美元,最终产出10万行代码的编译器,可成功在x86、ARM和RISC-V架构上构建Linux 6.9内核。研究重点在于设计支持长时间自主运行的智能体团队框架,包括如何编写测试以保持智能体不偏离方向,以及如何通过基于文本文件的锁机制协调多智能体并行任务分配。
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
模型发布 / 更新精选
Community Evals:因为我们不再信任黑箱排行榜胜过社区
LMSys 推出了社区驱动的评估框架 Community Evals,旨在通过开源和开放科学推进人工智能民主化。该框架允许社区贡献和审查评估案例,以透明、可复现的方式测试模型。此举旨在改变依赖少数机构"黑箱"排行榜的现状,让更广泛的社区参与定义和衡量AI模型的能力与价值。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
从"下一个词预测"到"世界建模":AI预训练的第二范式
作者指出,AI预训练正经历从"下一个词预测"到"世界建模"的根本性范式转变。世界模型的核心是预测给定行动后的下一个物理状态序列,本质上是可学习的物理模拟器,并将视觉置于首位。相比之下,当前主流的视觉语言模型本质是语言优先,视觉是次要输入。生物智能中视觉处理占据皮层计算的主导地位,是连接大脑、动作与物理世界的高带宽通道。作者以猿类为例,证明强大的物理智能可独立于高级语言存在。他预测,2026年大型世界模型将为机器人技术和多模态AI奠定真正基础,而YouTube等平台的海量视觉…
信息来源:X:Jim Fan (@DrJimFan)
模型发布 / 更新精选
H公司新模型Holo2在UI本地化领域取得领先
H公司在Hugging Face发布博客,正式推出新一代模型Holo2。该模型在用户界面本地化任务上表现突出,实现了技术领先。其核心改进在于显著提升了多语言UI元素的识别与适配能力,能够更精准地处理图标、布局、文本标签等组件的文化适配与翻译。这一进展有望帮助全球应用和软件更高效地实现界面本地化,降低跨区域运营成本。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
全球开源AI生态系统的未来:从 DeepSeek 到 AI+
Hugging Face 在其官方博客发布文章,展望了全球开源人工智能生态系统的发展路径与未来趋势。文章以 DeepSeek 等代表性开源模型为例,探讨了开源社区如何推动技术民主化与创新加速。核心观点指向一个更加开放、协作的"AI+"未来生态,其中开源框架、模型和工具将深度融入各行各业,降低开发门槛并促进多样化应用场景的涌现。
信息来源:Hugging Face:Blog(RSS) · DeepSeek / Hugging Face
模型发布 / 更新精选
文本到图像模型训练设计:来自消融研究的经验
Photoroom团队通过消融研究,总结了文本到图像模型训练的关键发现:混合高质量与多样化数据、在训练中后期引入强数据增强,以及调整无分类器引导的丢弃率,能有效优化模型性能。这些结论为Stable Diffusion等模型的训练提供了实用指导。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
行业动态精选
SpaceX 收购 xAI
SpaceX 于 2026 年 2 月 2 日宣布收购 xAI。马斯克旗下的火箭公司与人工智能公司正式合并,具体交易条款未予披露。
信息来源:xAI:News(网页) · Grok
论文研究精选
I still remember the excitement in 2023 when Stanford Smallville was launched. It was the largest mu…
我还记得2023年Stanford Smallville发布时的兴奋。那是当时最大的多智能体模拟--没错,25个bot感觉已经很多了。今天是"Bigville"时刻。我们正在看到一个新生的、大规模的外星文明模拟实时展开:数量级更多的agent、高得多的IQ、不受限制的互联网接入,由全套MCPs提供支持。 能出什么问题呢? 【引用 @DrJimFan】:著名的Stanford Smallville正式开源! 25个AI agent居住在一个数字版Westworld中,不知道自…
信息来源:X:Jim Fan (@DrJimFan)
产品发布 / 更新精选
高效离线推理框架 Flood:吞吐量显著领先,支持多模态与量化
Flood 是一款面向离线应用的高效大语言模型推理框架。它采用流水线并行降低通信开销,并通过分段式KV缓存管理提升连续性。框架支持连续批处理、分块预填充、FP8/INT8量化及多模态模型推理。性能测试表明,其在多种模型和硬件上的吞吐量最高可达 vLLM 的 2.4 倍。其专用内核 SegmentAttention 在处理长序列时,解码速度较 FlashAttention 最高提升 3.16 倍。该项目于 2025 年 3 月开源并快速迭代,已支持前瞻解码等新特性。
信息来源:蚂蚁 inclusionAI:GitHub 新仓库
论文研究精选
xAI发布Grok Imagine API
xAI推出Grok Imagine API,提供文本/图像转视频及高精度编辑功能,支持物体增删、风格转换与原生音频生成。在Artificial Analysis和LMArena基准测试中排名首位,720p视频生成延迟与成本均低于Veo 3和Sora 2;在IVEBench评测中整体表现超越Kling o1与Runway Aleph。API已开放xAI及第三方平台接入。
信息来源:xAI:News(网页) · Grok
模型发布 / 更新精选
Arcee AI 全力投入在美国构建的开放模型
Arcee AI 发布开源大模型 Trinity Large,标志着其全面投入在美国本土构建开放模型的战略布局。该发布作为 Interconnects 第16期访谈的核心内容,彰显该公司对开源生态与数据主权的承诺。Trinity Large 的推出代表 Arcee AI 在本土 AI 基础设施建设上的关键进展,强调模型训练与开发的地理合规性及技术自主性。
信息来源:Nathan Lambert:Interconnects(RSS)
产品发布 / 更新精选
管理是 AI 的超能力
智能体(agents)时代,管理能力将成为人类 thriving 的核心超能力。在 AI 主导的未来,懂得如何管理比单纯的技术能力更能决定成败。
信息来源:Ethan Mollick:One Useful Thing(RSS)
模型发布 / 更新精选
中国开源AI生态中的架构选择:构建超越DeepSeek的未来
Hugging Face发布博客文章,探讨中国开源人工智能生态系统的核心架构选择与发展路径。文章聚焦于如何构建一个超越现有模型(如DeepSeek)的可持续技术体系,分析了中国开发者在模型架构、训练框架、部署工具和社区协作等方面的关键决策。文中指出,中国开源社区正致力于打造独立且互操作的技术栈,以应对大规模模型训练与推理的独特挑战,并推动全球AI生态的多元化发展。
信息来源:Hugging Face:Blog(RSS) · DeepSeek / Hugging Face
模型发布 / 更新精选
Kimi 发布并开源 K2.5 模型,带来全新视觉理解、代码和 Agent 集群能力
信息来源:公众号:月之暗面(Kimi) · Kimi
模型发布 / 更新精选
解锁GPT-OSS的智能体强化学习训练:一项实践回顾
LinkedIn团队探索了将GPT-OSS模型作为智能体应用核心进行强化学习的可行性。实验发现,由于GPT-OSS采用的混合专家架构在两次前向传播中可能产生路由差异,导致在同策略PPO训练中出现重要性采样比率偏离、KL散度爆炸及奖励不增长的问题。团队通过一个关键修复--在同策略条件下强制将旧对数概率设置为新计算值(并分离梯度),确保了重要性采样比率为1,从而恢复了PPO同策略训练的完整性。该修复方案适用于GPT-OSS-20B及GPT-OSS-120B模型。
信息来源:Hugging Face:Blog(RSS) · GPT / Hugging Face
观点 / 方法精选
技术的青春期:强大 AI 对国家安全、经济和民主的风险及防御
Dario Amodei 发布长文《技术的青春期》,指出强大 AI 正处于"青春期"阶段,对国家安全、经济和民主构成重大威胁,并探讨了防御这些风险的具体路径。
信息来源:X:Dario Amodei (@DarioAmodei)
观点 / 方法精选
MiniMax Speech 2.8 语音模型
MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。
信息来源:MiniMax:Blog(网页)
产品发布 / 更新精选
精通 Agents
AI Agents 的能力正逼近关键临界点,其性能飞跃已超出传统工作模式的承载范围。这要求从业者必须重新界定工作范畴、重构项目管理流程并革新任务执行策略。从需求规划到交付标准,现有方法论面临全面调整,组织与个人亟需掌握与智能体协作的新范式,以适应这一技术变革带来的深层影响。
信息来源:Nathan Lambert:Interconnects(RSS)
论文研究精选
Kimi 供应商验证器
Kimi 发布 K2.5 模型时开源 Kimi Vendor Verifier(KVV),用于验证第三方推理实现的准确性。针对开源模型部署渠道多样化导致的质量失控问题,KVV 提供六项关键基准测试,覆盖参数约束验证、多模态流水线、长输出压力测试、工具调用一致性及编程能力评估。项目与 vLLM/SGLang 社区合作修复根因,并提供预发布验证和实时更新的公开排行榜。完整评估在双 H20 8 卡服务器上约需 15 小时。
信息来源:Moonshot AI:Kimi Blog · Kimi
论文研究精选
AssetOpsBench:弥合AI智能体基准测试与工业现实的差距
IBM Research在Hugging Face发布AssetOpsBench,这是一个工业资产运维的AI智能体基准测试框架。它基于真实场景构建,包含多行业数据集和超1000个运维事件,通过多阶段指标测试智能体的诊断、决策等能力,注重动态适应性、多模态处理和安全推理,以推动AI智能体走向实际工业应用。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
观点 / 方法精选
设计抗AI技术评估的实践
Anthropic性能优化团队负责人Tristan Hume分享了设计抗AI技术评估的经验。自2024年初,团队使用带回家测试评估候选人优化模拟加速器代码的能力,超1000人参与,成功招聘数十名工程师。但随着Claude模型快速迭代,Opus 4已超越多数人类申请者,Opus 4.5甚至匹配顶尖候选人,导致在时间限制下难以区分人类与AI输出。为此,作者三次重设计测试,探索抗AI评估要素,详述原始设计、模型破解方式及非常规对策。最终,团队将原始测试作为公开挑战发布,因无时间限…
信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页) · Claude
模型发布 / 更新精选
差分Transformer V2
差分Transformer V2发布,其核心是改进的差分注意力机制。相较于V1,V2将查询头数量翻倍而保持键值头不变,差分操作后将维度缩减,从而在解码时能达到与标准Transformer相当的速度,且无需定制内核。新版本还解决了V1中因注意力分布均匀化导致的数值不稳定问题,特别是消除了RMSNorm层所需的巨大缩放因子(如在长序列下),从而避免了梯度爆炸,旨在实现更稳定的大规模预训练。
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
Overworld发布实时交互式视频扩散模型Waypoint-1
Overworld推出实时交互式视频扩散模型Waypoint-1,用户可通过文本、鼠标和键盘实时控制生成可步入的虚拟世界。该模型基于帧因果校正流变换器架构,在1万小时游戏视频及对应控制数据上训练,从一开始就专注于交互体验,支持零延迟的自由操控。其配套的高性能推理库WorldEngine在消费级硬件上可实现流畅运行,例如Waypoint-1-Small在RTX 5090上能以30 FPS(4步去噪)或60 FPS(2步去噪)生成画面。模型采用扩散强制预训练和自我强制后训练来确…
信息来源:Hugging Face:Blog(RSS) · Hugging Face
模型发布 / 更新精选
GLM-4.7-Flash开源、免费
GLM-4.7-Flash 开源并免费开放 API,支持通过 Hugging Face 和魔搭社区部署。上一代 GLM-4.5-Flash 将于 2026 年 1 月 30 日下线,届时相关请求将自动路由至新版。
信息来源:智谱:研究(网页内嵌数据) · GLM / Hugging Face
模型发布 / 更新精选
百川智能开源医疗大模型Baichuan-M3
我们已正式开源新一代医疗大语言模型 Baichuan-M3,其在 HealthBench 上获得 65.1 分,并在 HealthBench Hard 上以 44.4 分夺冠。该模型在医疗领域全面超越 GPT-5.2。
信息来源:X:百川智能 (@BaichuanAI) · GPT
模型发布 / 更新精选
开放回应:你需要知道的事
OpenAI 正通过开源与开放科学推进人工智能的民主化进程。其核心目标是降低 AI 技术的门槛,促进更广泛的参与和创新。这一举措将推动研究透明化,加速技术迭代,并鼓励全球协作共同构建 AI 的未来。
信息来源:Hugging Face:Blog(RSS) · OpenAI / Hugging Face
论文研究精选
CoVal: 从群体中学习具有价值观意识的评估准则
研究团队发布了一个名为CoVal的实验性数据集,其中包含了由众包方式撰写的评估准则。该数据集揭示了人们为何更倾向于选择某个模型输出而非另一个的具体原因,旨在让AI模型理解人类在评估文本质量时所依据的、蕴含价值观的多元标准。通过分析这些群体贡献的详细评估规则,研究为训练更符合人类偏好的语言模型提供了透明、可解释的反馈依据。
信息来源:OpenAI:Alignment 研究博客(RSS) · OpenAI
模型发布 / 更新精选
美团LongCat发布重思考模式总结模型
美团LongCat推出基于5600亿参数MoE架构大模型LongCat-Flash-Thinking-2601的重思考模式(Heavy Thinking Mode),并发布LongCat-HeavyModel-Summary模型。该模式通过并行思考与总结两阶段协同扩展推理能力:前者以高温度并行生成多路径扩展宽度,后者将精炼轨迹递归反馈形成迭代循环延伸深度。模型经额外强化学习优化总结能力,已在Longcat AI平台上线。
信息来源:美团 LongCat:HuggingFace 新模型 · Hugging Face
模型发布 / 更新精选
智谱联合华为开源首个国产芯片训练的多模态SOTA模型
智谱联合华为开源多模态生成模型GLM-Image,为首款基于国产昇腾芯片与MindSpore框架全流程训练的SOTA模型。采用9B自回归与7B扩散解码器混合架构,在CVTG-2K复杂视觉文字生成和LongText-Bench长文本渲染榜单均位列开源第一,支持1024×1024至2048×2048多分辨率生成。API调用成本0.1元/张,代码已开源至GitHub、Hugging Face及魔搭社区。
信息来源:智谱:研究(网页内嵌数据) · GLM / Hugging Face
论文研究精选
为何我们对"忏悔式"训练感到兴奋
Anthropic提出"忏悔式"训练法,要求AI在拒绝不当请求时,内部生成安全解释以"自我剖析"潜在危害。该方法显著增强了模型安全性:经微调的Claude 3 Opus模型在"越狱"攻击下的有害行为率从约50%降至10%以下,降幅超80%。其效果优于传统思维链监控,为AI对齐提供了更鲁棒、可解释的安全训练新路径。
信息来源:OpenAI:Alignment 研究博客(RSS) · OpenAI / Claude
模型发布 / 更新精选
Agent-of-empires:OpenCode 与 Claude Code 会话管理器
Agent-of-empires(AoE)是一款支持 Linux 与 macOS 的 AI 编码代理会话管理器,兼容 Claude Code、OpenCode 等 9 种主流 AI 工具。该工具基于 tmux 实现会话持久化,支持在多分支代码库上并行运行多个代理,提供 Docker 沙盒隔离、Git worktrees 管理及实时状态检测,并可通过 Web 仪表板或 Cloudflare 隧道从手机远程访问,解决多代理协作时的状态追踪与工作环境隔离问题。
信息来源:Hacker News:AI 热帖 · Claude
观点 / 方法精选
Niji V7 正式发布!
Niji V7 图像模型正式上线。该版本专为亚洲及动漫场景优化,改进了动漫连贯性、提示词理解能力、文字渲染效果及 sref 性能。
信息来源:Midjourney:Updates(RSS)