AI 情报文章归档
浏览 AI圈报 已保存的 5909 条 AI 情报文章,覆盖模型、产品、行业、论文、教程与观点方法六大分类。
已收录文章5909
正式分类6
精选内容3375
全部文章
第 60 / 148 页 · 每页 40 条
论文研究普通
SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB
SK 海力士在 Hot Chips 2026 大会上披露下一代 HBM 封装路线图,计划借助英特尔 EMIB 等先进封装技术,未来进入 3D 封装阶段。其 HBM4 带宽超 2TB/s,功耗效率较 HBM3E 提升 40% 以上,容量最高 48GB,并正研发混合键合与 I-HBM 局部热点缓解技术以应对散热挑战。
信息来源:IT之家(RSS)
行业动态普通
天工团队回应机器人捂脸跑夺冠:非人为模仿,是它自己迭代出来的
天工 Omni 在第二届世界人形机器人运动会 400 米(小型组)决赛中以 45.66 秒夺冠,其"捂脸跑"跑姿引发关注。研发团队负责人韩刚回应称,并未找人模仿该跑姿,而是机器人在仿真中通过数据迭代自行"思考"出来的方式。天工 Omni 身高 1.35m、整机 39kg,并开放了关节、传感器、系统及运控 API 的二次开发体系。
信息来源:IT之家(RSS)
产品发布 / 更新普通
Codex 修复用量问题并重置所有付费订阅用量
Codex 已向所有账户推送用量重置,并修复了此前发现的多项问题,用户应能感受到明显改善。修复包括长会话多压缩场景下图片使用低效、Computer History 高 p95+ 用量,以及对话标题生成功能消耗超预期。团队还发现一种全新的效率提升方法,将于下周推进。
信息来源:X:Tibo (@thsottiaux)
行业动态普通
Marin 项目成为 AI 开放训练的典范,全程公开代码、数据与实验结果
Andrew Ng 称赞 Marin 项目是 AI 开放训练的典范,代码、数据、配方及实验结果全程公开。该项目本周启动 535B-A23B 模型训练,计划在 11 台 GB200 NVL72 上处理 18.75T tokens,预训练占 80%、中期训练占 20%,总计算量约 2.7e24 FLOPs,为期约 3 个月。
信息来源:X:Andrew Ng(DeepLearning.AI 创始人) (@AndrewYNg)
论文研究普通
AgentX 推理基准:CUDA 护城河能否守住智能体推理
AgentX - InferenceXv3:CUDA 护城河在智能体推理中能否守住?开源 300 万美元数据集,100 万+上下文长度,多轮对话,子智能体 95%+ KVCache 命中率,GB300 NVL72,MI355,B200 https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
信息来源:X:SemiAnalysis (@SemiAnalysis_)
观点 / 方法普通
两个16岁高中生自建"炼丹社",共享显卡和API让全校免费用AI
北京两名16岁高中生张睿修和冯子上成立"炼丹社",将自有的RTX PRO 6000、Mac studio及从公司、高校争取的算力与API额度整合为FreeAPI项目,向全校开放共享API,提供三个对话模型及文本向量、联网搜索、视频生成能力。社团现有30多人,覆盖高一约120人年级的四分之一。两人还计划帮学校重建整合课表、成绩等信息的校园网站,并嵌入AI检索助手。
信息来源:公众号:数字生命卡兹克
行业动态普通
美国得州州长阿博特:AI 数据中心遭民众反对实属咎由自取
得克萨斯州州长阿博特在 ABC《本周》节目中表示,科技公司围绕 AI 数据中心的宣传未奏效,遭民众抵制是"咎由自取"。盖洛普调查显示,七成美国人反对在本地建设 AI 数据中心,其中 48% 强烈反对。阿博特已叫停该州约 1800 个 AI 数据中心项目,并引入新标准保护居民免受基础设施成本影响。
信息来源:IT之家(RSS)
观点 / 方法普通
OpenAI CEO 奥尔特曼:担心人工智能会被少数强势主体掌控
OpenAI CEO 萨姆·奥尔特曼在 David Senra 播客中表示,担心 AI 终有一天会被少数公司、模型或个人控制,让绝大多数消费者在技术塑造世界问题上没有发言权。他同时担心 AI 挣脱人类控制,并认为对后者的恐惧可能导致前者实现。奥尔特曼还称,美国 AI 领导者未能向公众展示技术如何赋予人们更大自主权,并预测将见证有史以来最大规模的小企业创业热潮。
信息来源:IT之家(RSS) · OpenAI
论文研究普通
Industrial-Instruction:从工业技术报告构建指令微调与基准数据集的端到端框架
Industrial-Instruction框架利用906份松下公开技术文档构建了两个开放QA数据集,各含约13.6k问答对。用该数据微调小于10B参数的开源LLM,在松下基准上将Set-Match Accuracy从28.5%提升至42.0%,F1从46.6%提升至63.5%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CyberFactory:用真实世界漏洞实例规模化构建网络安全能力
CyberFactory 是一个统一的开源框架,将数据构建、轨迹合成与模型训练串联起来,覆盖 PoC 生成、漏洞修补和网络安全问答(CyberQA),并把来自野外的 CVE 等漏洞产物转化为可执行、可验证的任务实例。基于该框架训练的模型 Aegis 在 CyberGym 上以一小时预算达到 52.4% Pass@1,较其 Qwen 3.5 基座模型提升 +22.8 分,且推理时无需技能提示。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
AutoSaddler:利用智能体执行轨迹实现自动化的 Harness 优化与持久更新
AutoSaddler 提出一种自动化 harness 优化框架,将 harness 改进视为离线学习问题,通过失败轨迹诊断、结构化补丁生成和基于验证的更新选择,迭代优化智能体外部控制逻辑。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
EchoWM:可进入式全模态世界模型
EchoWM 是一个面向可进入式生成媒体的全模态世界模型,能在持续导航中联合生成 720p 视频、环境音、音乐和语音。它围绕相机意图组织交互,将离散指令和连续姿态映射到共享的度量尺度相对 6-DoF 轨迹,并通过渐进训练和自回归后训练实现长时程生成。评测显示其在公开世界模型基准上轨迹跟随和视觉质量表现优异,支持第一/第三人称交互及同步环境音和语音。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
LongWoF-Bench:用 EvoMap 基因评估可验证的长流程任务
研究团队提出 LongWoF-Bench,含 778 个可机器验证任务,覆盖代码生成、智能体环境合成、数学推理与规则遵循。在 252 个经验证的 Opus 轨迹上,进化得到的 EvoMap 基因在全部 7 个模型中比 Skill 平均高出 8.7-15.5 个百分点,且优势扩展至消费级模型;对 Claude Opus,基因复用还多完成 39 个任务,并减少 9.9% 的推理 token 消耗。
信息来源:HuggingFace Daily Papers(社区热门论文) · Claude / Hugging Face
观点 / 方法精选
AI 智能体应该活多久?
长期运行的 AI 智能体会因上下文累积而注意力衰减、临时指令残留成永久规则,并带来安全风险。建议给日常助手 24 小时生命周期,午夜重置会话,将具体任务委派给只存活 30 秒的单一用途子智能体,并在重置前将持久偏好存入磁盘。
信息来源:Tomer Tunguz 博客(VC 分析)
论文研究普通
AgentRoom:基于CRDT共享工作区的并发多智能体编码协议
AgentRoom提出一种面向并发编码智能体的实时协作编辑协议,通过CRDT合并的共享文件系统,以MCP工具暴露文件级声明、状态与广播。在Python DevBench和Rust+axum的跨语言测试中,2个智能体的AgentRoom比Solo放弃更少任务、运行波动更小;匹配算力时,完整AgentRoom优于并行合并及各部分消融,表明协调机制而非并行或CRDT合并承担主要作用。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
生成式搜索中的上下文分配定律:因果测量与闭环编排
一项新研究指出,RAG 系统在证据利用测量和上下文预算分配上存在瓶颈,并提出因果留一法探针替代标准相关性代理,以准确识别生成依赖。研究发现,单一扩大上下文窗口会因相关性衰减而失效,而跨多次顺序生成迭代分配计算可将组合召回率提升 16.7-20.5 个百分点,且可扩展至 32B 模型。相关代码、数据和因果测量工具已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
ReWorld:具备长时记忆的交互式世界模型
ReWorld 将控制与记忆分离训练并在推理时加以约束,通过混合逐头注意力窗口和随机头路由,让少量全局头关注全部历史,同时以姿态索引地标库支撑有界 KV 缓存。在覆盖动作跟随、长时回忆和视频质量的三轴评测中,ReWorld 对六个近期交互式世界模型取得最佳控制保真度(11.95° 旋转误差)和最佳生成质量,并支持 704x1280 实时视频流。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
无 CoT 数据下,Next-Chunk 推理 RL 真的优于 SFT 吗?混合 SFT 以 60 倍更低算力取得更高 RLVR 上限
一项对照研究重新审视了 next-chunk reasoning RL 在无 CoT 数据上的训练策略,发现简单的 Mixed SFT(单阶段联合训练 no-CoT 与 long-CoT 数据)在 post-RLVR 准确率上限上明显高于 next-chunk reasoning RL,且训练算力需求降低超过 60 倍。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化
Task-CoEvolve 提出一种高效的大语言模型 harness 优化方法,通过让验证任务与 harness 共同演化,解决固定验证集评估成本高的问题。该方法利用方差加权采样聚焦能力边界附近的任务,并基于采样概率估计全量集分数。在在线文本分类和 Terminal-Bench 2.1 上,Task-CoEvolve 匹配全量集搜索的最终性能,同时将优化过程中的评估次数减少 80%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CaRGo-T:因果推理思维图提升多模态幽默理解
CaRGo-T提出一种基于图的推理框架,将多模态幽默背后的因果与上下文关系序列化为代码表示,供视觉语言模型在零样本或上下文学习场景下解读并输出预测。在涵盖讽刺、反讽和表情包的四项数据集上,CaRGo-T较现有推理基线在幽默理解上提升约1-20%,幽默检测上提升1-3%。互信息分析显示其推理表示包含更多与目标输出相关的信息,代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
SWE Refactor Bench:编码智能体能否完成长周期、全仓库的栈迁移?
SWE Refactor Bench 新基准用 20 个全仓库迁移任务、三阶段评估协议(迁移审计、行为测试、智能体验证)衡量编码智能体的迁移能力。8 个前沿模型的 520 次运行中仅 28 次(5.4%)通过全部阶段,最佳模型 claude-opus-5 得分 47.0/100。迁移完整性与行为正确性是两种独立能力,智能体在构建工具链重写得分 31.4,语言重写仅 5.6。
信息来源:HuggingFace Daily Papers(社区热门论文) · Claude / Hugging Face
论文研究普通
Apodex 1.1:面向复杂工作的智能体能力扩展
Apodex 1.1 通过环境扩展与智能体协调训练两条路径,提升模型在文件、搜索和代码环境中的持续可验证工作能力。在专业工作、金融、科研、数学、编码和搜索等任务上,该模型以远小于前沿系统的参数量达到领先性能。35B 参数的 Apodex 1.1 Mini 在本地可部署形态下仍保持较强工作能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Agent-G^2:用高斯引导改进智能体强化学习中的提示深度选择
Agent-G^2 提出一种高斯引导框架,将每个任务的提示深度建模为高斯分布,其中心与方差从已收集的 rollout 中在线估计,无需额外探测 rollout 或学习深度预测器。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降
研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
产品发布 / 更新普通
Prime Agent:一个可自我改进的 RLM 工具框架
Prime Agent 是一个开源的长时程评估与编码智能体工作流工具框架,通过持久化 IPython REPL 和持续工具框架实现程序化上下文处理与测试时计算。该框架将 ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建及自主 nanoGPT 速通等任务上达到或超越原生及主流工具框架的表现。代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究精选
单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性
检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
面向十亿级容量的用户表征学习:迈向"稠密化定律"
针对十亿级规模下原始数据扩展遭遇性能瓶颈的问题,研究提出用户行为稠密化定律,量化数据规模与最小充分分词容量间的关系。实验发现二者对数近似线性,斜率随分词方法和数据源变化。据此开发的ALGN自适应变长分词方法在多种数据源和下游任务上优于现有基线。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
超越稳定性-探索困境:面向LLM策略优化的环境正则化方法
针对大语言模型策略优化中的稳定性-探索权衡问题,研究提出环境正则化策略优化(ERPO),将正则化从动作侧移至输入侧,通过Query-KL项约束查询分布漂移,同时保留探索能力。ERPO可无缝接入GRPO/PPO/REINFORCE等流程,无需额外前向传播。在六个数学推理基准上,ERPO替代标准Policy-KL正则化,在高温解码和长时训练下实现更强准确率和更稳定行为。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
同一智能体不同答案:检索增强问答中语料库引发的答案更替审计
检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MARS:面向竞技编程的多专家 LLM 接力系统
MARS 提出一种纯提示词框架,让每个智能体专精动态规划、图论、字符串等特定算法主题,并通过检索增强生成从算法理论语料中选取相关专家组成小团队协作解题。在 CodeContests 测试集上搭配 Gemma 4,MARS 达到 0.624 的通过率,较直接提示提升 14.4 个百分点,并以 3.3 倍更低的墙钟成本接近 CodeSIM 的 0.731。源码已在 GitHub 开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
RIBOSPAN:面向通用 RNA 建模的长上下文基础模型
RIBOSPAN 是一个 16.1 亿参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt,支持单核苷酸分辨率的完整长 RNA 建模。原生 10K 预训练在 10,240 token 下保持强重建能力,长上下文基准显示其上下文响应与表征分离俱佳,且推理时 YaRN 缩放可恢复短上下文模型直接外推丢失的上下文组织。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
掩码并非模型本身:审计注意力、状态空间与混合序列模型的前缀不变性
一项研究形式化定义了前缀不变性,即位置 t 的表示不得依赖未来输入,并提出一种轻量级审计方法,仅需两次前向传播、无需训练或梯度即可精确定位因果性破坏位置。在八个检查点上的 192 次注入故障试验中,注意力掩码检查未发现任何问题,而该审计方法全部定位成功,并发现 Zamba2 与 Nemotron-H 存在缺陷。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
模型发布 / 更新普通
JoyAI-Echo-1.5:面向持久故事与交互世界的长时程音视频生成
JoyAI-Echo-1.5 发布,这是一个统一的音视频生成系统,包含长视频与世界模型两个变体。长视频变体通过可组合的跨镜头记忆与说话人线索,实现跨镜头的角色外观和语音身份保持;世界模型变体将导航输入转换为 6-DoF 相机轨迹,支持控制器无关的交互。其世界模型变体在 WBench 上以 81.7 的平均分排名第一。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从生成到模拟:世界模型距离真正的模拟器还有多远?
一项基于能力的研究系统评估了生成式世界模型与传统模拟器的差距,覆盖资产构建、物理引擎、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力,并梳理了2018年至2026年6月间的200篇代表性工作。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MobilePA-Bench:面向复杂真实任务的移动端规划智能体评测基准
MobilePA-Bench 是一个交互式、有状态且以工具为中心的评测基准,用于评估移动端规划智能体的工具调用与规划能力。它运行在可执行沙箱中,覆盖 13 个功能域和 212 个真实移动工具,并额外评测子智能体协作、记忆使用和技能调用三个高级维度。实验显示,当前前沿 LLM 在严格工具排序、权限限制和意外运行时错误下性能显著下降。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从智能体轨迹中构建自动机:失败预测与下一步预测
一项研究将LLM智能体的完整轨迹语料压缩为单一紧凑有限状态机(FSM),在12个公开数据集上仅用7-43个状态即可复现数据,保真度不低于0.997,且构建耗时仅毫秒级。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Claude 助数学家破解 1948 年难题
又是一周,又一个开放数学难题被 AI 攻克。 Anthropic 的一位数学家与 Claude 合作,声称解决了一个自 1948 年以来悬而未决的著名数学问题。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
观点 / 方法普通
Fable 5 仅占 Anthropic 付费 token 使用量 6%,定价为 Opus 5 两倍
Anthropic 旗舰模型 Fable 5 仅占其付费 token 使用量的 6%,API 定价为 Claude Opus 5 的两倍,价差正促使企业按任务难度匹配模型。Opus 5 成本仅为 Fable 5 一半,且最大努力模式下在 CursorBench 3.2 上仅落后 0.5%。6 月被迫下架可能永久削弱了 Fable 5 的定价权,并推动客户转向多模型采购。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
行业动态普通
Codex 语音免提编程演示预告
如果你能减少坐在办公桌前的时间,却完成更多工作,会怎样? 提示:你其实已经可以做到 @AlexFinn 明天将来到我们的演播室,展示他如何通过 Codex 中的语音功能实现免手操作--在桌面端和移动端皆可。
信息来源:X:OpenAI Developers (@OpenAIDevs) · OpenAI