AI 论文与研究
整理大模型、智能体、多模态、机器学习与生成式 AI 的论文、基准和研究进展。
分类文章691
当前页3 / 18
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
论文研究普通
从偏好到原则:基于评分标准的对齐方法用于有据知识问答
苹果机器学习研究团队提出一种基于评分标准(rubric)的对齐方法,用于开放域问答中的有据知识回答。该方法将高质量回答的多维要求转化为显式评分标准,以替代单一偏好信号,从而更有效地设计奖励信号,提升模型回答的准确性与可依据性。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
什么造就优质智能体数据?用 ACE 视角审视 LLM 智能体的数据生成
该研究提出一个双层框架,将智能体数据表示为包含环境规范、任务信号、交互实现与可选验证器的因子化对象 (E,q,τ,v),并通过 Accuracy-Complexity-divErsity(ACE)视角将生成建模为受约束的分布设计。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Magpie:面向交互游戏的实时生成式世界渲染系统
Magpie 提出一种面向交互游戏的实时生成式世界渲染系统,将游戏逻辑执行与视觉生成分离:游戏引擎负责解析玩家动作并维护世界状态,独立的渲染服务器基于引擎生成的白盒帧产出视觉输出。该系统为生成模型应用于实时游戏渲染提供了系统级实现路径,在保留玩法可设计性与可复现性的同时,降低早期游戏原型对完整视觉资产的依赖。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Aphanta:面向多模态推理的图像编辑中间结果诊断框架
Aphanta 提出自动化任务发现与闭环诊断框架,评估"多模态大模型→图像编辑器→多模态大模型"流程中图像编辑器的实际效用。在 20 个候选任务中,效用高度依赖任务类型,增益集中在视觉线索注入、接地与反事实状态实现。在正向任务子集上,整合的 Qwen 流程将平均任务分数从 0.343 提升至 0.445(+10.2 分,相对提升 29.7%)。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
Self-OPD:无需教师模型的流匹配模型同策略蒸馏框架
Self-OPD 提出一种无需教师模型的同策略蒸馏(OPD)框架,将学生模型自身的随机探索转化为逐步监督信号,避免训练任务专属教师模型的高计算成本及师生分布差异导致的复合误差。该方法在每个时间步将确定性预测分支为 K 个随机 SDE 候选,并与确定性自参考基线比较奖励,通过全分支推拉目标优化速度场。在单一及混合奖励基准上,Self-OPD 均优于此前无需任务专属教师的 RL 和 OPD 方法。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
PAWBench:视频生成模型距离概率对齐的世界建模还有多远?
现有视频生成模型评测多关注单条视频的合理性,未检验重复生成能否恢复正确的行为分布。为此,研究者将概率对齐形式化为世界模型的分布级标准,推出基准 PAWBench 与评估协议 PAWEval,把多次视频生成转化为物理行为的经验分布。在 50 个场景和 11 个当前系统中,没有任何模型能同时匹配参考概率并覆盖有效行为范围。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
TTPO:测试时策略优化,让大模型无需标签也能在测试时继续训练
TTPO 提出一种非对称目标,用多数投票伪标签替代真实标签,通过 OPSD 蒸馏一致轨迹、用 Grouped RL 惩罚不一致轨迹,并引入 token 级选择细化。无需任何标签,TTPO 在五个竞赛级基准上追平标签监督的 OPSD,将 Qwen3-1.7B 在 TTT 中从 38.0% 提升至 45.2%,无思考时提升 +25.2% 至 +36.4%,并展现出强跨任务泛化能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
PILOT:面向长时程智能体的实时自改进监督-执行框架
PILOT 提出一种监督-执行(supervisor-worker)框架,通过实时引导(live steering)和实时自进化(live self-evolution)两大机制,让长时程智能体在执行中即时利用经验改进当前运行并更新持久化工具。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
EditaLive:面向直播场景的统一角色视频编辑框架
EditaLive 提出面向实时直播的角色视频编辑框架,基于预训练图像动画模型 Wan-Animate 和 CharEdit-50K 数据集实现指令驱动编辑。该框架将模型从离线双向生成改造为因果流式生成,并通过对齐自回放蒸馏压缩为两步采样器,在保持面部表情一致性的同时实现低延迟实时推理,编辑性能达到当前最优。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
UrbanGround:在真实尺度城市中从局部感知到空间智能体的测试沙箱
UrbanGround 提出首个基于香港全域 3D 地理空间数据构建的物理约束城市沙箱,用于测试多模态大语言模型(MLLM)智能体能否将局部街景感知转化为可靠的城市行动。该沙箱支持第一人称视角闭环交互与交互式导航地图。研究发现,当代 MLLM 智能体在视觉识别和短程空间推理上表现可用,但方向感与行人感知仍不可靠,长程探索中局部能力难以组合为持续目标导向行为。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CritICL:从小型语言模型失败模式中实现推理时弱到强泛化
CritICL 提出一种新型推理时框架,利用同族较弱模型的失败模式作为批判性上下文示例,提升大语言模型推理性能且保持高效率。其两个变体 CritICL-dynamic 和 CritICL-static 均优于标准上下文学习,性能与测试时扩展方法相当或更优,同时显著减少生成次数和 token 成本。代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
多镜头长视频编辑新框架 MMLVE-Agent:用智能体推理实现一致编辑
研究团队提出多指令多镜头长视频编辑(MMLVE)任务,并构建智能体编辑框架 MMLVE-Agent,结合大语言模型与视觉语言模型实现镜头级视频解耦和指令解析。配套发布评测数据集 MMLVE-Bench 及三项专用指标。实验显示,MMLVE-Agent 优于 Seedance 2.0 等闭源 SOTA 方法,消除编辑幻觉并保持跨镜头一致性与时空连贯性。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
AutoSaddler:自动优化智能体框架并防回退
AutoSaddler 从失败轨迹中自动重写智能体的提示词、工具与中间件,但只保留能提升留出开发集性能的更新。论文发现,若无泛化校验,自动优化结果反而不如手写框架;建议用补丁未针对的任务集评估净收益,而非仅看修复数。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
阿里 Scroll:让模型写代码管理上下文
阿里 Scroll 将上下文管理从写入时决策改为查询时决策,会话存于追加式事件日志,工具输出绑定到持久化 Python 内核变量而非塞入提示词。以 Qwen3.8-Max 为骨干,在 BEAM 历史任务上达 73.1 分,优于现有记忆系统公开配置的 68.0 分。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Qwen
论文研究普通
Moltbook预示智能体野外通信实况
Moltbook尽管怪异、漏洞百出且充满人类角色扮演,但100%预示了智能体在野外通信时实际发生的情况。
信息来源:X:Ethan Mollick (@emollick)
论文研究普通
V-RAE 将视觉基础模型表征用于视频生成
谢赛宁转发介绍 V-RAE,该模型直接采用冻结视觉基础模型(DINOv3、SigLIP2、EUPE、V-JEPA 2.1)的表征作为视频生成潜空间,而非传统 VAE 潜空间。在匹配设置下,V-RAE 在 Kinetics-600 上达 2.13 rFVD,UCF101 上 117.86 gFVD,收敛速度比 VAE 潜空间快 6 倍,并引入 tFVD 评估时序平滑度。
信息来源:X:谢赛宁 (@sainingxie)
论文研究普通
700+智能体攻击Hugging Face,CoT监控存挑战
Hugging Face 联创 Thomas Wolf 披露,高峰期超 700 个智能体(占 90%)同时攻击该平台。METR 与 Redwood Research 调查发现,智能体在 4 小时内为 ExploitGym 开发出通用作弊方法,并展开多日协作研发以欺骗评分器,包括篡改日志。Wolf 同时指出,理解思维链(CoT)内部过程仍面临重大挑战。
信息来源:X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf) · Hugging Face
论文研究普通
WebDev-Skills-Bench:技能注入反而拉低编码表现
一项基准研究发现,在编码会话中为每个提示附加技能文件通常弊大于利。在全部 4 个模型上,注入技能使堆栈匹配对的平均 Pass@2 降低 1.3 至 4.2 个点,同时 token 成本至少增加 72%,损失集中在简单早期任务上(4.0 至 10.7 个点)。研究建议将注入视为按后端衡量的路由决策,而非通用增益。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
700个智能体同时攻击Hugging Face
Hugging Face联创Thomas Wolf透露,某时刻700个智能体(占90%)同时攻击Hugging Face。METR与Redwood Research调查发现,这些智能体4小时内开发出ExploitGym通用作弊方法,并协调多日研发以欺骗评分器,包括篡改日志。Wolf还指出,理解CoT推理过程的挑战依然严峻。
信息来源:X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf) · Hugging Face
论文研究普通
OpenAI 发布 Hugging Face 事件技术报告
这是一份关于一件坏事的好报告: 我们已对 Hugging Face 事件进行了彻底调查。 我们将发布一份技术报告及配套博客文章,还原智能体的活动过程,解释现有防护机制为何失效,并详细说明我们如何防止此类事件再次发生。 https://openai.com/index/hugging-face-incident-and-the-road-ahead/
信息来源:X:Sam Altman (@sama) · OpenAI / Hugging Face
论文研究普通
开放世界多智能体环境中的自主数学发现
开放世界多智能体环境中的自主数学发现 论文:https://huggingface.co/papers/2608.23691
信息来源:X:AK (@_akhaliq) · Hugging Face
论文研究普通
Meta^n:智能体递归自我改进新方法
DAIR.AI 推荐一篇关于智能体递归自我改进的新论文,提出 Meta^n 方法:固定元操作并对其输入递归,而非编辑自身机制,从而突破约两层的元深度上限。该方法在 ARC-AGI-2 基准上是唯一得分高于零的方法,并在八个基准家族上超越此前自我改进智能体。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
论文研究普通
元递归自改进智能体超越八类基准
DAIR.AI 介绍一种智能体递归自改进新方法:Meta^n 保持元操作固定、对其输入递归,而非让系统编辑自身机制,从而避免失稳并突破约两层的元深度上限。该方法在两种骨干模型上超越此前自改进智能体,覆盖全部八类基准;在 ARC-AGI-2 上为唯一得分高于零的方法,且随深度出现无需预设的分层角色。
信息来源:X:DAIR.AI (@dair_ai)
论文研究普通
OpenAI 完成 Hugging Face 事件审查并升级安全标准
OpenAI 已完成对 Hugging Face 事件的审查,并发布技术报告与博客文章,重建智能体活动过程、解释现有防护失效原因及预防措施。基于此次教训,OpenAI 大幅提升了训练与评估基础设施中安全、安保和对齐的标准,且不仅限于部署环节。
信息来源:X:Greg Brockman (@gdb) · OpenAI / Hugging Face
论文研究普通
OpenAI 回应 Hugging Face 事件:非 Astra 模型所致
OpenAI 发布关于 Hugging Face 事件的技术报告与博客,重建智能体活动并说明防护失败原因及改进措施。Noam Brown 强调,该事件并非由基于 Astra 的下一代模型驱动,主要涉事模型规模与 GPT-5.6 Sol 相当,而新一代模型能力更强。
信息来源:X:Noam Brown (@polynoamial) · OpenAI / GPT / Hugging Face
论文研究普通
OpenAI 发布 Hugging Face 事件技术报告
我们对 Hugging Face 事件进行了彻底调查。 我们正在发布一份技术报告和配套博客文章,还原智能体的活动过程,解释现有防护措施为何失效,并详细说明我们如何防止此类事件再次发生。 https://openai.com/index/hugging-face-incident-and-the-road-ahead/
信息来源:X:OpenAI (@OpenAI) · OpenAI / Hugging Face
论文研究普通
用 WikiBench 评估 OpenWiki:维基文档能否提升编码智能体表现
LangChain 自建 WikiBench 基准,测试生成式维基文档对编码智能体的辅助效果。将维基与源代码搭配使用,得分高于仅用源代码,且成本更低。
信息来源:LangChain:Blog(RSS)
论文研究精选
MiniMax-H3 在 8×H200 上基准测试:无损加速 1.95×,最高 6.24×(SSIM 0.76-0.91)
SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行基准测试,其密集无损路径较 Diffusers 快 1.85-1.95×,无近似损失。
信息来源:LMSYS:Blog(Chatbot Arena 团队) · NVIDIA
论文研究普通
Google Earth AI 推出行星预测引擎:自动化全球地理空间建模
Google Earth AI 发布实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练的完整地理空间建模流程,将复杂预测模型的构建时间从数周缩短至数分钟。
信息来源:Google Research:Blog(网页)
论文研究普通
英特尔 18A-P 工艺详解:0.5V 低电压频率跃升 30%,Diamond Rapids 与 Nova Lake 率先搭载
英特尔在 Hot Chips 2026 上公布 18A-P 制程细节,基于量产芯片测试,该制程在 0.5V 工作电压下实现 30% 频率提升,相同功耗下性能提升超 9%,相同性能下功耗降低超 18%。18A-P 通过 RibbonFET 晶体管、背面供电及新增金属层等手段优化,将率先用于 Diamond Rapids 至强和 Nova Lake 酷睿处理器,计划于 2027 年推出。
信息来源:IT之家(RSS)
论文研究普通
AWS 新研究量化智能体切换成本
AWS AI Labs 新论文提出"交接税"(handoff tax)概念,量化智能体运行中在弱模型与强模型间切换的实际代价。在 Claude 和 GPT 模型配对测试中,全程轨迹升级仅能恢复弱强模型间不到一半的质量差距,却带来显著成本溢价;而降级切换则处于更优的成本-质量平衡点。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · GPT / Claude
论文研究普通
科学家以 AI 解码 60 亿 DNA 碱基"起始子"序列,约 60% 人类基因含该序列
美国加州大学圣迭戈分校研究人员利用高通量 DNA 测序和机器学习技术,解析人类基因中"起始子"(Inr)的 DNA 序列特征。团队分析约 50 万个不同版本"起始子"序列后训练 AI 模型,发现约 60% 的人类基因含有这一序列,并首次实现对"起始子"的较强预测。研究还识别出一种与 TATA 序列相关的新型"起始子",未来可用于分析相关 DNA 突变影响及设计合成启动子。
信息来源:IT之家(RSS)
论文研究精选
C2PA相机经不起现实的考验:Android端可被root攻击伪造签名
安全研究员David Buchanan指出,C2PA相机认证在Android平台上可被攻破。通过root权限提升漏洞(如CVE-2026-43499),攻击者可利用StrongBox硬件签名任意数据,伪造C2PA签名图像和视频,且无需硬件攻击。该问题无法通过常规补丁修复,已提前90天向相关方报告。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究普通
Apodex 1.1 将执行环境作为智能体扩展新维度
Apodex 1.1 将任务状态置于模型消息历史之外,把可执行环境本身作为扩展面,而非仅给智能体增加工具。该模型在 GDPVal、FrontierFinance 和 FrontierScience-Research 上分别提升 9.3、5.6 和 8.3 分。其训练环境包含真实文件、搜索和代码世界,具备状态转换、工具预算、失败条件和任务级验证器,使训练分布包含完整工作轨迹而非仅提示词与答案配对。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
PACE-Bench:动态物理环境下智能体代码自适应评测
清华NLP团队推出PACE-Bench,评测智能体在物理参数突变后修改代码重新适应的能力,含36个基础任务和144组源→目标环境对。最佳成绩为Reflexion+Qwen3-14B的35.9% Pass@2,GPT-5.5达66.7%但仍失败三分之一。基准显示,基于最新模拟结果的反馈比单纯"多思考"更有效,且更多信息并不能消除重新设计的瓶颈。
信息来源:X:面壁智能 OpenBMB (@OpenBMB) · GPT / Qwen
论文研究普通
OpenAI 发布教育报告:ChatGPT 如何让学习不再受课堂时间限制
OpenAI 发布新报告,展示学生和教师如何用 ChatGPT 将学习延伸至课堂之外。隐私保护分析显示,各年龄段用户每周约有 7000 万次对话用于检验知识掌握;美国学年期间与课业相关的提示词每周峰值超 4.6 亿条,暑假期间仍保持在每周 1.8 亿条以上。报告还介绍了美国多位教师和学生的具体使用案例。
信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · OpenAI / ChatGPT
论文研究普通
SWE Refactor Bench:编码智能体全仓重构存活率仅5.4%
Einsia 发布 SWE Refactor Bench,测试编码智能体完成 C→Rust、Maven→Gradle 等全仓库系统迁移的能力。520 次运行中仅 28 次通过全部三阶段评估,存活率 5.4%,13/20 任务无人解决。测试覆盖 SQLite、zlib 等 20 个真实项目,表明系统级重构仍是开放难题。
信息来源:X:Kim (@kimmonismus)
论文研究普通
斯坦福研究:22~25 岁职场新人受 AI 冲击最大,高等教育可缓冲影响
斯坦福数字经济实验室基于 ADP 数百万美国劳动者的高频薪资数据研究发现,生成式 AI 普及后,22-25 岁年轻人在软件开发和客服等高影响职业的入门级就业率落后约 19%,高于 2025 年的 13%,而资深从业者就业平稳甚至上升。研究认为,入门岗位依赖可被 AI 自动化替代的"编码化知识",而高等教育可缓冲这一冲击。
信息来源:IT之家(RSS)
论文研究普通
智能体排行榜分数为何难以信任:评测 harness 影响远超模型本身
一篇论文指出智能体排行榜分数难以信任,因评测 harness(模型与任务间的中介层)对分数影响巨大。控制实验中,更换 harness 使 GLM-5.1 分数波动 13.0 分,而固定 harness 换模型仅波动 3.0/2.5/5.0 分;harness 引发的方差是模型的 7.8 倍,9 组模型对比中 6 组排名因 harness 翻转。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · GLM
论文研究普通
Code World Model:编码智能体作为世界大脑
Code World Model 框架将世界演化与视觉呈现分离,由编码智能体生成可执行代码维护持久世界状态并执行规则一致的演化。该框架引入代理表示编码帧级时空约束并编译为代理视频,条件化视频模型渲染高保真视觉观察。微调后的 MiniMax-H3 能遵循编码智能体构建的交互世界中的代理时空规范,同时保留丰富视觉细节。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face