AI 论文与研究
整理大模型、智能体、多模态、机器学习与生成式 AI 的论文、基准和研究进展。
分类文章692
当前页4 / 18
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
论文研究普通
Code World Model:编码智能体作为世界大脑
Code World Model 框架将世界演化与视觉呈现分离,由编码智能体生成可执行代码维护持久世界状态并执行规则一致的演化。该框架引入代理表示编码帧级时空约束并编译为代理视频,条件化视频模型渲染高保真视觉观察。微调后的 MiniMax-H3 能遵循编码智能体构建的交互世界中的代理时空规范,同时保留丰富视觉细节。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
TacForcing:利用执行期触觉反馈的流式动作生成框架
TacForcing 提出一种流式动作生成框架,用流式动作专家替代标准动作专家,在动作执行过程中持续纳入实时触觉观测,并引入 Execution-Aware Tactile Attention(EATA)减少触觉采集与动作执行间的时间错配。在六个模拟 UniVTAC 任务和三个真实接触丰富操作任务中,TacForcing 平均成功率分别达 65% 和 69%,均优于强基线。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
StreamPI:为视觉-语言-动作模型引入流式多模态时序建模
StreamPI 提出一种流式多模态时序建模框架,在不增加任何参数的前提下,为 pi0.5 等单帧 VLA 模型赋予时序推理能力。其核心设计包括指令锚定时序建模与随机间隔流式训练策略,支持单帧与多帧推理,并提升异步部署的鲁棒性。在真实机器人任务与 LIBERO 仿真基准上,StreamPI 均优于 pi0.5。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Zero-WAM:利用人类视频实现开放任务泛化的上下文世界-动作建模
Zero-WAM是一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见过的操作任务,将大语言模型的上下文学习范式引入机器人操作。在RoboTwin 2.0模拟的七个未见任务上,Zero-WAM平均成功率达47.0%,较最强视频-动作基线绝对提升29.5个百分点;真实世界评估中可泛化至多物体场景、长时程操作和精细插入任务。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
智能体游戏开发作为可验证轨迹数据引擎,用于扩展世界模型
论文提出扩展世界模型不应仅依赖更多爬取视频和算力,而需递归数据引擎提供 grounded 奖励信号。游戏开发可提供缺失的奖励环境:游戏引擎能高效检查碰撞、物理、可导航性和有界可玩性,并生成真实长程轨迹数据。据此提出 RLHEV(Reinforcement Learning with Human-Engine Verification)后训练范式,结合密集引擎信号与开发过程中隐含的人类接受反馈。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CaSKG:面向可扩展智能体技能检索的反事实因果技能图
CaSKG 提出一种反事实因果技能图框架,在检索前校准程序性关系,通过方向条件反事实探针和贝叶斯平滑构建状态过滤加权图,且不改变下游智能体策略。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Procedura:用程序化控制实现智能体3D建模
Procedura 是一个新型3D建模智能体框架,将对象编写为程序化装配体--一种参数化程序,其命名部件通过类型化、机器可检查的配合关系连接。该智能体从文本提示出发,将对象规划为装配图并逐部分编写程序,通过编译、配合和连通性检查后才接受部件,并由视觉批评器逐项诊断修复。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
JIT-Agent:通过即时框架进化扩展智能体框架智能
JIT-Agent 是一种智能体框架智能模型,可为任意现成智能体大语言模型即时合成任务自适应框架,并支持框架修复与自我进化。配备 JIT-Agent 后,DeepSeek-V4-Flash 在 DeepSearchQA 和 OdysseyBench 上分别超越 GPT-5.6 达 +9.1 和 +4.3 分,GLM-5.2 提升最高达 +20.2 分。
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / DeepSeek / GLM
论文研究普通
VBVR-Pro:可扩展且可验证的原生视觉推理套件
VBVR-Pro 是一个闭环测试平台,通过将视觉生成作为推理媒介,使原生视觉推理可训练、可验证、可优化。它提供 300 个程序化生成任务,训练后的模型在 RISE-Video、MME-CoF-Pro、BabyVision 等七个外部基准上表现强劲;其基于确定性规则的可验证奖励评分器优于主流 VLM-as-a-judge 范式,并支持大规模多任务强化学习。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MA-VLA:面向协作与组合泛化的多臂视觉-语言-动作模型
MA-VLA提出统一的多臂协作框架,将协作行为分解为中层原子提示并分配给各机械臂,实现显式子目标指定与跨任务组合复用。其引入训练时置换机制Arm Shuffle,强制角色无关的指令跟随,支持重组为未见过的协作模式。在仿真与真实世界评估中,先前SOTA VLA模型在未见协作下大多失败,MA-VLA则持续成功,代码、模型与数据已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Video-IFBench:评估多模态大模型在视频理解场景中的指令跟随能力
研究团队推出 Video-IFBench,一个专门评估多模态大模型在视频理解中指令跟随能力的基准。该基准包含四种指令模板、32 种任务类型和 39 类约束,并通过半自动流程构建了 1.5K 样本。对 20 多个近期 MLLM 的大规模评测显示,视频指令跟随对现有模型仍具挑战性,尤其在多约束、语义约束和复杂条件结构场景下。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
时空可组合性编程范式:Cordis 元框架
一篇论文提出"上下文范式",通过可逆效应与反应式共效应机制,将时空可组合性从单一组件推广至整个交错组件系统。该范式在 Cordis 元框架中实现,提供带效应追踪与共效应解析的核心库,以及支持配置协调和热模块替换的声明式组件加载器。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
RetrievalRouter:面向文档检索的模态与架构联合选择
RetrievalRouter 是一种轻量级查询感知路由器,仅依据查询文本即可为每条查询选择最合适的检索流程,在金融和科学语料库上无需静态流程即可兼顾准确率与延迟。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
VoiceMem:面向实时交互的流式双脑记忆架构
VoiceMem 提出一种并行信息左脑与情感右脑的流式记忆架构,为双工语音大模型(SLM)提供实时、精准且具共情力的记忆系统。在 top-5 检索下,其左脑较 Mem0 的 top-200 检索准确率提升近 30 分;右脑在三个人格基准上较此前最优系统总分提升 4.29 分。检索仅耗时 134 ms,不增加对话延迟,支持可替换记忆后端的解耦部署。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
IDEA Prune:生成式语言模型预训练中的集成放大-剪枝流程
Apple 研究团队提出 IDEA Prune,将放大模型预训练纳入结构化剪枝流程,形成集成式 enlarge-and-prune 管线。该研究探讨两个关键问题:即使放大模型从不部署,预训练它是否值得;以及如何优化该流程以提升 token 效率。相比从头训练目标尺寸模型,该流程在有限推理预算下展现出更高的 token 效率。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
PROOF-Gen:从优化数据到更好的知识蒸馏
PROOF-Gen提出用优化后的数据改进工具调用能力的知识蒸馏。在τ2-bench上,教师模型57%的试运行失败,其中三分之二是近失(大部分工具调用正确),而传统生成-过滤流程因失败不提供信号,每轮都会遗留相同的难题。该方法通过利用失败信号优化数据,提升蒸馏效果。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
Luce:面向3D资产生成的可重光照高斯表示
Luce是一种将几何与PBR材质统一在体素化多模态高斯云中的3D表示,为每种模态使用专用高斯原语,支持重光照并集成到标准渲染管线。变分自编码器将该表示压缩为统一的材质感知潜空间,实现高保真图像到3D生成。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
技能是否随语言变化?LLM 跨语言技能一致性研究
一项新研究通过多语言自对弈框架量化了大语言模型在不同语言下的技能差异。研究基于 TextArena 的多语言扩展,评估了三个开源模型在八种语言、六类游戏中的表现,发现同一模型在不同语言界面下展现出显著不同的博弈水平、无效动作率和策略倾向。仅改变中间推理语言即可恢复部分性能损失,表明技能差异是可测量的、阻碍真正多语言模型发展的关键问题。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Prefix Sliding:一种高效测试时扩展的新方法
研究者提出 Prefix Sliding 方法,在推理过程中丢弃非前缀且不在最近数千 token 窗口内的中间推理 token,从而将内存需求限制为常数,支持高效的长时程测试时扩展。无需训练即可让现有模型速度提升 3 倍且保持性能;结合强化学习训练可支持超过十万 token 的推理轨迹,并优于摘要中间 token 或普通滑动窗口方法。代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
V-Rubrics:基于评分标准的强化学习提升视觉忠实度
视觉语言模型常生成与图像证据不符的流畅回答,V-Rubrics 将参考回答分解为原子命题,按视觉忠实度、推理一致性和指令遵循三维度评分,提供结构化部分奖励。研究基于 Qwen3-VL-8B-Instruct 微调,构建 50,248 条训练集,实验显示基于评分标准的 GRPO 优于共享 SFT 基线和仅答案 GRPO,在知识导向和视觉推理基准上提升最大。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
评测框架无中立:同一模型得分31%到89%
新论文揭示评测框架(harness)对模型得分影响巨大:12个开源模型在26种同等合理的配置下回答相同3,679道题,仅改变选项顺序、提示词措辞和答案读取方式,gemma4-31b得分即可从31%波动至89%。配置敏感题目承载了相邻模型间95.7%的差距,4个模型在某种配置下可排第一。基准压缩方法筛选的题目恰是最易受配置影响的,压缩基准实则在挑选脆弱项。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
论文研究普通
无中立基准:配置变化致模型排名大幅波动
一项研究让12个开源权重模型在26种同等合理的基准配置下回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题,仅改变选项顺序、提示词措辞及答案读取方式。gemma4-31b的得分随配置在31%至89%间波动,四个模型在某种配置下排名第一。配置敏感题目承载了相邻模型间95.7%的差距,基准压缩方法筛选出的题目恰是最易受配置影响的。
信息来源:X:DAIR.AI (@dair_ai)
论文研究普通
Prime Agent 技术报告:记忆层级机制解析
Prime Agent 发布技术报告,该 harness 曾助 Opus 5 在 ARC-AGI-3 达 95.5%。其核心机制为记忆层级:模型权重与活动上下文之下,设持久 IPython 会话及磁盘存储的历史、技能与提示词库,模型通过代码在各层级间移动状态。长输入作为 REPL 变量留存,供智能体搜索与转换,将长上下文工作转为信息管理问题。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
Perplexity 便携电脑智能体获英伟达支持
Perplexity 发布本地优先智能体 Portable Computer,搭载端侧 27B 模型,在真实知识工作基准上得分 82.6%,超越开源方案 Pi 和 Hermes;后训练版 PPLX 27B 达 85.4%。Perplexity CEO 感谢英伟达在 DGX Spark 上的合作,并推动开放生态以支持高性价比开源权重模型、推理框架及统一内存硬件。
信息来源:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas) · NVIDIA
论文研究普通
上下文压缩如何破坏智能体安全规则
研究测量了20个生产级智能体配置中上下文压缩的实际破坏效果:Claude Code在Sonnet 4.6上经一轮压缩后仅保留53%的安全规则,五轮后降至10%。其提出的Knowledge Triage方案按类型分类知识库各行并分配独立保留策略,在任意压缩比下多保留2-4倍安全规则,五轮召回率达96%。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Claude
论文研究普通
WebDev-Skills-Bench 评测:Agent 技能是否真的有用
WebDev-Skills-Bench 在 50 个 Web-Bench 项目和 1000 个有序任务上测试 31 个公开 WebDev 技能,发现注入目标技能使平均 Pass@2 下降 1.3% 至 4.2%,token 成本增加 72% 至 394%。对照实验将损害归因于长度干扰和内容误导两类失败模式,且技能排名在模型间迁移性弱。
信息来源:X:DAIR.AI (@dair_ai)
论文研究普通
终端智能体评测:脚手架比模型更影响分数
一项针对命令行环境AI智能体的综述发现,模型外围脚手架(scaffold)对基准分数的影响大于模型本身,系统间差异可测量而模型变体间差异不显著。同一脚手架内更强的模型变体未带来额外解决任务数,仅增加延迟。研究建议将脚手架选择视为一级工程决策。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
NVIDIA ACES:技能文档高分不等于运行时有效
NVIDIA 新论文提出 ACES 评估框架,指出技能文档得分高不代表智能体运行时真能受益--技能主要贡献是发现与工作流顺序,而非最终答案质量。ACES 固定任务、模型、沙箱等变量,仅对比有无目标技能两次运行的奖励差,定义为 Skill Lift。在生产技能实测中,结构与裁判评分与 Skill Lift 相关性仅 −0.0181 和 −0.0266,几乎为零。
信息来源:X:Rohan Paul (@rohanpaul_ai) · NVIDIA
论文研究精选
Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果
Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。
信息来源:Anthropic:Research(发表成果 · 网页) · Claude
论文研究普通
MIT 新工具无需历史数据即可预测极端天气
MIT 研究人员开发出名为 Extreme Event Aware(η-learning)的工具,可生成某地区历史记录中从未出现但统计上可能发生的极端天气事件地图,并附带持续时间、强度和影响面积估算。
信息来源:Artificial Intelligence News(RSS)
论文研究普通
阿里智能体记忆新法:上下文当编程任务
阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · Qwen
论文研究普通
Apodex 1.1 发布,扩展智能体复杂工作能力
Apodex 1.1 扩展面向复杂工作的智能体智能 论文:https://huggingface.co/papers/2608.23283
信息来源:X:AK (@_akhaliq) · Hugging Face
论文研究普通
AutoSaddler:自动优化智能体框架的微软新论文
微软等机构提出 AutoSaddler,将智能体框架视为代码,通过失败轨迹离线自动生成补丁,优化提示词、工具配置和控制逻辑。在 GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 上分别提升 9.0、9.6、10.0 分。研究显示深度调试优于浅层反思,定向编辑优于无约束编辑。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
论文研究普通
加权记忆树:提升长任务智能体推理准确率
论文提出 Weighted Memory Tree,通过为每条记忆打分并在未被选中时衰减其权重,而非简单堆叠记忆层级,来提升长任务 LLM 智能体的推理能力。该方法在多个模型上均优于线性历史和未打分树,同时降低提示词成本并提高准确率。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
语言模型如何评估用户能力与职业偏见
模型对你专业水平的内部估计,会决定它如何回答你,以及是否"录用"你。 语言模型携带一个关于用户能力的单一方向向量,同时驱动回答的复杂度。 这篇论文表明,该估计在因果上中介了行为,但并未证明其承载的人口统计学差异会可靠地以输出歧视的形式显现。 - arxiv.org/abs/2608.20347 标题:"语言模型认为谁是有能力的?职业偏见的机制分析"
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
冻结主干只训投影层:新模态不损原能力
新研究提出"Projector Is All You Train":为语言模型添加新模态只需训练连接编码器与主干的投影层,无需微调模型本身。3D 测试中,冻结主干的模型性能持平或超越联合微调,训练速度快一倍,而联合微调的 Llama 在 GSM8K 上从 86.96% 暴跌至 0.61%。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Llama
论文研究普通
SWE-bench Science:编码智能体难解科学缺陷
新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
论文研究普通
DeepMind 新研究:推理时回灌深层激活可降困惑度
Google DeepMind 新论文提出"Recirculation"方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Gemini
论文研究普通
Best Practice Critic Optimization:一种稳定的基于评论家的强化学习训练方案
BPCO 提出一种结合 DPPO、奖励范围限定的价值预测、蒙特卡洛价值目标、未归一化策略优势及长度自适应广义优势估计的训练方案,以解决基于评论家的强化学习训练不稳定的问题。在 1.5B 至 30B-A3B 混合专家模型的数学推理任务中,BPCO 一致优于强评论家基线,并在每个提示仅采样一个响应的情况下达到或超过基于组采样的基线。该方案同样适用于基于评分标准的奖励学习,代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
FrontierChallenge:评估科学智能体端到端工作流完成度的新基准
FrontierChallenge 是一个跨领域科学工作流基准,包含 300 个端到端任务,论文发布并评估其中 97 个,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学及电化学/环境领域。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face