AI 论文与研究
整理大模型、智能体、多模态、机器学习与生成式 AI 的论文、基准和研究进展。
分类文章692
当前页5 / 18
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
论文研究普通
评估许可究竟意味着什么?Inspect Evals 提交级快照中的声明相对推理普查
一项针对 Inspect Evals 全部 124 个评估单元的普查显示,其中 110 个因缺乏所需历史证据或语义基础而无法进行确定性推理。该审计通过冻结基底、基础族与声明查询的形式化框架,对评估声明与指标之间的许可关系进行了分类,输出类型化停止点、不稳定见证与稳定子结构,而非单一的稳健性标签。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
LibriBrain100:百小时宽深 MEG 数据集,推动神经语音解码规模化
LibriBrain100 发布,将原有 MEG 语音解码数据集规模扩大一倍以上,提供超 100 小时自然连续语音聆听数据。其中单被试 80 小时数据创下深度内被试神经数据新纪录,为同类数据集的 8 倍;基于现有解码模型,该数据集在词分类基准上取得 SOTA 表现。数据集附带标准划分、开源 Python 库及公开排行榜竞赛,旨在加速非侵入式脑机接口研究。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Game2World Engine:解锁野外游戏视频用于世界模型训练
研究团队提出全栈框架G2WEngine,自动提取并合成UI覆盖层,构建含96K合成视频和1,079段野外片段的Game2World数据集。基于该数据训练的GameCleaner模型在UI去除任务上平均AAR达95.36,较最强时序掩码基线提升57.3%;使用去UI数据训练的世界模型VideoReward提升6.83%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
D^3-MOPD:面向高效多教师蒸馏的自适应动态域调度
D^3-MOPD 提出一种零开销调度器,利用训练中已有的逐域反向 KL 信号在线调整数据混合比例,解决固定混合在域收敛速率差异下的算力浪费问题。在 Qwen3.6-35B-A3B 学生模型从四个域专家教师蒸馏的实验中,该方法将平均学生-教师性能差距缩小 97%(vanilla MOPD 为 63%),以约 3 倍更少的 rollout 步骤达到相同峰值性能,并在七项基准中三项超越专家教师。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
MemUse:将长期人机对话中的记忆评估从直接问答转向自然融入
一项为期4个月、涉及40名用户和1,872次会话的部署研究发现,现有记忆基准的Direct QA准确率在7种条件下介于19.7%至70.1%之间,但与用户满意度无关。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CAFE:自我改进的搜索智能体需要共同进化的反馈
CAFE(Coupled Agent--Feedback Evolution)提出一种共享参数模型交替扮演搜索智能体与评论家的框架,通过在线RL与离线偏好优化耦合,让反馈随策略共同进化。在七个智能体搜索基准上,CAFE平均优于所评估的基于RL的搜索智能体,在全部六个域外基准上保持收益,并减少答案级幻觉。消融实验表明,仅改进智能体或仅改进评论家最终会陷入平台期,而交替更新两者可持续提升性能。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MoTE:面向多任务视频理解的任务专家混合解码器架构
论文提出MoTE(Mixture of Task Experts)解码器架构,将大语言模型的前馈网络转换为任务特定专家,同时共享多模态主干网络。实例化模型VideoLLM-MoTE在五个COIN基准上采用显式任务路由,五专家模型每样本激活约2B LLM参数,平均top-1准确率超过近期VideoLLM基线,并优于密集全专家激活与学习式稀疏路由。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
OPDVR:无需额外超参数的无监督策略蒸馏与可验证奖励结合方法
研究者提出 On-policy Distillation with Verifiable Reward(OPDVR),将基于可验证奖励的强化学习(RLVR)与在线策略蒸馏(OPD)无缝结合,无需引入任何额外超参数。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Recuris:面向长时程智能体的递归经验-工作记忆演化架构
Recuris 提出递归经验-工作记忆架构,让工作记忆跟踪任务进度并引导技能选择,将执行转化为结构化证据,由固定元智能体对技能记忆进行局部验证更新,形成有界递归演化循环。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Luce:面向3D资产生成的可重打光高斯表示
Luce提出一种将几何与PBR材质统一到体素化多模态高斯云中的3D表示,通过变分自编码器压缩至统一潜在空间,再由修正流Transformer从单张图像生成。在Toys4K上,Luce实现SOTA单图转3D生成,FID较最强基线提升28%;在AI生成图像基准上,CLIP图像对齐分数达0.8519,优于基线0.8299。Luce可生成保留文字、标志等细节的可重打光资产。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Meta^n:通过涌现深度实现递归自我改进
Meta^n 提出一种固定元操作 Ω 并对其输入递归的自我改进方法,将元深度从约两层扩展至由收敛决定的动态深度。在两种骨干模型上,Meta^n 在全部八个基准家族上超越此前自我改进智能体,其中在 ARC-AGI-2 上唯一取得非零分数。消融实验显示,递归收益主要来自各层传递给下一层的条件,且深度增加时会涌现出不同层角色。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
当"必须"变成"也许":LLM 智能体工作流中的约束弱化
一项针对 LLM 智能体工作流的研究发现,交接转换会反复将"必须解决"的约束弱化为"仅供参考"的非约束信息。在 1,296 个受控合成场景中,正常交接压缩导致 100.0% 的约束失效和 54.2% 的违规动作;恢复全部四个状态字段可将约束保持率提升至 100.0%,违规动作降至 0.0%。下游验证虽能消除违规动作,但约束失效仍达 95.3%,表明语义可用性并不保证操作层面的状态保持。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
STARFlow2:用归一化流桥接语言模型,实现统一多模态生成
STARFlow2 提出将自回归归一化流与语言模型统一,用于多模态生成。该方法观察到自回归归一化流与 LLM 共享因果掩码、KV-cache 机制和从左到右结构,从而弥合文本与图像生成的架构差异,避免离散 token 化带来的视觉保真度损失。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
DiffusionOPSD:扩散模型的在线策略自蒸馏框架
DiffusionOPSD 提出一种在线策略自蒸馏框架,将图像级奖励引导转化为采样查询点上干净输出预测的显式目标。在 SD 3.5-M 和 Z-Image-Turbo 上,该方法在 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,相比最强竞争方法最高提升 44.0%,训练 GPU 小时数较 DiffusionNFT 分别减少 40% 和 63%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Gated Recurrent Transformer:用循环调制在 Transformer 中实现表达性深度
Gated Recurrent Transformer 提出一种循环深度 Transformer,以固定深度前奏与尾声块包裹单一共享核心并迭代 R 次,通过轻量投影和逐元素更新门调制循环更新。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从看见到行动:智能眼镜如何成为第一人称智能平台
一篇系统综述首次以统一框架研究智能眼镜,将其定位为连接人类感知、持久上下文与数字或物理行动的第一人称智能平台。文章沿八项可验证硬件能力轴刻画设备,围绕七项基础能力组织文献,并提出L0-L5分级框架,涵盖采集、反应式感知、上下文辅助、持久状态、受控行动与具身耦合。综述还给出九维部署框架、基于主张的评估协议及证据阶梯,覆盖九个应用场景。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
LAION-BVD:面向多模态预训练的千万小时级开放视频数据集
LAION 团队发布 LAION-BVD,一个包含 1.3B 条平台视频 URL、下载 80M 段视频、总时长 1000 万小时的大规模开放视频数据集,面向视频、音频和图像多模态预训练。基于该数据训练的模型在视频-文本和音频-文本基准上表现具竞争力,且性能随训练或模型规模提升而持续增长。数据集已向研究社区开放。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
The Handoff Tax:LLM 智能体延续非原生轨迹的代价
研究用 Claude 与 GPT 家族的 LC/HC 模型配对,考察编码智能体在模型间切换时"交接税"的影响。完整轨迹升级仅能弥补不到一半的 LC 到 HC 质量差距,且成本显著增加;降级切换则性价比更优。交接方向还会改变最优接口选择:减少 LC 轨迹信息可提升升级质量,而移除 HC 轨迹会降低降级质量。
信息来源:HuggingFace Daily Papers(社区热门论文) · GPT / Claude / Hugging Face
论文研究普通
WarpSAC:重新思考探索与利用,迈向可扩展离策略强化学习新高度
WarpSAC提出一套数据体制感知的离策略强化学习算法族,通过受控实验揭示参数归一化、裁剪双Q等稳定器在不同数据规模下的适用性。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
GameWAM:面向视频游戏的 World Action Model
GameWAM 首次将 World-Action Model 引入原生闭环游戏玩法与 GUI 控制,通过并行视觉与动作生成、块因果条件及流匹配,联合预测未来视觉观测与可执行的键鼠轨迹。实验显示其以更少的原生动作数达到与对比智能体相当的任务成功率,并揭示了生成式控制中低频动作源成分系统性影响相机粗粒度运动的 LASI 失效模式。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
AnTrap:Android GUI 智能体在动态对抗环境中的鲁棒性评测基准
AnTrap 基准通过向智能体执行轨迹注入动态扰动,系统评估 Android GUI 智能体对运行时异常的鲁棒性,将真实异常分为状态、思考、动作和回合四层共十个细分类别。对 16 个主流模型的评测显示所有模型均存在普遍脆弱性,最强模型也出现显著性能下降;GRPO 训练实验表明,状态死锁等深层上下文陷阱无法仅通过在含陷阱环境中训练解决。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
RubSE:用评分规则作为视觉修复上下文实现UI到代码生成的自进化
RubSE框架通过将视觉反馈表示为结构化评分规则上下文,解决了大视觉语言模型在UI到代码生成中测试时自进化不稳定的问题。该方法每轮生成候选规则、选择优先修复目标并保留历史,引导修订聚焦于明确范围。在六个VLM和三个基准上,RubSE显著优于朴素自进化,轨迹更稳定且能缓解崩溃、提升对严重视觉回退的恢复能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
LAWA:用潜在动作作为意图,让世界动作模型高效想象未来
LAWA 用紧凑潜在动作表征未来意图,在不生成未来观测的情况下实现高效测试时未来想象,省去未来视频分支。在 RoboCasa 上,LAWA 在少样本和全数据设置下平均成功率分别达 65.6% 和 80.8%,比 Fast-WAM 基线高 9.6 和 4.5 个点,同时推理延迟比 Joint-WAM 低 42.9%,并在 LIBERO-Plus 和真实任务上表现稳健。代码和模型将开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
长程规划智能体:预训练与OPD蒸馏研究
论文发现,后训练无法修复薄弱的长程规划基础:噪声轨迹会累积错误,稀疏奖励导致信用分配不当,冲突教师引发遗忘。研究建议优先训练清晰世界模型和长轨迹,奖励信号过稀疏时采用OPD(on-policy distillation),并避免合并规划策略不兼容的教师。OPD在长程噪声场景下优于结果奖励GRPO,因教师反馈贯穿整个轨迹而非仅在末端。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制
研究团队分析 PubMed Central 上 119 万余篇英文生物医学论文发现,2025 年约 77% 的论文出现 AI 辅助写作或编辑特征,较 2023 年的 19% 和 2024 年的 52% 大幅提升。讨论部分使用比例最高(约 78%),韩国、中国等非英语母语地区超 80%。研究呼吁建立完善使用规范和监管机制,以应对 AI 生成虚假事实及披露不足等风险。
信息来源:IT之家(RSS)
论文研究普通
斯坦福研究:AI 对入门级岗位冲击最大
斯坦福大学经济学家最新研究显示,AI 正导致部分领域年轻员工的入门级岗位显著流失,而年长员工迄今基本未受影响。在 AI 暴露度最高的职业中,22 至 25 岁员工的就业水平已比低暴露领域同龄人低 19%,高于去年的 13%。
信息来源:Ars Technica:AI(RSS)
论文研究普通
加权记忆树:为长时运行智能体引入可恢复记忆
DAIR.AI 介绍一种名为加权记忆树的新方法,为长时运行智能体实现可恢复记忆。它将执行组织为任务、子任务和动作,并为每条记忆赋予动态保留分数,事件更新提升分数、选择衰减降低分数。在 GAIA-Text 上,该方法搭配 Qwen3-8B、Gemma 4 E4B 和 Llama-3.1-8B,平均比线性记忆高出 9.97 分,同时提示词 token 使用量减少 32.8%。
信息来源:X:DAIR.AI (@dair_ai) · Qwen / Llama
论文研究普通
终端智能体综述:对比为何矛盾
一篇关于终端智能体的不错综述。 它很好地介绍了终端智能体究竟是什么,以及为什么各种工具(harness)对比的结果总是相互矛盾? 论文:https://arxiv.org/abs/2608.20485 在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai/
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
论文研究普通
ASI-Bench:步骤比方法名更决定智能体表现
ASI-Bench 用 60 个真实科研项目、11 个科学领域测试研究智能体,仅改变指令内容。18 种智能体与模型组合下,完整步骤提示平均得分 50.91,仅给方法名降至 29.10,再删方法名仅再降 2.5 分。仅方法名提示还多耗 59% token,因命名方法既限制方向又迫使智能体重建全部实现细节。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
逆向工程发现 MS Paint 和"照片"为本地 AI 生成图片添加不可见 GUID 水印
逆向工程显示,MS Paint 和"照片"应用会将服务器下发的 GUID 以不可见方式嵌入本地生成的 AI 图像像素中。该水印由服务器签发,用于追踪图片来源,但用户无法直接察觉其存在。
信息来源:Hacker News 热门(buzzing.cc 中文翻译)
论文研究普通
美国GDP统计漏算英伟达经济贡献
我们发现,美国GDP统计遗漏了英伟达为美国经济增加的大部分价值。 因此,过去一年GDP增长被低估了约0.3个百分点。
信息来源:X:Epoch AI (@EpochAIResearch) · NVIDIA
论文研究普通
潜态推理视频世界模型如何学习世界演化
学习世界如何演化 通过潜态动力学推理实现的外推式视频世界模型 论文:https://huggingface.co/papers/2608.09926
信息来源:X:AK (@_akhaliq) · Hugging Face
论文研究普通
皮尤研究:ChatGPT 发布后网络 AI 生成文本激增
皮尤研究中心分析近 50 万个英文网页发现,ChatGPT 发布后发布的页面中超过三分之一带有 AI 生成文本痕迹。商业 .com 域名出现 AI 文本的比例约为 .edu 或 .gov 网站的十倍。分析工具 Open Pangram 难以区分完全自动生成与部分 AI 辅助的文本,且"delve"等 AI 常用词及破折号、牛津逗号的使用频率自 2023 年以来显著上升。
信息来源:The Decoder:AI News(RSS) · ChatGPT
论文研究普通
AgentHands:为XR空间对话智能体生成交互式手部手势
Google在CHI 2026发布研究原型AgentHands,利用LLM为XR对话智能体生成与语音同步的富有表现力的手部手势,提供空间锚定的物理指引。该系统通过眼动追踪和场景重建注册物体,由LLM生成内联GestureEvents,并在头显上按词级时间戳协调TTS与动画引擎,实现手势与语音的精准同步。应用场景包括兰花养护交互式教学、3D打印机操作技术讲解和生活方式陪伴。
信息来源:Google Research:Blog(网页)
论文研究普通
Ultrafast Frontier Inference: Cerebras Deep Dive at Hot Chips 2026
信息来源:Cerebras:Blog(网页)
论文研究普通
InfinityEdit:轻量适配器实现无限视频编辑
InfinityEdit 通过轻量级编辑点火适配器实现无限视频编辑 论文:https://huggingface.co/papers/2608.20910
信息来源:X:AK (@_akhaliq) · Hugging Face
论文研究普通
Meta 新论文:EvoHarness-RL 让 Qwen3-8B 在 ALFWorld 达 96.9%
Meta 新论文提出 EvoHarness-RL,通过强化学习训练智能体自主决定何时使用外部记忆与工具,而非硬编码持续访问。该方法将 Qwen3-8B 在 ALFWorld 已见任务成功率从 ReAct 的 47.9% 提升至 96.9%,未见任务达 86.6%(对比 50.0%),且每次任务的外部状态调用降至约 1 次。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Qwen
论文研究普通
Anthropic 原语在企业中的落地范式
前沿模型虽降低了编写定制代码的成本,但并未降低审查与维护成本,每个定制方案都需从头阅读代码库。该立场论文主张采用"harness 范式":一个编码智能体 harness 作为骨干,在所有部署中运行相同代码,无需修改。论文基于三项近期发现,其中 harness 选择对智能体基准结果差异的影响大于模型选择。
信息来源:X:DAIR.AI (@dair_ai) · Claude
论文研究普通
DataSpace 基准:最强模型数据智能体准确率仅 66.34%
DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业
卡迪夫大学和墨尔本大学研究发现,生成式AI目前无法像人类教师一样可靠评判学生书面作业。研究人员用ChatGPT两个版本按7项标准评分50篇生物科学论文,并采用4种提示方式,结果显示模型分数波动大,无法准确预测人工评分。除一种情况外,AI平均分普遍高于人工,最大差距达16.1分,单篇最大差距达40分,且分数系统性向中间集中。
信息来源:IT之家(RSS) · ChatGPT