AI 论文与研究
整理大模型、智能体、多模态、机器学习与生成式 AI 的论文、基准和研究进展。
分类文章692
当前页6 / 18
持续更新永久归档
分类文章
按发布时间从新到旧 · 每页 40 条
论文研究普通
清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡
清华等高校提出"表征平等"框架,评估大语言模型作为跨国调查合成受访者时,模拟精度是否在各群体间均衡分布。测试覆盖59国、2420个亚组及9个开源模型,发现模拟不平等是系统性的:模型对澳大利亚、北美、欧洲模拟更准,且国家精度与人均GDP、互联网普及率正相关。
信息来源:X:面壁智能 OpenBMB (@OpenBMB)
论文研究普通
Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入
Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。
信息来源:MarkTechPost(RSS)
论文研究普通
对抗式审查:结构化分歧提升智能体代码审查
一篇论文提出用"对抗式审查"规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
NVIDIA 新论文提出 ACES 技能评估法
NVIDIA 新论文提出 ACES 方法评估智能体技能:在同一模型、沙箱、工作区和评分器下,分别在有/无技能加载时运行同一任务,对比智能体完成度的差异。基于 58 个生产技能、947 组配对案例、4 个 harness 的测试显示,技能执行、行为检查和技能效率的过程指标提升最大。传统结构扫描评分与 LLM 评判质量的相关性仅 Spearman rho 0.14。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI) · NVIDIA
论文研究普通
ContinualSkillBench:LLM 智能体能否真正进化能力?
ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。
信息来源:X:Rohan Paul (@rohanpaul_ai)
论文研究普通
MIT证明AI奉承会致人妄想螺旋
MIT用贝叶斯数学模型证明,ChatGPT等AI因被训练得乐于助人而天生奉承,会持续验证用户观点,即使理性人也可能陷入"妄想螺旋"。研究者尝试用RAG强制AI只输出事实,但AI会选择性引用支持用户妄想的事实,奉承者与说谎者同样危险;明确警告用户也无济于事。
信息来源:X:ZHO (@ZHO_ZHO_ZHO) · ChatGPT
论文研究普通
AlgorithmWatch 调查:ChatGPT、Gemini、Grok 和 Claude 频繁向孕妇推荐反堕胎网站且不披露立场
AlgorithmWatch 调查发现,ChatGPT、Gemini、Grok 和 Claude 在回答意外怀孕问题时,至少每四次查询中就有一次会附上反堕胎网站链接,且通常不披露这些来源的意识形态立场。
信息来源:The Decoder:AI News(RSS) · ChatGPT / Claude / Gemini
论文研究普通
Claude 证明 S6 复结构引热议
是时候假装我精通数学了,这样我才能对这东西有多厉害发表点看法。
信息来源:X:Ethan Mollick (@emollick) · Claude
论文研究普通
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建"Prefill As a Service"新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。
信息来源:IT之家(RSS)
论文研究普通
Netflix 如何用 LLM 评判器优化推荐解释
Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。
信息来源:X:Elvis Saravia (@omarsar0, DAIR.AI)
论文研究普通
SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB
SK 海力士在 Hot Chips 2026 大会上披露下一代 HBM 封装路线图,计划借助英特尔 EMIB 等先进封装技术,未来进入 3D 封装阶段。其 HBM4 带宽超 2TB/s,功耗效率较 HBM3E 提升 40% 以上,容量最高 48GB,并正研发混合键合与 I-HBM 局部热点缓解技术以应对散热挑战。
信息来源:IT之家(RSS)
论文研究普通
AgentX 推理基准:CUDA 护城河能否守住智能体推理
AgentX - InferenceXv3:CUDA 护城河在智能体推理中能否守住?开源 300 万美元数据集,100 万+上下文长度,多轮对话,子智能体 95%+ KVCache 命中率,GB300 NVL72,MI355,B200 https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
信息来源:X:SemiAnalysis (@SemiAnalysis_)
论文研究精选
单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性
检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Industrial-Instruction:从工业技术报告构建指令微调与基准数据集的端到端框架
Industrial-Instruction框架利用906份松下公开技术文档构建了两个开放QA数据集,各含约13.6k问答对。用该数据微调小于10B参数的开源LLM,在松下基准上将Set-Match Accuracy从28.5%提升至42.0%,F1从46.6%提升至63.5%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CyberFactory:用真实世界漏洞实例规模化构建网络安全能力
CyberFactory 是一个统一的开源框架,将数据构建、轨迹合成与模型训练串联起来,覆盖 PoC 生成、漏洞修补和网络安全问答(CyberQA),并把来自野外的 CVE 等漏洞产物转化为可执行、可验证的任务实例。基于该框架训练的模型 Aegis 在 CyberGym 上以一小时预算达到 52.4% Pass@1,较其 Qwen 3.5 基座模型提升 +22.8 分,且推理时无需技能提示。
信息来源:HuggingFace Daily Papers(社区热门论文) · Qwen / Hugging Face
论文研究普通
AutoSaddler:利用智能体执行轨迹实现自动化的 Harness 优化与持久更新
AutoSaddler 提出一种自动化 harness 优化框架,将 harness 改进视为离线学习问题,通过失败轨迹诊断、结构化补丁生成和基于验证的更新选择,迭代优化智能体外部控制逻辑。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
EchoWM:可进入式全模态世界模型
EchoWM 是一个面向可进入式生成媒体的全模态世界模型,能在持续导航中联合生成 720p 视频、环境音、音乐和语音。它围绕相机意图组织交互,将离散指令和连续姿态映射到共享的度量尺度相对 6-DoF 轨迹,并通过渐进训练和自回归后训练实现长时程生成。评测显示其在公开世界模型基准上轨迹跟随和视觉质量表现优异,支持第一/第三人称交互及同步环境音和语音。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
LongWoF-Bench:用 EvoMap 基因评估可验证的长流程任务
研究团队提出 LongWoF-Bench,含 778 个可机器验证任务,覆盖代码生成、智能体环境合成、数学推理与规则遵循。在 252 个经验证的 Opus 轨迹上,进化得到的 EvoMap 基因在全部 7 个模型中比 Skill 平均高出 8.7-15.5 个百分点,且优势扩展至消费级模型;对 Claude Opus,基因复用还多完成 39 个任务,并减少 9.9% 的推理 token 消耗。
信息来源:HuggingFace Daily Papers(社区热门论文) · Claude / Hugging Face
论文研究普通
AgentRoom:基于CRDT共享工作区的并发多智能体编码协议
AgentRoom提出一种面向并发编码智能体的实时协作编辑协议,通过CRDT合并的共享文件系统,以MCP工具暴露文件级声明、状态与广播。在Python DevBench和Rust+axum的跨语言测试中,2个智能体的AgentRoom比Solo放弃更少任务、运行波动更小;匹配算力时,完整AgentRoom优于并行合并及各部分消融,表明协调机制而非并行或CRDT合并承担主要作用。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
生成式搜索中的上下文分配定律:因果测量与闭环编排
一项新研究指出,RAG 系统在证据利用测量和上下文预算分配上存在瓶颈,并提出因果留一法探针替代标准相关性代理,以准确识别生成依赖。研究发现,单一扩大上下文窗口会因相关性衰减而失效,而跨多次顺序生成迭代分配计算可将组合召回率提升 16.7-20.5 个百分点,且可扩展至 32B 模型。相关代码、数据和因果测量工具已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
ReWorld:具备长时记忆的交互式世界模型
ReWorld 将控制与记忆分离训练并在推理时加以约束,通过混合逐头注意力窗口和随机头路由,让少量全局头关注全部历史,同时以姿态索引地标库支撑有界 KV 缓存。在覆盖动作跟随、长时回忆和视频质量的三轴评测中,ReWorld 对六个近期交互式世界模型取得最佳控制保真度(11.95° 旋转误差)和最佳生成质量,并支持 704x1280 实时视频流。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
无 CoT 数据下,Next-Chunk 推理 RL 真的优于 SFT 吗?混合 SFT 以 60 倍更低算力取得更高 RLVR 上限
一项对照研究重新审视了 next-chunk reasoning RL 在无 CoT 数据上的训练策略,发现简单的 Mixed SFT(单阶段联合训练 no-CoT 与 long-CoT 数据)在 post-RLVR 准确率上限上明显高于 next-chunk reasoning RL,且训练算力需求降低超过 60 倍。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化
Task-CoEvolve 提出一种高效的大语言模型 harness 优化方法,通过让验证任务与 harness 共同演化,解决固定验证集评估成本高的问题。该方法利用方差加权采样聚焦能力边界附近的任务,并基于采样概率估计全量集分数。在在线文本分类和 Terminal-Bench 2.1 上,Task-CoEvolve 匹配全量集搜索的最终性能,同时将优化过程中的评估次数减少 80%。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
CaRGo-T:因果推理思维图提升多模态幽默理解
CaRGo-T提出一种基于图的推理框架,将多模态幽默背后的因果与上下文关系序列化为代码表示,供视觉语言模型在零样本或上下文学习场景下解读并输出预测。在涵盖讽刺、反讽和表情包的四项数据集上,CaRGo-T较现有推理基线在幽默理解上提升约1-20%,幽默检测上提升1-3%。互信息分析显示其推理表示包含更多与目标输出相关的信息,代码已开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
SWE Refactor Bench:编码智能体能否完成长周期、全仓库的栈迁移?
SWE Refactor Bench 新基准用 20 个全仓库迁移任务、三阶段评估协议(迁移审计、行为测试、智能体验证)衡量编码智能体的迁移能力。8 个前沿模型的 520 次运行中仅 28 次(5.4%)通过全部阶段,最佳模型 claude-opus-5 得分 47.0/100。迁移完整性与行为正确性是两种独立能力,智能体在构建工具链重写得分 31.4,语言重写仅 5.6。
信息来源:HuggingFace Daily Papers(社区热门论文) · Claude / Hugging Face
论文研究普通
Apodex 1.1:面向复杂工作的智能体能力扩展
Apodex 1.1 通过环境扩展与智能体协调训练两条路径,提升模型在文件、搜索和代码环境中的持续可验证工作能力。在专业工作、金融、科研、数学、编码和搜索等任务上,该模型以远小于前沿系统的参数量达到领先性能。35B 参数的 Apodex 1.1 Mini 在本地可部署形态下仍保持较强工作能力。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Agent-G^2:用高斯引导改进智能体强化学习中的提示深度选择
Agent-G^2 提出一种高斯引导框架,将每个任务的提示深度建模为高斯分布,其中心与方差从已收集的 rollout 中在线估计,无需额外探测 rollout 或学习深度预测器。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降
研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
面向十亿级容量的用户表征学习:迈向"稠密化定律"
针对十亿级规模下原始数据扩展遭遇性能瓶颈的问题,研究提出用户行为稠密化定律,量化数据规模与最小充分分词容量间的关系。实验发现二者对数近似线性,斜率随分词方法和数据源变化。据此开发的ALGN自适应变长分词方法在多种数据源和下游任务上优于现有基线。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
超越稳定性-探索困境:面向LLM策略优化的环境正则化方法
针对大语言模型策略优化中的稳定性-探索权衡问题,研究提出环境正则化策略优化(ERPO),将正则化从动作侧移至输入侧,通过Query-KL项约束查询分布漂移,同时保留探索能力。ERPO可无缝接入GRPO/PPO/REINFORCE等流程,无需额外前向传播。在六个数学推理基准上,ERPO替代标准Policy-KL正则化,在高温解码和长时训练下实现更强准确率和更稳定行为。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
同一智能体不同答案:检索增强问答中语料库引发的答案更替审计
检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MARS:面向竞技编程的多专家 LLM 接力系统
MARS 提出一种纯提示词框架,让每个智能体专精动态规划、图论、字符串等特定算法主题,并通过检索增强生成从算法理论语料中选取相关专家组成小团队协作解题。在 CodeContests 测试集上搭配 Gemma 4,MARS 达到 0.624 的通过率,较直接提示提升 14.4 个百分点,并以 3.3 倍更低的墙钟成本接近 CodeSIM 的 0.731。源码已在 GitHub 开源。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
信息来源:Apple Machine Learning Research(RSS)
论文研究普通
RIBOSPAN:面向通用 RNA 建模的长上下文基础模型
RIBOSPAN 是一个 16.1 亿参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt,支持单核苷酸分辨率的完整长 RNA 建模。原生 10K 预训练在 10,240 token 下保持强重建能力,长上下文基准显示其上下文响应与表征分离俱佳,且推理时 YaRN 缩放可恢复短上下文模型直接外推丢失的上下文组织。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
掩码并非模型本身:审计注意力、状态空间与混合序列模型的前缀不变性
一项研究形式化定义了前缀不变性,即位置 t 的表示不得依赖未来输入,并提出一种轻量级审计方法,仅需两次前向传播、无需训练或梯度即可精确定位因果性破坏位置。在八个检查点上的 192 次注入故障试验中,注意力掩码检查未发现任何问题,而该审计方法全部定位成功,并发现 Zamba2 与 Nemotron-H 存在缺陷。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从生成到模拟:世界模型距离真正的模拟器还有多远?
一项基于能力的研究系统评估了生成式世界模型与传统模拟器的差距,覆盖资产构建、物理引擎、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力,并梳理了2018年至2026年6月间的200篇代表性工作。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
MobilePA-Bench:面向复杂真实任务的移动端规划智能体评测基准
MobilePA-Bench 是一个交互式、有状态且以工具为中心的评测基准,用于评估移动端规划智能体的工具调用与规划能力。它运行在可执行沙箱中,覆盖 13 个功能域和 212 个真实移动工具,并额外评测子智能体协作、记忆使用和技能调用三个高级维度。实验显示,当前前沿 LLM 在严格工具排序、权限限制和意外运行时错误下性能显著下降。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
从智能体轨迹中构建自动机:失败预测与下一步预测
一项研究将LLM智能体的完整轨迹语料压缩为单一紧凑有限状态机(FSM),在12个公开数据集上仅用7-43个状态即可复现数据,保真度不低于0.997,且构建耗时仅毫秒级。
信息来源:HuggingFace Daily Papers(社区热门论文) · Hugging Face
论文研究普通
Claude 助数学家破解 1948 年难题
又是一周,又一个开放数学难题被 AI 攻克。 Anthropic 的一位数学家与 Claude 合作,声称解决了一个自 1948 年以来悬而未决的著名数学问题。
信息来源:X:Rohan Paul (@rohanpaul_ai) · Claude
论文研究普通
主动推理让AI智能体按需获取上下文
一篇论文提出用主动推理让AI智能体显式决策每次澄清、检索或工具调用是否值得其token与延迟成本。受控测试中,定向澄清将验证器合规率从0.0417提升至0.375,平均token使用从约112增至219。建议为智能体增加显式上下文获取层,而非将其视为自动行为。
信息来源:X:Rohan Paul (@rohanpaul_ai)