论文研究普通
MintAct:面向数字环境的统一视觉智能体
原始标题:MintAct: A Unified Visual Agent for Digital Environments
内容摘要
MintAct 是一系列视觉语言模型,统一了 UI grounding、跨移动端/桌面/Web 的多步导航与视觉工具使用,提供 2B、4B、8B 三种规模,性能可匹配各领域专用模型。其配套的可扩展环境与异步 RL 框架支持数百个并发实例和在线强化学习,在 OSWorld-Verified 上取得 48.9 的 SOTA 成绩。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-de78b0d87ef137ca22bdc6ec