产品发布 / 更新普通
FreeToken:单工作站 GPU 运行 753B GLM-5.2 的边缘原生 MoE 推理引擎
原始标题:Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU
内容摘要
UC Berkeley 与 UT Austin 团队提出 FreeToken,将个人电脑视为统一弹性推理平台,在 8 GB 笔记本 GPU 上以交互速度运行 35B 模型,在单张工作站显卡上运行 753B GLM-5.2。
内容分类AI 产品发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源MarkTechPost(RSS)
站内情报编号intel-118ee5a5ecb03346d26dc01f