AI圈报
行业动态普通

Modal 与 CMU 推出 Quail:单张 H100 上每分钟处理超 10 亿 token

信息来源:Modal 官方工程博客(RSS)·
原始标题:Hitting a billion tokens per minute on one GPU by combining a query planner and an inference engine

内容摘要

Modal 与 CMU Full Stack Data Lab 合作推出查询感知推理层 Quail,在单个 H100 GPU 上对某多表连接查询实现每分钟超 10 亿 token 的处理速度,比同硬件 vLLM 基线快 10 倍以上,Modal 上成本低于每 10 亿 token 6 美分。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Modal 官方工程博客(RSS)
站内情报编号intel-75534088b50de23e3c4c3db1