AI圈报
教程 / 实战普通

NVIDIA Dynamo-Triton 部署 HSTU 生成式推荐模型,延迟最高降低 5.93 倍

信息来源:NVIDIA Technical Blog:Agentic AI / Generative AI·
原始标题:Deploying an HSTU Generative Recommender with NVIDIA Dynamo-Triton

内容摘要

NVIDIA Dynamo-Triton(原 Triton Inference Server)现已通过 recsys-examples 仓库支持端到端 HSTU 生成式推荐推理工作流,结合 PyTorch AOTI、FlexKV KV 缓存与 NV embedding cache。
内容分类AI 教程与实战
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源NVIDIA Technical Blog:Agentic AI / Generative AI
站内情报编号intel-82cb67797d882634c3149063