产品发布 / 更新普通
llama.cpp 支持通过 ggml RPC 后端在异构设备上分布式推理
原始标题:llama.cpp can distribute inference on heterogeneous devices through the ggml RPC backend
内容摘要
llama.cpp 可通过 ggml RPC 后端在异构设备间分布式推理,作者 Georgi Gerganov 表示这是高级设置,后续会让普通用户更容易使用。被引用的实测称,MiMo 2.6 Flash 的原生 mxfp4 权重可跨 RTX 6000 GPU 与 M5 笔记本以 40 tokens/sec 通过 10 GbE 运行,llama.cpp 开箱即支持。
内容分类AI 产品发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Georgi Gerganov(llama.cpp) (@ggerganov)
站内情报编号intel-15a7bb724dbbfaedfd99ffcc