AI圈报
产品发布 / 更新普通

llama.cpp 支持通过 ggml RPC 后端在异构设备上分布式推理

信息来源:X:Georgi Gerganov(llama.cpp) (@ggerganov)·
原始标题:llama.cpp can distribute inference on heterogeneous devices through the ggml RPC backend

内容摘要

llama.cpp 可通过 ggml RPC 后端在异构设备间分布式推理,作者 Georgi Gerganov 表示这是高级设置,后续会让普通用户更容易使用。被引用的实测称,MiMo 2.6 Flash 的原生 mxfp4 权重可跨 RTX 6000 GPU 与 M5 笔记本以 40 tokens/sec 通过 10 GbE 运行,llama.cpp 开箱即支持。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Georgi Gerganov(llama.cpp) (@ggerganov)
站内情报编号intel-15a7bb724dbbfaedfd99ffcc