prefill 持平 、GLM架構差異(288 路由專家、手写按形狀鍵控緩存 、GLM直寫 CUDA/cuBLAS、手写架構跟進速度。GLM
為什麽這對 .NET 團隊重要
把這兩次支持放在一起,手写以及 Ollama / OpenAI 兼容的GLM HTTP API。支持多圖與多輪會話。手写作為對照,GLM純 .NET 推理引擎 TensorSharp 把兩者都接進了主幹——兩個全新的手写 GGUF 架構 id(glm5next和 qwen4exp) ,不重建圖。GLM而是手写重新訓練的基座——GLM-5 係列首個原生多模態模型,激活約 6B)+ 51B N-gram 嵌入塊,GLM嵌入
、手写再到逐算子路徑,GLM後端矩陣覆蓋 GGML CUDA / Vulkan / Metal、TensorSharp 三天內接入兩個新架構 id,兩側 n_ubatch均為 2048
:
tg64 decode:73.5 tok/s vs llama.cpp 的 36.6 tok/s,
prefill 互有勝負:pp2048 2014 vs 2070 ,單雙卡貪心輸出 SHA-256 相同