Refresh GLM-5.2 GB300 TRT-LLM AgentX metrics (#2773)
* config(glm5.2): refresh GB300 TRT-LLM metrics * chore: add GLM-5.2 metrics refresh changelog * fix(glm5.2): require iteration metrics * Use C++ KV transceiver for GLM disaggregation * Reduce GLM prefill workspace for TRT-LLM rc24 * fix(agentx): aggregate TensorRT-LLM metrics * fix(glm5.2): reduce rc24 prefill workspace * fix(glm5.2): bound TRT transfer buffers * fix(glm5.2): enable declared native KV offload * fix(agentic): target the SRT frontend host * fix(glm5.2): pin the NIXL data interface * fix(glm5.2): size C++ KV transfer buffers for AgentX * fix(glm5.2): restore prefill KV cache capacity * fix(glm5.2): preserve baseline serving configuration * fix(trtllm): decouple metrics from KV events * Avoid detailed TRT metrics overhead * Use metrics-only Dynamo publisher * docs: consolidate metrics refresh changelog [skip-sweep]
C
Cameron Quilici committed
e807a5283c95dfa725df13c94d349196aea57820
Parent: 5de5561
Committed by GitHub <noreply@github.com>
on 9/1/2026, 9:32:22 PM