SIGN IN SIGN UP

Refresh GLM-5.2 GB300 TRT-LLM AgentX metrics (#2773)

* config(glm5.2): refresh GB300 TRT-LLM metrics

* chore: add GLM-5.2 metrics refresh changelog

* fix(glm5.2): require iteration metrics

* Use C++ KV transceiver for GLM disaggregation

* Reduce GLM prefill workspace for TRT-LLM rc24

* fix(agentx): aggregate TensorRT-LLM metrics

* fix(glm5.2): reduce rc24 prefill workspace

* fix(glm5.2): bound TRT transfer buffers

* fix(glm5.2): enable declared native KV offload

* fix(agentic): target the SRT frontend host

* fix(glm5.2): pin the NIXL data interface

* fix(glm5.2): size C++ KV transfer buffers for AgentX

* fix(glm5.2): restore prefill KV cache capacity

* fix(glm5.2): preserve baseline serving configuration

* fix(trtllm): decouple metrics from KV events

* Avoid detailed TRT metrics overhead

* Use metrics-only Dynamo publisher

* docs: consolidate metrics refresh changelog [skip-sweep]
C
Cameron Quilici committed
e807a5283c95dfa725df13c94d349196aea57820
Parent: 5de5561
Committed by GitHub <noreply@github.com> on 9/1/2026, 9:32:22 PM