【MLflow LLMs & Agents 實戰】#04 Agent 全鏈路追蹤與生產監控
測驗:Agent 全鏈路追蹤與生產監控 共 5 …
測驗:Agent 全鏈路追蹤與生產監控 共 5 …
用 Prometheus + Grafana + MLflow 監控自架的 vLLM 推論服務——從架構、該看哪些指標、PromQL 查詢,到我實際踩過的 5 個坑(指標改名、子路徑 datasource、Dokploy 不重建…)。
MLflow 3.5+ 官方支援 trace Claude Agent SDK:mlflow.anthropic.autolog() 會 patch ClaudeSDKClient、從訊息流事後重建 trace。實測它缺 cost、子代理不巢狀、span 時長全假——其中 cost 和自己的 chat id 用 30 行 set_trace_tag 補丁就能補回,這是我最終落地的方案(mlflow-skinny + anthropic + python-dateutil 最小組合)。要真實時長/子代理樹則附全手動 TurnTrace 實作。外加四個坑:token stub、輕量包兩段死法、容器裡的 tracking server、resume 重放假 trace。