【MLflow LLMs & Agents 實戰】#04 Agent 全鏈路追蹤與生產監控
測驗:Agent 全鏈路追蹤與生產監控 共 5 …
測驗:Agent 全鏈路追蹤與生產監控 共 5 …
測驗:用 Prompt Registry 管理你的提示詞…
測驗:用 LLM-as-a-Judge 評估你的模型輸…
測驗:認識 GenAI 觀測 Tracing 入門 共 5…
從零自建 Claude Code 私人 plugin marketplace 的完整踩坑記錄:marketplace 命名限制、${CLAUDE_PLUGIN_ROOT} 路徑、版本號更新陷阱、內建 MCP server、引用外部 plugin 的相容性問題,以及把 CLAUDE.md 知識庫搬進 skill 的技巧。
用 Prometheus + Grafana + MLflow 監控自架的 vLLM 推論服務——從架構、該看哪些指標、PromQL 查詢,到我實際踩過的 5 個坑(指標改名、子路徑 datasource、Dokploy 不重建…)。
MLflow 3.5+ 官方支援 trace Claude Agent SDK:mlflow.anthropic.autolog() 會 patch ClaudeSDKClient、從訊息流事後重建 trace。實測它缺 cost、子代理不巢狀、span 時長全假——其中 cost 和自己的 chat id 用 30 行 set_trace_tag 補丁就能補回,這是我最終落地的方案(mlflow-skinny + anthropic + python-dateutil 最小組合)。要真實時長/子代理樹則附全手動 TurnTrace 實作。外加四個坑:token stub、輕量包兩段死法、容器裡的 tracking server、resume 重放假 trace。
測驗:MLflow GenAI 教學 – Evaluat…
測驗:MLflow GenAI 教學 – 追蹤 Cl…
測驗:MLflow Tracing 入門 共 5 題,點選…