vLLM 推論服務監控實戰:Prometheus + Grafana + MLflow(附 5 個踩坑筆記)
用 Prometheus + Grafana + MLflow 監控自架的 vLLM 推論服務——從架構、該看哪些指標、PromQL 查詢,到我實際踩過的 5 個坑(指標改名、子路徑 datasource、Dokploy 不重建…)。
用 Prometheus + Grafana + MLflow 監控自架的 vLLM 推論服務——從架構、該看哪些指標、PromQL 查詢,到我實際踩過的 5 個坑(指標改名、子路徑 datasource、Dokploy 不重建…)。
Dokploy 的 GitHub App 裝在 A 帳號,卻要部署 B 帳號的 private repo?整理 customGit + SSH Deploy Key、多 Git Provider 並存、push-to-deploy webhook 與五個踩過的坑。
新手剛接觸 Dokploy 容易被 Backups / Schedules / Volume Backups 三個 tab 搞混。本文釐清差異、舉例 Schedules 能做什麼,並記錄一個在遠端 server 上踩到的雷與繞過方法。
Dagster 跑在 Dokploy 上以後,日常要改 code、加 Python 套件、或建新的 code location 怎麼做?三種場景各自對應的最短步驟。
這不是 step-by-step 教學,是「你真的動手做會問出來的」那 10 個基礎問題,一題一題把底層機制講清楚。Port 到底有幾種、跨機器怎麼接、Invalid origin 在擋什麼、Cloudflare Tunnel 為什麼不用開 port、2FA 跟 CF Access 差在哪——看完這篇,Dokploy 上手時不會一頭霧水。
不教 prompt 技巧。直接看一次真實案例——我花一個下午,讓 AI 把公網可訪問的自架服務平台從零架起來,過程中踩了 3 個坑,AI 每次都自己爬出來。提煉 5 個「人類側」操作心法,附完整技術細節。