AI 应用可观测性与生产监控实操手册——AI 进生产后的"仪表盘与探照灯":可观测性全景(三大支柱:日志/指标/追踪 + AI 特有观测对象)、调用追踪与日志规范(LLM 调用追踪、Span 设计、会话级追踪、敏感信息过滤)、质量监控指标(幻觉率/拒答率/满意度/转人工率实时看板)、性能与成本监控(延迟/吞吐/Token 成本实时追踪)、护栏与安全监控(护栏命中率/注入检测/敏感数据泄漏监控)、告警体系(分级告警/阈值设计/通知路由/告警疲劳治理)、监控平台与落地(埋点规范/工具选型/灰度期监控)。附零依赖本地工具一键出三大支柱清单、监控指标表、告警设计、追踪规范与落地路线。面向 AI 平台、SRE、运维与质量负责人——与 LLM 评测(离线质量)互补,本技能管线上运行质量。
Coding
AI Model Asset Management(AI模型资产管理)
Try itAI 模型与资产全生命周期管理(LLMOps)实操手册——从"有模型在用"到"资产清清楚楚":资产全景与台账(模型/Prompt/知识库/评估集/Agent 配置五类资产登记)、模型卡与注册(Model Card 字段规范、注册流程、元数据管理)、版本管理(模型/Prompt/知识库版本化、灰度发布、一键回滚)、上线下线管理(上线审批、退役下线、废弃处置与迁移)、漂移监控(数据漂移/概念漂移/模型漂移、监控指标与告警阈值)、成本治理(Token 成本核算、预算控制、路由分层、蒸馏与缓存降本)、治理制度与流程(角色职责、审批流、审计留痕)。附零依赖本地工具一键出盘点清单、模型卡模板、生命周期检查、漂移监控要点与成本治理清单。面向 AI 平台、工程、运维与财务负责人——与企业 AI 治理(管制度)互补,本技能管资产与工程。
What it does
AI 模型与资产全生命周期管理(LLMOps)实操手册——从"有模型在用"到"资产清清楚楚":资产全景与台账(模型/Prompt/知识库/评估集/Agent 配置五类资产登记)、模型卡与注册(Model Card 字段规范、注册流程、元数据管理)、版本管理(模型/Prompt/知识库版本化、灰度发布、一键回滚)、上线下线管理(上线审批、退役下线、废弃处置与迁移)、漂移监控(数据漂移/概念漂移/模型漂移、监控指标与告警阈值)、成本治理(Token 成本核算、预算控制、路由分层、蒸馏与缓存降本)、治理制度与流程(角色职责、审批流、审计留痕)。附零依赖本地工具一键出盘点清单、模型卡模板、生命周期检查、漂移监控要点与成本治理清单。面向 AI 平台、工程、运维与财务负责人——与企业 AI 治理(管制度)互补,本技能管资产与工程。
The skill document
AI 模型资产管理(LLMOps)
AI 资产的全生命周期"管家":建台账、管版本、控上线、盯漂移、算成本。当企业用上多个模型、多套 Prompt、多个知识库,没有资产管理就会出现"谁在用哪个模型都不知道、成本失控、更新了没人知道"。
什么时候用这个技能
- 建台账:「我们的 AI 资产有哪些?都登记了吗?」
- 管版本:「模型/Prompt 升级怎么管理?出问题怎么回滚?」
- 控上线:「新模型上线要什么流程?旧模型怎么退役?」
- 盯漂移:「模型效果变差了怎么发现?」
- 算成本:「AI 调用成本怎么核算和控制?」
怎么用(两种模式)
模式一:直接问(推荐)
「怎么建 AI 资产台账?」 「模型升级后怎么回滚?」 「AI 成本失控了怎么治理?」
模式二:本地工具(要结构化结果)
# ① 资产盘点:输出 AI 资产盘点清单
python tools/llmops_toolkit.py inventory
# ② 模型卡模板
python tools/llmops_toolkit.py modelcard
# ③ 生命周期检查(按阶段)
python tools/llmops_toolkit.py lifecycle --phase launch # register/launch/monitor/retire
# ④ 漂移监控要点
python tools/llmops_toolkit.py drift
# ⑤ 成本治理清单
python tools/llmops_toolkit.py cost
# 查看全部命令
python tools/llmops_toolkit.py --help
知识库导航(references/)
| 模块 | 文件 | 解决什么问题 |
|---|---|---|
| ① 资产全景与台账 | references/01-资产全景与台账.md | 五类 AI 资产、台账字段、盘点流程 |
| ② 模型卡与注册 | references/02-模型卡与注册.md | Model Card 规范、注册流程、元数据 |
| ③ 版本管理 | references/03-版本管理.md | 模型/Prompt/知识库版本化、灰度、回滚 |
| ④ 上线下线管理 | references/04-上线下线管理.md | 上线审批、退役下线、废弃处置 |
| ⑤ 漂移监控 | references/05-漂移监控.md | 三类漂移、监控指标、告警阈值 |
| ⑥ 成本治理 | references/06-成本治理.md | Token 成本核算、预算、路由降本 |
| ⑦ 治理制度与流程 | references/07-治理制度与流程.md | 角色职责、审批流、审计留痕 |
| ⑧ FAQ | references/08-FAQ.md | 高频疑问 |
快速上手(三步)
- 建台账:
inventory出盘点清单,01 模块看资产分类; - 管版本:
modelcard/lifecycle出模板与检查,02-04 模块看流程; - 盯运行:
drift/cost出监控与成本要点,05-06 模块看指标。
能力边界(如实说明)
- 本技能是资产管理方法论与流程框架,不是资产管理平台:台账/版本/监控需落到现有工具链(MLflow、LangSmith、内部平台等)实施;
- 指标阈值是经验值:漂移阈值、成本预算需按业务规模校准;
- 工具不联网:本地规则匹配,不采集数据、不调用外部服务。
常见问题(FAQ)
- Q:资产台账要管什么? 五类:模型、Prompt、知识库、评估集、Agent 配置——每类登记"版本+负责人+状态+依赖"(见 01 模块)。
- Q:模型升级出问题怎么回滚? 版本管理先行:每版固化(模型+Prompt+知识库快照),发布走灰度,异常一键回退到上一可用版本(见 03 模块)。
- Q:怎么发现模型变差? 漂移监控:线上指标(拒绝率/满意度)+ 定期评测(评测集回归)+ 数据漂移检测三轨(见 05 模块)。
- Q:工具脚本要装依赖吗? 不需要,仅 Python 标准库。
版权与许可
版权与许可:© 2026 注册老炮。本作品(含方法论、模板、法规整理与原创表达)依 MIT License 提供,详见 LICENSE.md。
知识版权声明:本作品汇集的 LLMOps 资产管理方法论、流程与原创表达,归 注册老炮 所有。未经许可,不得复制、转载、转售本作品全部或实质部分,不得用于任何模型训练或二次分发牟利。
免责声明:本作品按「现状」(AS IS) 提供,不作任何明示或暗示的担保,包括但不限于适销性、特定用途适用性与安全保证。使用者应自行核实并承担使用后果,作者不对因使用本作品产生的任何直接或间接损失负责。
Related skills
面向团队与企业用户的 llm-provider API 全功能管理工具。核心能力: - 涵盖免费版全部能力(对话补全、图像生成、助手管理) - 批量任务(Batch API)大规模异步处理 - 模型微调(Fine-tuning)定制化训练 - 评估(Evaluations)质量度量与回归测试 - 向量存储(Vector Stores)高级检索与 RAG - 视频生成与异步任务管理 - 容器(Containers)隔离执行环境 - 审计日志与团队权限管理 适用场景: - 企业级内容生产与自动化流水线 - ...
Use this skill whenever the user needs to operate a GPU inference cluster — vLLM (OpenAI API + Prometheus /metrics) and Ray Serve / Ray Jobs (Ray dashboard), plus the single-process serving engines SGLang and TGI (Text Generation Inference): a one-shot cluster overview (deployments + total replicas + queue backpressure), request metrics (TTFT / TPOT / e2e latency + token totals), queue depth, KV-cache stats (utilisation, prefix-cache hit rate, preemptions), the flagship latency root-cause analysis (diagnose_latency_spike / diagnose_engine_latency) and low-utilisation RCA, engine-agnostic health + running-model inventory across vLLM/SGLang/TGI, Ray Serve autoscaling and scaling (scale up/down, scale-to-zero, drain a replica), LoRA load/unload, base-model hot-swap, deploy/undeploy/redeploy, prefix-aware routing, GPU utilisation, Ray jobs, and cost per million tokens. Always use this skill for "why is inference slow", "TTFT spike", "latency spike", "GPU underutilised", "scale down the dep
Use this skill whenever the user needs to observe or govern on-endpoint local LLMs running on Ollama, llama.cpp (llama-server), LM Studio, or a local single-node vLLM — inventory installed/running models with an allow/deny verdict (shadow-AI detection), inspect VRAM residency, model license/params/capabilities and server version, view the model policy, detect model provenance/digest drift (re-pulled or tampered weights; strong for Ollama/llama.cpp, id-only and honestly weaker for LM Studio/vLLM), scan a prompt for secrets / PII / source-code / jailbreak with a weighted risk band, route a prompt THROUGH a guard that scans + policy-gates + records + runs-if-allowed (guarded_generate / observe_chat), query the observed-usage log, and roll up anomalies (shadow models, digest drift, high-risk + blocked prompts). Always use this skill for "what local models are installed", "find shadow / unsanctioned AI models", "which model is loaded in VRAM", "scan this prompt for secrets/PII before sendin
开源大模型综合技能 - 覆盖国内外主流开源LLM的选型、部署、调优、API调用。国产: DeepSeek/Qwen/ChatGLM/Yi/MiniMax/Baichuan/Kimi。国际: Llama/Mistral/Gemma/Phi/Falcon/Granite/DBRX
LLM 应用质量评测与回归测试实操手册——从"感觉不错"到"可度量可门禁":评测全景与指标体系(正确性/相关性/忠实度/幻觉率/鲁棒性/效率)、评测集构建(黄金数据集/对抗样本/领域评测集/规模估算)、RAG 系统评测(RAGAS 四指标:忠实度/答案相关性/上下文精度/上下文召回)、幻觉检测与度量(事实性幻觉/提示幻觉/上下文矛盾分类与检测方法)、Prompt 回归测试(用例管理/回归门禁/漂移检测/版本对比)、模型对比选型(评测矩阵/成本质量权衡/多模型 A-B/上线决策)、评测流水线与报告(自动化评测/评分聚合/报告模板/上线门禁)。附零依赖本地工具一键查指标、建评测集清单、看 RAG 指标、出对比矩阵、生成评测报告模板。面向 AI 工程师、测试、产品与质量负责人——与 AI 安全红队测试(测安全)互补,本技能测质量。