编程

AI Observability(AI可观测性监控)

试用

AI 应用可观测性与生产监控实操手册——AI 进生产后的"仪表盘与探照灯":可观测性全景(三大支柱:日志/指标/追踪 + AI 特有观测对象)、调用追踪与日志规范(LLM 调用追踪、Span 设计、会话级追踪、敏感信息过滤)、质量监控指标(幻觉率/拒答率/满意度/转人工率实时看板)、性能与成本监控(延迟/吞吐/Token 成本实时追踪)、护栏与安全监控(护栏命中率/注入检测/敏感数据泄漏监控)、告警体系(分级告警/阈值设计/通知路由/告警疲劳治理)、监控平台与落地(埋点规范/工具选型/灰度期监控)。附零依赖本地工具一键出三大支柱清单、监控指标表、告警设计、追踪规范与落地路线。面向 AI 平台、SRE、运维与质量负责人——与 LLM 评测(离线质量)互补,本技能管线上运行质量。

它能做什么

AI 应用可观测性与生产监控实操手册——AI 进生产后的"仪表盘与探照灯":可观测性全景(三大支柱:日志/指标/追踪 + AI 特有观测对象)、调用追踪与日志规范(LLM 调用追踪、Span 设计、会话级追踪、敏感信息过滤)、质量监控指标(幻觉率/拒答率/满意度/转人工率实时看板)、性能与成本监控(延迟/吞吐/Token 成本实时追踪)、护栏与安全监控(护栏命中率/注入检测/敏感数据泄漏监控)、告警体系(分级告警/阈值设计/通知路由/告警疲劳治理)、监控平台与落地(埋点规范/工具选型/灰度期监控)。附零依赖本地工具一键出三大支柱清单、监控指标表、告警设计、追踪规范与落地路线。面向 AI 平台、SRE、运维与质量负责人——与 LLM 评测(离线质量)互补,本技能管线上运行质量。

技能文档

AI 可观测性与生产监控

AI 应用生产运行的"仪表盘 + 探照灯":看得见、测得准、告得动、查得到。当 AI 应用上线,传统监控不够用——要监控的不只是服务器,还有幻觉率、Token 成本、护栏命中这些 AI 特有的东西。

什么时候用这个技能

  • 建监控:「AI 应用上线后要监控什么?」
  • 查问题:「线上回答变差/报错/异常怎么定位?」
  • 设告警:「什么情况要告警?阈值怎么定?」
  • 管成本:「线上 Token 成本怎么实时盯?」
  • 保安全:「护栏命中率、注入攻击怎么监控?」

怎么用(两种模式)

模式一:直接问(推荐)

「AI 应用上线后要建哪些监控?」 「线上幻觉率怎么实时监控?」 「告警太多怎么办?」

模式二:本地工具(要结构化结果)

# ① 三大支柱要点
python tools/observability_toolkit.py pillars

# ② 核心监控指标
python tools/observability_toolkit.py metrics

# ③ 告警设计(分级)
python tools/observability_toolkit.py alert

# ④ 调用追踪规范
python tools/observability_toolkit.py trace

# ⑤ 落地路线
python tools/observability_toolkit.py plan

# 查看全部命令
python tools/observability_toolkit.py --help

知识库导航(references/)

模块文件解决什么问题
① 可观测性全景references/01-可观测性全景.md三大支柱、AI 特有观测对象
② 调用追踪与日志references/02-调用追踪与日志.mdSpan 设计、会话追踪、敏感过滤
③ 质量监控指标references/03-质量监控指标.md幻觉率/拒答率/满意度/转人工看板
④ 性能与成本监控references/04-性能与成本监控.md延迟/吞吐/Token 成本实时追踪
⑤ 护栏与安全监控references/05-护栏与安全监控.md护栏命中/注入检测/数据泄漏
⑥ 告警体系references/06-告警体系.md分级告警、阈值、通知路由
⑦ 平台与落地references/07-平台与落地.md埋点规范、工具选型、灰度监控
⑧ FAQreferences/08-FAQ.md高频疑问

快速上手(三步)

  1. 定范围pillars 出三大支柱要点,01 模块看全景;
  2. 选指标metrics 出监控指标表,03-05 模块看详解;
  3. 建告警alert/trace/plan 出设计与路线,06-07 模块看落地。

能力边界(如实说明)

  • 本技能是监控方法论与设计框架,不是监控产品:埋点/告警/看板需落到现有可观测性平台(Prometheus/Grafana、LangSmith、OpenTelemetry 等)实施;
  • 指标与阈值是经验值:需按业务规模与风险等级校准;
  • 工具不联网:本地规则匹配,不采集数据、不调用外部服务。

常见问题(FAQ)

  • Q:AI 监控和普通应用监控有什么区别? 普通监控看服务器/接口;AI 监控还要看幻觉率、Token 成本、护栏命中、Prompt 质量这些模型特有维度(见 01 模块)。
  • Q:幻觉率能实时监控吗? 可以:自动检测(规则/评估器)覆盖大部分,配合抽样人工复核;对高危场景设实时告警(见 03 模块)。
  • Q:告警太多怎么办? 分级治理:预警/告警/严重三级 + 阈值校准 + 聚合去重 + 值班轮转(见 06 模块)。
  • Q:工具脚本要装依赖吗? 不需要,仅 Python 标准库。

版权与许可

版权与许可:© 2026 注册老炮。本作品(含方法论、模板、法规整理与原创表达)依 MIT License 提供,详见 LICENSE.md

知识版权声明:本作品汇集的 AI 可观测性方法论、指标体系、流程与原创表达,归 注册老炮 所有。未经许可,不得复制、转载、转售本作品全部或实质部分,不得用于任何模型训练或二次分发牟利。

免责声明:本作品按「现状」(AS IS) 提供,不作任何明示或暗示的担保,包括但不限于适销性、特定用途适用性与安全保证。使用者应自行核实并承担使用后果,作者不对因使用本作品产生的任何直接或间接损失负责。

相关技能

Specify the tracing, metrics, and alerting for an AI agent or LLM feature in production. Use when asked what to log for an LLM app, design agent tracing or s...

AI 模型与资产全生命周期管理(LLMOps)实操手册——从"有模型在用"到"资产清清楚楚":资产全景与台账(模型/Prompt/知识库/评估集/Agent 配置五类资产登记)、模型卡与注册(Model Card 字段规范、注册流程、元数据管理)、版本管理(模型/Prompt/知识库版本化、灰度发布、一键回滚)、上线下线管理(上线审批、退役下线、废弃处置与迁移)、漂移监控(数据漂移/概念漂移/模型漂移、监控指标与告警阈值)、成本治理(Token 成本核算、预算控制、路由分层、蒸馏与缓存降本)、治理制度与流程(角色职责、审批流、审计留痕)。附零依赖本地工具一键出盘点清单、模型卡模板、生命周期检查、漂移监控要点与成本治理清单。面向 AI 平台、工程、运维与财务负责人——与企业 AI 治理(管制度)互补,本技能管资产与工程。

面向团队与企业用户的 llm-provider API 全功能管理工具。核心能力: - 涵盖免费版全部能力(对话补全、图像生成、助手管理) - 批量任务(Batch API)大规模异步处理 - 模型微调(Fine-tuning)定制化训练 - 评估(Evaluations)质量度量与回归测试 - 向量存储(Vector Stores)高级检索与 RAG - 视频生成与异步任务管理 - 容器(Containers)隔离执行环境 - 审计日志与团队权限管理 适用场景: - 企业级内容生产与自动化流水线 - ...

Export OpenClaw OTLP traces to Latitude for open-source LLM observability and evaluation. Use when configuring diagnostics.otel to send OpenClaw model-call,...

1 次安装

Use this skill when the user wants to monitor LLM behavior over time and get alerted when outputs change unexpectedly. Triggers on requests like "set up LLM regression monitoring", "alert me when my prompts start behaving differently", "watch my LLM for regressions", "run behavioral tests on my AI outputs on a schedule", or "detect when my model starts drifting". Handles first-time setup, baseline capture, scheduled monitoring, and alert configuration via WhatsApp, Slack, Discord, or email.

17 次安装

LLM 应用质量评测与回归测试实操手册——从"感觉不错"到"可度量可门禁":评测全景与指标体系(正确性/相关性/忠实度/幻觉率/鲁棒性/效率)、评测集构建(黄金数据集/对抗样本/领域评测集/规模估算)、RAG 系统评测(RAGAS 四指标:忠实度/答案相关性/上下文精度/上下文召回)、幻觉检测与度量(事实性幻觉/提示幻觉/上下文矛盾分类与检测方法)、Prompt 回归测试(用例管理/回归门禁/漂移检测/版本对比)、模型对比选型(评测矩阵/成本质量权衡/多模型 A-B/上线决策)、评测流水线与报告(自动化评测/评分聚合/报告模板/上线门禁)。附零依赖本地工具一键查指标、建评测集清单、看 RAG 指标、出对比矩阵、生成评测报告模板。面向 AI 工程师、测试、产品与质量负责人——与 AI 安全红队测试(测安全)互补,本技能测质量。