前置知识: AI工程

LLM可观测性与评估仪表板

00:00
3 min Advanced

Langfuse开源核心、Arize Phoenix发布2026 GenAI semconv映射、Helicone和Braintrust加倍每用户成本归因、Traceloop的OpenLLMetry成为事实SDK插桩。生产形态:ClickHouse存储traces、Postgres元数据、Next.js UI、eval作业(DeepEval/RAGAS/LLM-judge)在采样traces上运行。自托管构建,从至少四个SDK家族摄取,五分钟内捕获注入回归。

问题

2026年运生产流量的每个AI团队都在模型旁保持可观测性。成本归因、幻觉检测、漂移监控、越狱信号SLO板、PII泄露告警。开参考——Langfuse、Phoenix、OpenLLMetry——收敛于OpenTelemetry GenAI语义约定作为摄取模式

你将构建一个自托管仪表板,从至少四个SDK家族摄取,在采样traces上运小规模eval作业集,检测漂移并告警。测量标准:给定一个故意注入的回归(一个开始产生PII的提示),仪表板在五分钟捕获触发告警。

核心架构

摄取

OpenTelemetry GenAI语义约定。一个SDK插桩OpenAI、Anthropic、Google、LangChain、LlamaIndex和vLLM,发出兼容spans。

存储

ClickHouse用于traces(吞吐写入),Postgres用于元数据查询灵活)。

评估

DeepEval、RAGAS、LLM-judge在采样traces上运检测幻觉、漂移、PII泄露。

告警

基于规则告警(PII检测、成本超限)+ 统计漂移检测(分布偏移)。

关键术语

术语常见说法实际含义
OpenLLMetry”LLM插桩SDK”Traceloop的OpenTelemetry LLM插桩
Semconv语义约定”OpenTelemetry GenAI语义约定
Cost attribution”成本归因”用户/团队/端点分配LLM成本
Drift detection”漂移检测检测模型输出分布的统计偏移
PII leak alert”PII泄露告警检测模型输出中的个人身份信息

延伸阅读

  • Langfuse — 开源LLM可观测性
  • Arize Phoenix — GenAI可观测性
  • OpenLLMetry (Traceloop) — LLM SDK插桩

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式