日志与监控
672 字约 2 分钟
domain/aiai/engineering
2026-07-24
1. 核心结论
- 日志与监控是 AI 应用稳定运行的基础保障
- AI 应用需要监控模型调用、响应质量、成本和用户反馈
- 完善的日志系统能快速定位问题和优化性能
- 监控指标应该覆盖基础设施、应用层和业务层
- 告警机制能在问题影响用户前及时发现
2. 基础概念
Logging:日志记录,保存系统运行信息。
Monitoring:监控,实时观察系统状态。
Tracing:追踪,记录请求的完整链路。
Metrics:指标,量化的系统状态数据。
Alert:告警,异常时通知相关人员。
Dashboard:仪表盘,可视化展示监控数据。
SLA:服务等级协议,承诺的服务质量指标。
3. 工作原理
监控体系层次:
- 基础设施监控:
- CPU、内存、磁盘使用率
- 网络带宽和延迟
- 容器和 Pod 状态
- 数据库连接池
- 应用层监控:
- API 响应时间
- 错误率
- 请求吞吐量
- 队列长度
- AI 特定监控:
- 模型调用次数
- Token 使用量
- API 成本
- 响应质量评分
- 缓存命中率
- 幻觉率
- 业务层监控:
- 用户活跃度
- 功能使用率
- 用户满意度
- 转化率
日志结构示例:
{
"timestamp": "2025-01-15T10:30:00Z",
"level": "INFO",
"service": "chat-api",
"trace_id": "abc123",
"user_id": "user456",
"model": "gpt-4",
"input_tokens": 1500,
"output_tokens": 300,
"cost": 0.045,
"latency_ms": 2500,
"cache_hit": false,
"status": "success"
}监控工具栈:
- 日志:ELK(Elasticsearch、Logstash、Kibana)、Loki
- 指标:Prometheus、Grafana
- 追踪:Jaeger、Zipkin
- AI 专用:LangSmith、Arize、WhyLabs
- 告警:PagerDuty、Slack、Email
关键监控指标:
- P50/P95/P99 延迟
- 错误率(4xx、5xx)
- 模型调用成功率
- 平均每次请求成本
- 用户满意度评分
- 系统可用性
4. 实战场景
- 生产环境故障排查
- 性能瓶颈分析
- 成本异常检测
- 用户行为分析
- 模型效果追踪
- 容量规划
5. 常见误区
- 日志不完整:缺少关键信息无法排查
- 不设置告警:问题发生不知道
- 告警疲劳:太多无效告警
- 不监控成本:费用超标才发现
- 忽视用户反馈:只看技术指标
6. 进阶方向
- AI 异常检测
- 自动根因分析
- 预测性监控
- 分布式追踪
- 实时监控仪表盘
- 日志智能分析
7. 推荐资料
- LangSmith - https://docs.smith.langchain.com/
- Prometheus - https://prometheus.io/docs/
- Grafana - https://grafana.com/docs/
- OpenTelemetry - https://opentelemetry.io/docs/
- Arize AI - https://docs.arize.com/arize