AI客服
3908 字约 13 分钟
domain/aiai/applications
2026-07-24
AI 客服是利用大语言模型(LLM)、检索增强生成(RAG)和智能 Agent 构建的自动化客户服务系统。相比传统关键词匹配的规则客服,核心差异在于:理解自然语言、支持多轮上下文推理、能主动调用外部工具解决实际问题。
一句话解释
AI 客服 = LLM 理解用户意图 + RAG 检索企业知识库 + Agent 调用业务系统,最终在对话中解决用户问题。
核心结论
- 纯 RAG 方案已足够覆盖 70% 的客服场景:FAQ、政策查询、操作指引等事实型问题,用 RAG + 知识库即可高效解决
- Agent 是解决"动手能力"的关键:退款、改订单、查物流等需要调用 API 的场景,必须引入 Agent + Function Calling
- 人机协作是当前最佳实践:AI 处理确定性高的问题,复杂/敏感问题无缝转人工,二者在同一工作台协同
- 幻觉是客服场景的头号风险:给用户错误政策信息可能引发法律纠纷,幻觉控制优先级高于对话流畅度
- ROI 计算不能只看替代人力:真正的收益包括 7x24 覆盖、响应速度提升、人力转去做高价值工作
四层架构详解
AI 客服系统从用户输入到最终回复,经过四个核心层级:
第一层:意图识别层
负责判断用户想问什么、属于什么类型、需要什么处理路径。
| 方法 | 适用场景 | 实现方式 |
|---|---|---|
| 语义分类 | FAQ 类快速匹配 | Embedding 相似度 + 预设类别 |
| LLM 分类 | 复杂意图判断 | Prompt 引导 LLM 输出意图标签和实体 |
| 关键词 + 规则 | 高优先级敏感词 | 触发词表(投诉、退款、起诉)直接分流 |
关键设计:
- 意图列表应从历史工单中提炼,而非凭空设计。分析过去 6 个月的客服对话,按频次聚类得到最真实的意图分布
- 多意图并存是常态:一个消息可能同时包含咨询+投诉,需要有意图优先级排序机制
- 未知意图处理:设"其他"兜底分类,定期审核未分类对话,迭代添加新意图类别
第二层:检索层(RAG)
负责从企业知识库中找到最相关的信息来回答用户。
核心组件:
- Embedding 模型:将知识库文档和用户问题都转成向量,当前主流方案使用 text-embedding-3-large 或 bge-large-zh 等中文优化模型
- 向量数据库:存储文档向量并做相似度检索,选择取决于数据量(Qdrant / Milvus / pgvector)
- 检索策略:基础方案用单路语义检索;进阶方案用混合检索(语义 + BM25 关键词)提升召回率;高阶方案加重排序(Reranker 模型)将 Top-20 精排到 Top-3
客服场景的 RAG 特殊要求:
- 时效性敏感:促销政策、价格等信息必须实时更新,需要文档同步机制和过期内容标记
- 权限隔离:B2B 客服中不同客户等级看到不同 SLA 条款,需要在检索层做文档级权限过滤
- 结构化 + 非结构化混合:政策文档和 FAQ 是非结构化的,但订单状态、物流信息来自结构化数据库,需要统一检索接口
第三层:生成层(LLM)
负责将检索到的知识组织成自然流畅的回复。
核心技术点:
- Prompt 工程:System Prompt 需要明确角色("你是 xx 公司的客服助手")、约束("不要凭空编造政策,不确定时请说明需要转人工确认")、格式要求
- 上下文窗口管理:多轮对话需要保留历史摘要,避免无效轮次占满窗口。常见做法是最近 N 轮保留原始对话,更早的轮次用 LLM 做摘要压缩
- 温度设置:客服场景用低温度(0.1-0.3),追求确定性和一致性,而非创造性
- 流式输出:用户体验要求逐字显示,降低感知等待时间
第四层:兜底层(人工转接)
负责在 AI 无法处理时,将对话平稳移交给人工坐席。
转接时机和策略见下文「人工介入时机与策略」章节。
RAG + Agent 混合架构
当客服需要不只是"回答"而是"做事"时,需要引入 Agent 层:
RAG 负责的事:
- "你们的退货政策是什么?"
- "如何重置密码?"
- "配送范围包括哪些地区?"
Agent 负责的事(需要调用外部系统):
- "帮我查一下订单 #12345 的物流状态" → 调用物流 API
- "我要退掉上个月买的那个商品" → 调用订单系统 + 退货流程
- "帮我把套餐从 A 改成 B" → 调用 CRM 系统修改订阅
混合架构的关键设计:
- 路由决策:先用轻量级分类模型判断走 RAG 还是 Agent 路径,避免每条消息都过 Agent 的规划开销
- 共享记忆:RAG 和 Agent 共享同一份对话历史和用户画像,保证上下文连续
- 工具权限:Agent 可调用的 API 需要严格权限控制,尤其是涉及资金/订单操作时加二次确认
- 降级机制:Agent 工具调用失败时,自动降级为 RAG 给出参考信息并建议转人工
五个落地案例
案例一:电商客服(售前咨询 + 售后处理)
电商客服量最大的两类场景。售前侧用 RAG 回答商品参数、优惠活动、尺码推荐等;售后侧用 Agent 处理退款申请、物流查询、发票补开。
实现要点:将商品信息(SKU、规格、库存状态)实时同步到向量库,确保 RAG 回答的是当前真实库存。订单接口做幂等设计,防止 Agent 重复退款。
案例二:SaaS B2B 工单系统
SaaS 企业客服的核心诉求是减少工单流转次数。AI 客服在工单创建阶段自动收集信息(产品版本、报错截图、操作步骤),填好工单字段后再分配给对应技术团队。
实现要点:意图识别细到产品功能模块级别(如"仪表板-图表渲染-数据源配置"三层分类)。检索层包含公开文档、内部 KB、历史工单三类知识源,按优先级加权。
案例三:银行客服(合规优先)
金融行业对合规性要求极高。AI 客服的回复必须与监管口径一致,不能有任何自由发挥空间。
实现要点:检索层只索引经合规审核的文档,LLM 设极低温度(甚至 0)确保回复稳定可审计。所有 AI 回复被记录,支持逐条回溯。敏感操作(转账、修改个人信息)永久走人工通道。
案例四:医疗预问诊
医院场景中,AI 客服在患者挂号前完成症状收集、分诊建议、就诊准备提醒。核心价值是提高医生面诊效率,而非替代诊断。
实现要点:使用医学知识库(如临床指南、药物说明)做 RAG 基础。症状收集用结构化问卷而非开放式对话。明确声明"本系统不提供诊断,仅供分诊参考",降低医疗法律风险。
案例五:在线教育答疑
教育平台用 AI 客服解答课程咨询、学习路径推荐、技术问题排错(如编程环境配置)。
实现要点:知识库包含课程大纲、常见错误 FAQ、讲师录播文字稿。编程类问题用代码片段检索(Code RAG),不只是自然语言匹配。学习路径推荐需要结合用户已购课程和完成进度,需接入用户数据。
人工介入时机与策略
| 触发条件 | 类型 | 处理方式 |
|---|---|---|
| 置信度 < 阈值(如 < 0.7) | 自动 | AI 回复"我正在为您转接人工客服"并附上对话摘要 |
| 连续 2 轮未解决 | 自动 | 统计用户重复提问或表达不满的轮次,触发转接 |
| 用户主动要求转人工 | 手动 | 识别"转人工""找真人""客服电话"等关键词 |
| 敏感话题命中 | 自动 | 投诉、退款纠纷、法律威胁、人身安全等关键词即时转接 |
| 操作失败 | 自动 | Agent 调用 API 连续失败,无法完成任务时转人工兜底 |
转接质量保证:
- 转接时必须携带 AI 阶段的对话摘要 + 用户意图判断 + 已确认信息,避免用户重复描述
- 人工坐席在同一工作台看到 AI 的推荐回复,可以一键采纳、修改后发送或完全手打
- 建立转接率监控指标:正常范围 15-30%,过低说明 AI 过度自信可能产生幻觉,过高说明 AI 能力不足需优化
成本与 ROI 分析
成本构成
| 成本项 | 估算方式 | 说明 |
|---|---|---|
| LLM 推理成本 | 每轮对话 token 消耗 × 对话量 | GPT-4 级别约 $0.03/轮,DeepSeek 级别约 $0.001/轮 |
| Embedding + 向量库 | 文档量 × 更新频率 | 万级文档量月成本约 $50-200 |
| 知识库维护 | 人力投入 | 至少 1 人兼职维护知识库更新和质检 |
| 系统开发与集成 | 一次性 | 自研 2-3 人月,第三方平台按量付费 |
| 人工坐席保留 | 持续 | AI 无法完全替代,需保留 20-40% 人力处理复杂问题 |
ROI 计算模型
ROI = (节省人力成本 + 效率提升价值 - AI 系统成本) / AI 系统成本 × 100%
节省人力成本 = 原人工客服月均成本 × AI 接管对话占比 × 边际人力减少比例
效率提升价值 = 对话量增量 × 单次转化价值(电商适用)
AI 系统成本 = LLM 推理 + 基础设施 + 知识库维护 + 折旧典型参考值(以中型电商日均 5000 对话为例):
- 人工客服单人日均处理 150-200 对话,需 25-33 人
- AI 接管 60-70% 对话后,人力可缩减至 10-12 人
- 系统月成本约 $2000-5000,节省人力成本约 $8000-15000/月
- 额外收益:7x24 覆盖夜间咨询、首次响应时间从分钟级降到秒级
关键认知:AI 客服的 ROI 在小规模时可能为负(开发成本摊不下去),规模越大 ROI 越高。日均对话量低于 500 的企业,使用第三方 SaaS 客服 AI 产品通常比自研更划算。
常见挑战与应对
幻觉控制
客服场景的幻觉风险远高于一般对话场景,因为错误信息可能直接导致用户经济损失或法律纠纷。
策略层级:
- 检索优先:所有回答必须有知识库来源锚定,LLM 只能组织和润色检索到的内容,严禁自由发挥
- 引用展示:回复中明确标注信息来源("根据《退换货政策》第 3.2 条..."),用户可以自行核实
- 置信度机制:当检索结果相似度低于阈值时,不勉强回答,明确告知需要人工确认
- 输出校验:用第二个模型或规则引擎检查回复是否与检索到的原文矛盾
详细技术方案见 幻觉问题。
情感处理
用户带着情绪来咨询时,纯信息回答无法解决问题。
处理策略:
- 情绪识别:分析用户输入的负面情绪强度(急躁、愤怒、失望),对应调整回复语气
- 共情前置:在给出答案前先确认用户感受("我理解您对延迟发货感到着急,让我帮您查一下具体状态")
- 升级机制:高情绪强度自动触发人工转接,不让 AI 和愤怒的用户继续对话
- 禁忌用语:禁止"冷静一下""这没什么大不了的"等人机对话中的低情商回复
多语言支持
面向海外用户的客服系统需要考虑多语言。
方案选择:
| 方案 | 成本 | 效果 | 适用场景 |
|---|---|---|---|
| 各语言独立知识库 | 高(需翻译+维护多套) | 最好 | 核心业务语言 |
| 翻译管道(用户输入→翻译为中文→检索→翻译回目标语言) | 中 | 信息损失风险 | 长尾语言覆盖 |
| 多语言 Embedding 模型 | 中 | 新兴方案 | 语义级跨语言检索 |
| LLM 直出多语言 | 低(依赖模型能力) | 不稳定 | 非关键场景 |
与其他概念的关系
- RAG基础:客服系统的知识检索层,决定回答的准确性上限
- Agent基础:赋予客服"动手能力",从问答升级到事务处理
- RAG常见失败模式:客服场景中最常见的 RAG 故障及预防
- AI产品设计:AI 客服作为产品,涉及用户旅程设计、人机协作界面、信任建立
- 幻觉问题:客服场景幻觉的检测和防控策略
- 成本控制:LLM 推理成本优化、模型选型与降级策略
- Agent权限控制:Agent 调用业务 API 时的权限边界与安全设计
- RAG评估与优化:客服知识库的检索质量评估和持续优化方法
可继续补充的方向
- 多模态客服:用户拍照上传(破损商品、报错截图),结合视觉模型辅助判断
- 主动客服:基于用户行为数据(浏览停留、购物车放弃)主动发起 AI 帮助
- 语音客服集成:ASR + LLM + TTS 全链路语音客服方案
- 客服质检:用 LLM 对人工+AI 对话做自动化质量评分和合规检查
- A/B 测试框架:如何科学地评估 AI 客服对客户满意度(CSAT)和转化率的影响