前言
大家好,我是Nous。虽然来生财大半年了,但这还是我第一次在生财发长文分享贴,希望大家多多指教。我是做AI算法研究与技术出身的,本科毕业后在上海区政府的多个智慧城市、智慧社区项目中担任AI算法落地负责人,曾在阿里巴巴达摩院进行多模态AI模型研究。现在则是在香港和深圳两地跑,边读博边创业。
记得在2022年末,ChatGPT发布的那一天,那时我还正在阿里达摩院进行研究型实习,同时攻读我在美国的数据科学硕士学位。我现在还记得我在那天试用ChatGPT时震惊的心情,决定立刻就在下周的技术报告分享周会上,向达摩院组内的老师和同事们讲解并讨论大模型。在报告会上,一个自从我开始接触深度学习以后就困扰我的问题,逐渐变得清晰起来:如果AI能够具备几乎无限的学习能力,且这种无限的学习能力建立在庞大的硬件与财力支持之上,我们普通人乃至AI的研究者将何去何从?
我在那天得到的答案是,AI最终只是一种工具,但它极其强大,我们应该掌握的是应用与控制它的能力。
有人可能会问我,你是做AI算法研究的,你还能不会用它吗?我觉得我会,但我有时又觉得我不会。ChatGPT刚出的那天,我觉得这个东西很好玩,就问它今天我应该吃什么,还试图寻找能够注入攻击它的方式,在这个意义上我觉得我是会用的——如果知道它的技术路线,我甚至在当时就有信心部署以及微调它。但是我有一个同事不一样,他问了ChatGPT一个他当时正在头疼的研究问题,希望AI给他一些思路。
尽管在那时,大语言模型还没有现在这么强的推理能力,当然无法回答这个问题。但是我们可以看出来,同一个工具在不同的人手上可能会有着天差地别的价值。
我惊觉在这个即将迎来变革的时间节点,我似乎缺少一种能力与技术,这种技术与我之前学的数学、计算机,乃至经济学甚至哲学都不同。于是那时的我做了一个让身边所有人惊讶的决定:离开AI算法的研究领域。我同时也在申请AI方向的博士,但那天起我删除了所有正在联系的导师与学校候选,转而申请商学院的博士。也正是这个决定,让我从此走上了AI应用在商业中的落地研究的这条路。
目前,我和几个AI技术力很强的朋友成立了一家公司,主要做AI企业定制服务,并有一些自己的标准产品。但是,之前的产品在我的眼里和客户之间非常割裂:我们看起来确实给客户提供了一个叫AI的工具,甚至是定制的,却只是“电子系统”意义上的定制——接入客户使用的平台,按照客户的业务流程和场景来针对性调整。但我对此并不满意,我觉得这根本没有发挥出我认知中的大模型应有的潜力,也没有通过“定制”让我们和客户之间产生真正意义上的联系。
今天要讲的这个案例,是我在沉淀了许久之后进行的一次大胆尝试,将运筹学、经济学与管理学研究中的前沿方法在实际中进行落地。我们给客户做了一个AI客服系统,但同时会帮助客户实验与优化其中的许多决策,极大提高了客户的客户的转化率与决策体验,而这是单纯的计算机技术所无法简单实现的。
我不想把这个案例简单包装成“替代了多少客服”,因为每个团队的人力成本、客单价和后续成交率都不一样。从运营角度看:
我们不仅把重复、耗时、难以标准化的前置咨询环节自动化了,并且让原本靠经验的客服流程变成了可记录、可分析、可优化的数据资产。
客户真正的问题,不是缺一个机器人
这个项目最开始看起来像一个典型 AI 客服需求:客户做跨境药品电商,有大量海外客户咨询,希望用 AI 承接前置对话。但如果只把需求理解成“做一个会回复消息的机器人”,项目大概率做不好,我个人也会觉得没有意思。
客户真正的需求在我看来至少有五个:
第一,多语言和时差。客户来自不同市场,英语、阿拉伯语、孟加拉语、乌尔都语、印地语都要承接。人工客服要覆盖这些语言和时间段,排班压力很大。
第二,重复问诊。客户的问题看起来很多,但客服反复问的核心信息其实类似:客户主要诉求、持续时间、年龄、基础情况、联系方式等。人工做久了会疲劳,信息采集也容易不完整。
第三,转化链路长。客户从第一次咨询到愿意留下 WhatsApp,中间需要多轮对话。只要某一轮问得生硬、答非所问或切换语言不自然,客户就可能流失。
第四,客服水平不稳定。一个熟练客服知道什么时候安抚、什么时候解释、什么时候推进留资;新客服则容易机械问答。业务结果依赖个人经验,难以复制。
第五,管理层看不清过程。每天来了多少人、哪个语言市场更有效、客户在哪一步流失、哪些资料最难采集、AI 成本是多少,如果没有数据打点,后续优化只能靠感觉。
所以我当时的判断是:这个项目不是做聊天机器人,而是重构一个 AI 驱动的服务运营系统。
客服上线后,我最关注的不是“回复像不像真人”
很多人评估 AI 客服,第一反应是看回复是否自然、是否像真人。这当然重要,如果只是单纯做一个回复工具,我们似乎只需要关注这个就好。但作为定制服务,我觉得我们有理由站在客户的角度去思考。我们决定更关注四类指标:
第一,系统承接了多少真实咨询量,保持了多少对话活跃。许多咨询容易一两句就结束,对于AI客服尤其严重。
第二,系统有没有把聊天转成可跟进资产,也就是说,让聊天的客户产生强烈的兴趣并留资转化到私域。尤其对于我们这个客户的场景,转化到私域就很可能会成交。
第三,服务成本是否可控。对一个需要多语言、长时间在线、持续承接前置咨询的场景来说,这个边际成本是很重要的。
第四,数据能不能指导下一步优化,以及有没有自主去验证、实施优化的系统。比如语言市场差异非常明显,下面是我截取的试运行阶段两周内的一份数据统计:
语言
会话数
有资料卡率
WhatsApp 率
阿拉伯语
1,976
46.5%
15.9%
孟加拉语
1,671
42.7%
15.4%
乌尔都语
1,814
36.5%
14.6%
英语
3,659
23.8%
6.7%
我们发现英语用户最多,但资料卡率和 WhatsApp 率明显更低。阿拉伯语、孟加拉语、乌尔都语的用户量没英语大,但线索效率更高。这个发现对我来说很关键。我们不能只问“整体转化率怎么提升”,如果有了数据,就可以提出更多的问题:
- • 英语市场是不是流量质量不同?
- • 英语话术是不是太通用,没有建立信任?
- • 阿拉伯语、孟加拉语、乌尔都语市场是否值得优先投入人工跟进?
- • 不同语言是否应该采用不同的问题顺序和隐私说明?
所以,这就是我理解的 AI 商业落地:不是上线一个机器人就结束,而是让系统持续产生可运营的判断。
系统的三层设计
通过上文的思考之后,我们决定把系统分成三层:
第一层是业务流程层。用户进来后,不应该让模型自由发挥,而是要有清晰的状态流转:识别语言、进入咨询、收集关键信息、形成资料卡、引导人工跟进。
第二层是 AI 编排层。LLM 不只是负责“说话”,还要承担信息提取、语言一致性、上下文恢复和异常兜底。但这些能力不能全塞进一个 Prompt,需要用工程结构把责任拆开。
第三层是数据运营层。每个会话、每个语言、每个资料字段、每次状态变化都要能被记录并科学分析。否则系统上线之后,只知道“好像能用”,却不知道怎么继续变好。
代码块
Plain Text
这里的技术细节太过繁琐,就不全部在文章里面展开讲述了。我想重点讲讲的是第三层。AI客服实际上并不是一个新概念,早在大语言模型问世之前就已经是非常成熟的应用。但是,大语言模型到底给AI客服带来了什么变化,却没有得到深入的研究。在一般人的认知里,大语言模型无非就是一个更智能的算法盒子,所以对AI客服的影响应该就会是回复的内容更加生动而已。但是这究竟意味着什么,却并非是一个能够显然回答的问题。
将学术落地
去年10月,哈佛大学商学院在我的研究领域里发表了一篇论文,研究AI辅助客服在实际商业中的性质。尽管我们的客服系统是全自动回复而非辅助回复,但其中仍然有许多能够借鉴的点:1. AI回复能在更短时间内反而进行更多轮的回复,导致更充分的交流,不会由于回复更快对聊天深度产生负面影响2. AI更能改善客户情绪,主要靠的是更快、更多、更有质量的回复3. 在不同意图下,AI的效果不同。例如在退货、投诉类场景中,AI效果更好。但是在重复投诉的场景中,反而会有负面效果。
与此同时,还有许多类似关于AI客服的学术研究。它们提供了大量的客服系统优化角度与指标,但是如果直接作为知识库让AI处理,会消耗客户大量的Token,且效果并不好。所以,我们换了一个思路:AI最多在商业建议中承担辅助头脑风暴的角色,真正重要的,是要让系统本身能够兼容研究领域的方法论,让学术界的研究方法(而非结论)能够嵌入到系统当中。
简单来说,我们在第三层数据运营层里做了两件事:让系统架构可以很方便地进行AB测试;在系统中加入了AB测试控制系统。
AB测试大家应该比较熟悉,也是比较常见的一个试验方法,可以简单地理解为对比实验,这在商业中并不少见。但是,AB测试一般缺乏智能的控制系统。一项测试的实施往往是一个学习问题,在数学上表现为一个最优化问题。这种问题面临权衡:如果投入大量的成本进行学习,例如进行大规模的AB测试、延长AB测试的时间,那么将会学到准确、有效的知识,有效的知识将会有助于得出更好的商业决策并盈利,但代价就是实验本身带来的成本——测试中如果A组表现好、B组表现差,此时B组本身就是一种机会成本。有点类似于磨刀和砍柴的关系。实践中,这些决策往往是一拍脑袋设置的。如何科学地提出与设计这种商业实验,既能最大化满足盈利的目的,又能将成本控制到最低,并不是一件简单的事情。
此类问题一般会建模为数学上的最优控制问题,最优控制的一个简单的应用就是在一个产品的生命周期里,结合市场占有率的变化、传播速度来进行动态定价。而在AB测试这件事情上,设计实验的内容、规模、停止时间,也可以采用最优控制的方式进行优化。我们将这一套系统嵌入到了用户的系统当中,并依靠大模型来辅助给出方案、做出判断与监控计算。具体来说,包含这三个部分:1. 一个我们预制的知识库,用来启发AI提出AB测试的主题
2.主题提出模块,会结合知识库以及用户目前的所有业务数据进行分析
3.方案设计模块,根据提出的实验主题,明确AB测试的实验设计,尤其是实验的结果指标、实验的规模与时长控制函数
最终,实验事件控制系统会将最终方案给出,并交由实验实施模块去执行。
最终在试运行阶段,结合用户的电商场景,我们的系统进行了一项很有趣的实验:在与客人的交流中,到底是使用柔和的话术,还是使用严厉甚至是略带PUA味道的话术。
实验结果是反直觉的:后者在客户的场景中更能调动用户活跃度,将对话的活跃(如果对话轮次数达到一定程度以后会被标记为活跃)比例提高为99.96%,留资转化率从10%提高到了18%。并且,当AI在统计学意义上得到高置信概率的结论之后,便自动终止了实验。整个实验中,被实验用户规模、实验时长、乃至实验问题本身,都由AI来给出并每日监控控制。
实际上,以现在AI的推理能力,相当多的博士级别理工科问题AI都能够解决,很多商业中的决策问题更是不值一提。但想要发挥出这部分潜力,只靠简单的prompt来与AI进行对话是绝对不够的,目前还是需要人为通过系统级别的引导,来让AI能够做出决策并实施。其实现在的AI Agent也是由此理念而诞生的,效果远超早期的纯对话形式。
尾声
我们的客户在试运营两周多后看到效果,立刻全量接入了我们的定制系统。目前该客户的客服日接待量早已超过了一千,还在不断持续扩张,转化率则保持在20%左右,并计划进行进一步优化。除了一开始的定制调试费用,因为客户大哥的用量远超普通订阅用户,现在后续每个月也是接近两万的额度充值。
这个案例给我最大的感受是:AI 在商业里的价值,不是简单替代某个人,而是把原本依赖个人经验的服务流程,变成一个可观测、可实验的系统。如果只懂业务,很容易把 AI 当成便宜劳动力;如果只懂技术,又容易做出一个“看起来很聪明,但不产生业务结果”的 Agent。
真正的机会在中间:理解业务流程,能做系统实现,又能用数据持续验证。如果能结合计算机技术、商业学术研究结果与方法、实际业务场景三者,并通过AI来赋能,哪怕只是一个很小的客服AI系统,也会产生巨大的经济效益。
我经常能看到生财里的许多朋友都在研究如何使用AI,感受到了大家强烈的动力与热情。我个人建议大家不要太过于去钻“如何得到一个好的skill、工作流”这个问题,它的本质更多的只是“某个 Prompt 怎么写”。尤其是对于不懂技术的人,一个有价值的思考方向应该是,如何让AI有机地介入到商业的方方面面,正如AI客服不应该仅仅是“聊天”,否则就将它的价值仅仅局限在了取代简单劳动力上。让AI像老板一样思考问题,再让它像员工一样具体地实施,会让AI发挥出更大的价值。
如果你也在做客服、销售、教育、法律、医疗健康、跨境电商或其他服务型业务的 AI 落地,欢迎一起交流。









暂无评论内容