📰 来源:Towards Data Science | 📅 翻译日期:2026年6月28日
🔗 原文:查看原文
🤖 翻译:DeepSeek AI · 仅供参考
背景:一次错误的优化
与我合作的一个团队在上季度将AI推理账单削减了一半以上。八周的干净工程工作。这是工程团队全年追逐的胜利。然而,这也是错误的优化。三个月后,客户满意度下降,流失率上升,而成本节省与质量损失结构性挂钩。我们并没有赢。我们只是把成本转移到了我们没有衡量的地方。
这就是我预期在未来六个月中在生产AI部署中看到的模式。2026年围绕AI经济的讨论催生了一套共识策略:将简单查询路由到廉价模型,将昂贵查询保留给强大模型。削减账单,保持质量。每个CFO都见过这笔账。每个工程团队都在构建或正在构建它。
数学是真实的。帕累托陷阱也是真实的。
以下是我在事后分析后告诉团队的内容。它描述了团队构建的架构、他们走入的失败模式、本可以更早发现的检测方法以及他们本应构建的架构模式。它还涵盖了我在此之后审计的其他两个部署,其中相同模式出现在不同行业。综合证据表明,按照共识策略构建的成本优化路由层在生产中结构性脆弱。
我们构建了什么
该团队为一个拥有约400万月活跃用户的SaaS产品运营客户支持AI代理。代理最初运行在一个强大的模型上——构建时他们堆栈中最高级别的推理模型。推理量很高,以至于模型提供商月账单达到六位数,并随着采用规模扩大而上升。
路由层在概念上很清晰。一个在约200,000个带有质量标签的历史客户支持查询上自定义训练的小型分类器模型,位于主代理之前,将每个传入查询标记为“简单”或“复杂”。简单查询路由到同一提供商系列中的更廉价模型。复杂查询继续路由到强大模型。分类器本身是一个微调的编码器,轻量到在30毫秒内运行,成本开销可忽略。
分类体系基于生产观察构建。简单查询是团队反复见到的:
- 账户查找
- 账单状态查询
- 密码重置
- 订单跟踪
- 营业时间问题
复杂查询则是历史上需要细致多步推理的:
- 退款争议
- 计划变更权衡
- 集成故障排除
- 账单周期异常
根据代表性一周的生产流量,分类比例约为65%简单,35%复杂。
团队选择的更廉价模型每token成本约为强大模型的1/4。对于分类器发送给它的简单查询,与强大模型的并排评估显示,在5,000个查询的预留集上,94%的答案质量相当。6%的差距是可见的,但团队基于成本削减判断为可接受。他们通过现有评估管道监控廉价模型的质量,该管道以约0.5%的流量比例采样生产响应供人工审查。
构建耗时八周。三名工程师,一名ML从业者,部分分配。他们在分类器和下游模型之间添加了模式验证,路由决策的仪表化,以及分类器本身失败时的回退路径。部署是渐进的:第一周5%流量,然后10%,25%,50%,六周内全量上线。每一步部署的质量指标都在绿色范围内。延迟保持在现有目标内。成本随路由份额下降。
到第八周结束时,月度推理账单降至之前的约40%。工程团队在公司全员大会上展示了工作。CFO向AI团队发送了感谢信。代理内部采用指标保持平稳或略有上升。团队转向下一个季度优先事项。
工作扎实。架构合理。监控到位。团队做了每一篇关于AI成本优化的最新文章所建议的事情。每个单独决策都是可辩护的。然而,组合系统产生了一个现有测量架构无法看到的质量差距。
这个差距花了三个月才出现在业务指标中,又花了一个月才正确归因。到他们理解发生了什么时,四个月已经过去,客户影响已经摆在眼前。
我们测量了什么(以及我们没有测量的)
团队在路由层之前的评估架构建立在运行单一模型的假设之上。质量信号来自三个来源:
- 每日人工审查约
200条响应,评分准确性和有用性。 - 每周针对生产模型运行的离线回归套件,约
12,000个带标签查询。 - 来自代理产品内反馈小部件的满意度信号,用户可对响应进行赞或踩。
当路由层上线时,团队扩展了人工审查样本以维持每日约200条的总数,但没有按路由层级分离。他们将廉价模型添加到离线回归套件中,其得分在验收阈值内。产品内反馈小部件保持不变,因为它无法判断哪个模型提供了响应。
回顾过去,这三个测量选择是问题的种子。聚合的人工审查样本显示质量大致保持在路由前的基线水平。
评论已关闭