四步配方 · STEP 04 / 调优

调优:同样的效果,
成本和可靠性可以差很远

一个「能用」的 Agent,和一个用得起、还靠得住的 Agent,差距就在这最后一步。客户最终要按月付钱、按结果验收——成本与可靠性,必须为你这一个场景专门调到位

前三步决定它「能不能干」,这一步决定它「值不值得天天用」。

调优 = 在「成本 × 可靠性」上,为这个场景挑最优点
场景 A · 高频 · 低风险 → 选 ReWOO(省 token 的模式) 成本 可靠性 ✓ 便宜、够用 场景 B · 高风险 → ReAct + Reflexion 自检 + HITL 成本 可靠性 ✓ 稳为先、可追溯

01 · 成本同样的效果,token 可能差几倍

达到同一个结果,不同模式的推理成本天差地别——思维树(Tree of Thoughts)搜索多条思路,强但贵;ReWOO 一次性规划、去掉中间观测,省 token。 我们按场景选:高频、低风险的活,就换上省 token 的模式,把单次成本压下来;这笔账,在交付前就替你算清。

02 · 可靠性该自检的自检,该兜底的兜底

高风险场景,宁可慢一点、贵一点,也要加自我复核(Reflexion / Self-Refine)、加护栏、加人审,把出错的代价摁住;低风险、容错高的场景,就从简,别为用不上的稳健性买单。 可靠性不是越多越好,而是配得正好。

03 · 为「这一个场景」优化不是通用最优,是你的最优

没有放之四海皆准的最优配置。我们调的,是你这个场景在成本、速度、可靠性之间的那个平衡点——这也是为什么交付前要拿真实数据反复测:分数高不算数,又快又稳又付得起才算数。

CASE · 高频客服

砍掉用不上的重推理,成本降下来、质量不掉

某品牌的一线售后咨询,绝大多数是「查物流、查政策」这类高频、低风险问题。一开始用的重推理模式效果好但偏贵;调优时,我们把这部分换成省 token 的模式,只在涉及退换货的高风险分支保留自检与人审。

单次推理成本显著下降
=
低风险问题回复质量不掉
HITL
高风险分支仍保留人审

四步看完了,想看它真长什么样?

回模式库挑个场景看「配方」,或直接跑一个 Agent 给你看。