在 agent 这个领域,「凭经验选一个最优架构」是一种幻觉。
纸面上,每种 agent 模式都有它「适合」的场景:ReAct 适合需要边想边查的任务,Plan-and-Execute 适合步骤明确的长流程,Reflexion 适合容错要求高、需要自我检查的活。 这些都对——但只在 PPT 上对。一旦接上客户的真实数据和真实系统,纸面判断经常被打脸:一个理论上该用 ReAct 的任务,可能因为客户的工具接口响应太慢、上下文太长,反而是先规划后执行更稳。
所以我们承认一件事:第一版架构通常是错的,或者至少不是最好的。 承认这一点,反而让我们比「赌一个架构、然后硬调到底」的做法快得多、稳得多。
我们不押一匹马。我们让几匹马在同一条真赛道上跑一圈,再决定带谁上场。
01 · 框架模板 + 多方案择优不是 PPT 对比,是真跑真测真淘汰
第一段已经选定了候选框架的范围。到这一段,我们会按框架模板快速搭出两到三套候选架构——之所以快,是因为底层模式、脚手架、评测框架都是复用的,我们不从零造轮子。然后:
- 用同一批真实数据评测——拿第一段采集标注好的金标准数据,让几套架构跑同一组任务,比的是准确率、稳定性、成本和延迟,不是「谁的方案讲得好听」。
- 看坏样本,而不只看平均分——平均准确率高没用,我们重点看它在哪类输入上崩、崩得有多难看。一个会在关键场景上无声出错的架构,分数再高也淘汰。
- 把成本算进去——同样的效果,一套方案的推理成本可能是另一套的几倍。客户最终要按月付钱,这笔账必须在选型时就算清。
02 · 四维定制让通用架构,变成「你这一家」的
胜出的架构还只是个半成品。要让它真正能在客户那里干活,我们只在四个维度上做定制——这也正是同领域 A 公司和 B 公司的 Agent 真正不同的地方:
- 工具接口——接进它要调的系统:ERP、MES、工单、数据库、内部 API。
- 私有知识库——灌入这家公司的制度、话术、产品手册、历史工单,让它说「行话」。
- 记忆——让它记得住这个客户、这条产线、这个案子的上下文,而不是每次从零开始。
- 护栏——按这家公司的规矩,定下它什么能做、什么必须停下来转人工、出错怎么留痕。
架构是复用的,模型是装进去的,这四处才是为你单独配的。这套「复用底层 + 四维定制」的打法,让我们能为每一家配出真正专属的 agent 架构,又不必每次从零造起。