从 Demo 到生产:Agent 的工程化挑战
Demo 能跑通和生产可用之间,隔着一整座工程化的山。
可观测性是第一关。Demo 里打印几行日志就够,生产里你需要每一步的输入、输出、耗时、token 消耗、工具调用链都能回溯。没有结构化 trace,一次线上故障你根本无从归因是哪一步的模型幻觉。
评测是第二关。Demo 靠"看着不错"过关,生产要靠回归测试集——固定一批输入、固定评判标准、每次改 prompt 或换模型都跑一遍。没有评测集,你无法判断一次改动是改进还是退化,只能在"感觉更好"里反复横跳。
成本控制第三关。一个不加约束的 Agent 循环很容易在失败时无限重试,单次任务成本从几分钱涨到几块钱。必须设 token 上限、步数上限、失败熔断,并把单次成本埋进监控。
Prompt 与工具的版本管理常被忽略:工具的 schema 一变,旧 prompt 就可能失效,但很少有人把 prompt 和工具版本一起纳入 git。最后是失败模式归因——区分"模型能力不足""工具实现有 bug""上下文不够"三种失败,才能对症修复,而不是盲目加长 prompt。
把 Agent 从 demo 推向生产,本质是把这些"看不见的脚手架"一件件搭起来。
← 返回想法列表