最近做的一个东西,顺手记一下思路,可能对也在折腾 Agent 的人有点用。 背景是这样:我们把几个 coding agent 接进了团队的 Slack 和 GitHub 。接进去之后很快发现一个问题——Agent 不知道什么时候该闭嘴。一个支持频道里,有人提问,有人贴报错,也有人回一句「好的谢谢」。如果每条都回,很快就没人愿意把它留在群里了。 最早的做法是最直觉的那种:把消息丢给大模型,问它「这条需要回复吗」,再解析返回值。能用,但有两个地方一直别扭: - 每条进来的消息都要走一次完整的模型调用,延迟是用户能感觉到的。 - 模型偶尔会很热情地解释它为什么这么判断,而不是老实返回我们要的那个值,于是我们得在返回里做字符串处理。 后来换了个思路:这种判断其实不需要「生成」,只需要「判断」。现在这部分交给 TypeSafe 的 Jev 来做——定义一个问题和判定标准,它返回一个带概率的类型化结果,路由逻辑写在我们自己的代码里,而不是写在 prompt 里。 这个区别比我原本以为的重要。想调「多严才回复」的时候,改的是一个阈值数字,而不是去改 prompt 里的一句话——后者经常会顺...