最近自己折腾了一个项目,叫 TokenCut: https://www.tokencut.lol 起因其实挺简单。 前段时间一直在做 AI 相关的东西,接的模型越来越多,OpenAI 、Claude 、Gemini ,还有一些便宜的小模型。 用久了之后有一个感觉: 很多请求其实根本没必要用那么贵的模型。 比如翻译一句话、提取 JSON 、做个分类、改一下标题、总结一小段文本。 这些事情用便宜模型基本都能做。 但实际写项目的时候,为了省事,通常还是会固定一个模型。 比如整个项目默认都走某个比较强的模型。 这样写起来最简单,也不用管那么多。 问题就是账单也会比较简单粗暴。 用户问一个很复杂的代码问题,用这个模型。 用户只发一句“hello”,还是这个模型。 慢慢我就在想,能不能在真正调用模型之前,先判断一下这个请求到底难不难。 简单的就交给便宜模型。 复杂的再上强模型。 所以就做了 TokenCut 。 现在的思路是,在用户请求和真正的模型之间加一层。 请求进来以后,先让 Jev 判断这是个什么任务,大概需要什...