这三周业余时间做了个东西,开源出来给大家看看。 DeskMind 得心:一个在 Mac 上替你操作电脑的 agent ,决定每一步怎么做的是两个跑在本机的小模型( Qwen3.5 0.8B 和 4B 微调,MLX )。不走云端,也不按次付费。 思路来自 Jev:把每一步变成选择题,让模型给每个选项打分,而不是生成一段文字。区别是 Jev 是云端服务,我想要一个全在本机跑的版本,所以自己在 Qwen3.5 上训了 0.8B 和 4B 两个小模型。决策服务用的是和 Jev 相同的 POST /v1/systemone 请求格式,已有的 harness 换个地址就能接到本机。和 TypeSafe 没有任何关系。 0.8B 有把握就直接做(大约 0.5 秒),没把握就交给 4B 再判断(约 3.6 秒)。任务有两种理解的时候,它会先问你,比如表里有两笔 Lisa Wong 的订单,它会问你用哪一笔,而不是随便挑一个写进去。 自己出了 13 个真机任务,每个跑 3 次,目前发布版是 38/39 ,没出现过没做完就说「完成」的情况。题是我自己出的、样本也小,仅供参考,逐...