最近 jev 的讨论挺多,我们把它接进了「斯坦福小镇」的 agent 模拟世界,做了一个小实验。 虽然它用了像素风游戏的表现形式,但这个世界里没有玩家角色。人类只能观察,不能控制居民。画面中所有会移动的角色,都是 agent 依靠 jev 自己决定要去哪里、找谁,以及什么时候停下来。 目前场景里有 20 个居民。每个人都有自己的身份、性格、当前状态和对世界的共同认知。 世界运行后,他们会不断经历这样一个循环: 观察当前环境 → 决定下一步做什么 → 移动 → 发起互动 → 对话 → 更新状态和记忆 这次主要实验的是:能不能让 jev 来负责 agent 最频繁的「下一步做什么」决策( repo 里面有录屏) 我们的做法不是让模型自由生成一段 JSON ,而是先由引擎计算出当前合法的候选动作,例如: - 现在可以接近哪些人或物体 - 可以走向哪些地点 - 是否值得主动接触某个目标 - 如果不行动,应该短暂停留还是等待更久 然后把这些候选项交给 Jev 。一次请求里会同时询问 seek 、target 、roam 、place 和 idle_length ,再由代码按照固定规则组合成最...