Tech
[技术栈] 《失控之前: AI 安全治理方案 AI Trust 现场》系列目录(14 篇 · 已更新 5 篇)
模型答错一句话,和 Agent 替你做错一件事,是两种完全不同的风险。 而大多数团队还在用第一代的办法防第三代的问题:加审核、写规则、堆提示词。 真正会出事的地方早就换了—— 上下文里混进来的内容、被写错的记忆、越权的工具调用、没人盯着的运行时。 《失控之前:AI Trust 现场》 14 篇, 从「模型说了什么」一路讲到「它替谁做了什么」。 每篇 3000 字上下。读完能直接拿去对着自己的系统提问。 ———————————————————————————— 14 篇,已更新 5 篇: 01 AI 安全到底在保护什么? https://mp.weixin.qq.com/s/fnyCL6gyldtEpNsI9Tjlxw 02 AI 能生成,不等于应该生成 https://mp.weixin.qq.com/s/e0Eo3K6cXaMJVHwDks3YKg 03 越狱:写好的规则,为什么会被用户绕过去? https://mp.weixin.qq.com/s/z0GBrKHI-oe8iufpBL5FpQ 04 AI 看到了什么,决定了它可能泄露什么 https:...
Read the full discussion on V2EX
This article was aggregated from V2EX. Click to join the conversation.
View on V2EX