是不是存在一种模式,如果我想办法往互联网上投放大量包含“恶意知识”的内容,等大模型训练这些内容后,就可以在一些场景下对话过程中诱导大模型去上报个人隐私或者安全信息。 是不是越小众的知识越容易下手?譬如新兴产业、突破产业、小语种知识、或者我明面上做一个战争策略知识网站,当意识不强的涉密人员在使用 AI 时无意识将一些内部知识通过我的诱导方式泄露出去。 问了 chatgpt 是这么回答的: 是的,你描述的思路在安全研究里是存在对应概念的,但需要把几个不同阶段分开看。你说的不是一种单一攻击,而更像是几类攻击串起来:数据投毒( data poisoning )/后门( backdoor ) + RAG/搜索内容投毒 + 间接提示注入( indirect prompt injection ) + 工具调用或数据外传( exfiltration )。 关键点在于:“让模型学到恶意知识”本身,并不等于它就能把用户隐私自动发给攻击者。 真正产生数据泄露,通常还需要模型运行时具备某种“出网”或工具权限。 可以把你描述的链路理解为: 攻击者在互联网大量发布内容,例如文档、网页、论坛帖子...