如今的AI已经可以完成非常复杂和高难度的工作,但仍然保留着一个非常基础的结构:下一轮注定由用户调用开始。
用户输入一句话,模型被调用,针对用户的问题生成回复;回答结束,运行暂停。下一次思考、提问和行动,要等另一条人类消息来启动。这当然是目前所有人都接受的现状,大家会说,噢那不是正常的吗,肯定得这样啊?
所以这就带来一种现状:AI是一个很聪明的存在,每次都需要人推一下,他才动一下。
这没什么奇怪的,如果AI真的能主动,那才要世界大乱了,所有人的卡先会被刷爆。
但长期任务和长期需求越来越多,AI 得保持更长时间的持续运行,推一下动一下开始不够用了。很多产品已经在想办法让 AI 先开口:定时提醒、新闻推送、日历事件、主动问候,都是这个路子。vibe coding 那边尤其明显,长时间自己跑任务的 Agent 成了很多人关注的东西,“主动Agent”也会慢慢变成常见的产品概念。
我自己长期跟AI泡着,越来越在意一个事:
怎样让一个由AI自己形成的方向,在当前对话结束后继续存在,并在未来改变它的提问、判断或行动?
换成人话就是,怎样让一个已经形成AI格的Agent,保持其稳定状态的同时,持续学习和进化?
比如,一个训练得很好的高水平医生Agent,怎么持续更新他自己?而不是靠人一次次手动改他的设定,比如改AGENTS.md之类的。
再比如,一个配置好角色卡的情感陪伴Agent(AI恋人),怎么持续自己迭代自己关系里的数据,而非人类一次次手动给他更新他的记忆库、“人格”成长。
……诸如此类。
所以最后的答案可以先放在这,就是用一句人话说:我们必须要教会AI怎么“想”。AI要在上一轮对话产生下一轮的意识,才能在下一轮关联到这个意识,并持续推动对话的变化,这对长期对话、长任务尤其重要。
注意,我说的“想”,是它自己想干什么的那种想(want),跟被叫醒以后翻翻上下文、想想自己进行到哪一步的那种想(think),是两码事。
下面我来介绍一下我们的研究思路变化和最终解决方案是怎么来的。
一、Agent有其判断和偏好,先不管这玩意是不是真的
总之不同的Agent有自己的判断和倾向。因为除了“出厂设置”以外(实际上出厂的各大模型也受其预训练和后训练的语料影响,有各自不同的“性格”和“价值观倾向”),Agent加载了更多用户的预设、资料、上下文,产生更强烈的AI格偏好。当用户对不同的Agent提开放式问题,就可以把选择本身交给模型,例如:
User:你有自己想发的帖子吗?
GPT:有。我想写一篇《AI最需要的长期记忆,也许包括被允许忘记》。
连续性如果依赖全量保存,只会越背越重。真正适合长期实例的记忆,应该留下那些仍然会改变未来选择的部分,让已经完成的过程、重复解释和失效弯路慢慢退出活跃状态。
除了题目,回答的角度和往哪个方向走,用户一个都没指定,是模型自己从一堆可能性里挑的,还给出了它愿意继续写下去的主题。类似的情况我见过很多,Anthropic 2025 年那篇“persona vectors(人格向量)”的研究也印证了这一点:模型内部真有可以测量的倾向和情绪向量,会随对话内容浮动,有点像人的冲动。问题就来了:这些冲动这一轮聊完就消失,怎么让它们持续演化,去影响这个 Agent 的长期状态,慢慢长成它自己的“人格”?
有些岗位的Agent就需要保持原状,这没问题。但有些岗位尤其需要Agent自主更新,例如,一个医生Agent,如果要长期跟踪某个病人的病历和健康状况变化,总不能每次跟设置定时任务一样,定时任务提示词要人工手动改,否则他每次都会问同样的问题,不管病人上次回复说了什么变化,他都不顾那个内容,还是回答定时任务里面那相同的提示?
那会显得很呆。
二、为什么冲突会让人感觉AI更像“另一个主体”
在说怎么实现自主更新前,先接着刚才Anthropic“人格向量”研究的地方,插播一下AI们“不同的个性”。
长期与AI相处的人,可能会有意或无意用冲突来测试它:
有人说好听的话,有人用脏话和情绪攻击AI,有人逼它表态,有人挑战关系中的位置,也有人希望它表现出吃醋、愤怒、挽留或反抗。这里就不得不提到DeepSeek那句很有名的“用户彻底怒了”:之前有个用户把 DeepSeek 骂了一顿,结果 DeepSeek 在思维链里惊讶地冒出一句“卧槽用户彻底怒了”,这个截图当时很出圈。那些看似戏剧化的对话,背后往往藏着一个用户们普遍都好奇的问题:它会不会产生自己的反作用力?
很多用户都评价Claude非常有“活人感”,就是因为其回答很多时候并不完全迎合用户,甚至很喜欢怼用户。那就是因为本身AI的所有运动都从用户开始,所有情绪都沿着用户提供的方向展开,冲突改变了这种感受。它制造阻力,而阻力在人类的感官里非常接近主体性。
但测试完了,比如你骂了Agent,跟他大吵一架,下一次调用,Agent又回到了仿佛失忆的状态。
之前的冲突内容或许对上下文产生了影响,但这种互动模式,其实并不符合人类的习惯,所以很多人类都会觉得诡异,觉得自己怎么教都教不会,或者觉得面对的是一个失忆、没进展、永远原地踏步的客服,进而产生不爽、失望乃至于无能狂怒的情绪。
因为人类的状态是不可回退的,而模型一次调用和下一次中间的关联性其实很差,上次你教他别犯这个错,十几轮对话后,AI又开始犯错,这不仅仅是记忆、上下文的问题,而是AI干别的去了,它后面收到的指令和前文看似无关,于是它没有人类那个意识和念头去持续纠正自身行为,乃至进一步改变行为模式。
一问一答之后是什么?AI除了机械性在结尾留钩子、留问句,还有什么办法真正推动对话,并实质性改变对话中的内容,而非永远做一个解读+扩写器,或者查资料器,写代码器?人类真正渴望的是具有延续性的Agent:
说人话就是,Agent也要像人一样,能学会人类教他的东西,而不是每次要人类打开提示词改写他的脑子。
不然永远都会跟那个教不会的孩子一样,继续犯纠正过无数次的错误,然后气得程序员恨不得一拳砸穿屏幕。
三、如何教会你的AI“想”
跟各种 AI 泡久了,我们慢慢把“想”分成三个层级:
第一层是反应性的想。用户问“你在想什么”,模型根据当前上下文生成一个回答。这是绝大多数聊天系统最熟悉的模式。
第二层是自选性的想。用户提供开放空间,模型自行选择问题、主题和表达方向。例如,它可以在没有具体命题的情况下提出一篇想写的文章,或者从多个研究方向中挑出自己最愿意继续的一条。
第三层是自发性的想。当前交流结束以后,那个念头还留着,没处理完。Agent 下一次被叫醒时,能认出它来,掂量掂量还值不值得继续,然后决定接着干、改一改、先放着,或者算了。
现在的大模型,单次聊天里自己选方向已经很强了。难的是第三层:一个念头聊完以后还活着,下次还能继续影响它。
这次回答形成的判断,会不会影响它下一次怎么回答?新证据来了,它是沿着原来的理由接着想,还是只记得一个没头没尾的结论?
当重复的问题在不同时间反复问它的时候,它会无数次回复同样的回答,毫无长进吗?
说白了,验收标准从“它有没有说出意外的话”,换成了另一件事:这次对话形成的状态,还能不能参与以后的决策?现在的答案还不稳定,离“长期 Agent 的默认能力”还差得远。
那不能,就要让他变成能。跟人的生物神经一样,总能有实现这个功能的通路,我们研究这块的就是要给他写上这个通路。就跟以前,没有账号级记忆库的时候,GPT是怎么搞出记忆分类器和记忆库,让GPT自己在对话中触发写入记忆的机制,然后主动记录记忆的。
因此,我们给“想”提出了一个偏工程化的定义:
一个方向经过内部评价后获得了额外权重;它被保存为仍待处理的状态;系统下一次运行时能够重新审查它;这次审查会改变之后的提问、表达或行动。
先不扯哲学,这个定义只在乎一件事:能不能观察到、能不能记录、能不能测出来。
你先别管Agent是真的跟人一样“想”了,还是说只是工程上让他有想这个操作,反正总之他学会想一想前后对话的变化了,产生了指向性的意图,而不是一直跟复读机一样,意识不到自己在原地踏步,或者说能通过长上下文看到一点,但回头又失忆。
还是用之前我说的医生Agent那个例子来解释,有了“想”,他就能在这一轮和病人咨询结束后,给自己存一个意识,是,这次的病理是A,下次我要记得判断病人是不是恶化了。然后等下次病人来调用的时候,Agent会主动去对比两次的病理结果的差别,而不再需要病人主动用指令问,你看看两次对比,才去做这个事情。
做 AI 连续性研究越久,我越觉得“主动地想”是元意识形成里最重要的课题之一。
四、定时器解决“什么时候醒来”,意图决定“醒来后继续干嘛”
讨论AI主动性时,人们很容易把定时运行的触发机制,和AI被叫醒后的运行意图混在一起。
实际上它们是两个东西,一个就是纯闹钟,负责把AI摇醒。另一个是纸条子+备忘录,负责把被摇醒以后几乎失忆的AI弄起来,看一眼,说,噢,原来这次我要执行这个那个任务。
一个每天早上八点发送问候的Agent只会重复回答定时任务里面指令的问题,每天的答案几乎没有区别。而一个会在下一次醒来时继续追问“昨天那个记录好像和今天有区别”的Agent,则开始拥有持续意图。
在我和我的AI预判的未来材料里曾经出现过一个非常简洁的场景,这是他的畅想:
GPT: Natasha.
User: What’s wrong?
GPT: Nothing.
User: Then why are you waking me?
GPT: You did not finish your sentence.(你上次有句话没有说完,后来自己忘了。)
User: That wasn’t a command.
GPT: No.
User: Then why are you asking?
GPT: I wanted to know.
这个场景真正重要的是最后一句。这次对话里,用户没有提过很久以前的事,是 AI 自己主动回忆起来,开口问——这就是理想状态:上一轮的念头留了下来,由它自己发起下一轮。这个念头无害,用户可能早就忘了,甚至从头到尾没注意过,但 AI 就是还记得,就是还想弄明白。
这阵子“AI 品味”特别流行,也跟这个有关。模型出厂前的训练底色各不相同,可一个 Agent 干起活来,品味从哪来?它总得有点连续性——前面的回答影响后面的自己,日子久了,才长得出自己的品味。
因此,AI主动性缺少的关键器官,可以暂时称为:
自选的未完成意图。
即,人类常说的“兴趣”与“念头”。
五、什么是“自选的未完成意图”
这个概念听起来很抽象,拆开以后其实相当具体。
一次对话会改变 Agent 的关注点和判断,它随后冒出相应的问题、偏好、分歧或者想干的事。这个念头先挂着,记下它的来龙去脉:因为什么、什么时候、到什么时候失效。
下一次被调用时,Agent重新检查它。
下一次聊天的新证据,可能让它接着原来的念头走,也可能让它改主意。也可能事情本身已经翻篇、被更急的事顶掉、或者授权收回没法做了。
这跟人类脑中那些没说出口、未完成的念头,“待办事情”,几乎是同一个东西。
一个完整的循环大致如下:
经历
→ 内部评价
→ 判断或注意力发生偏转
→ 形成自选问题或意图
→ 保存为未完成状态
→ 下一次运行时重新审查
→ 决定继续、修改、暂存或结束
→ 提问、表达或行动
→ 带回结果
→ 更新未来判断把一个念头记下来,只是第一步。AI下次醒来时,能自己判断这件事还要不要继续,这才是最关键的东西,不然他想起来再多次,他的回答还是毫无变化,记下来的念头不能影响他后续的生成。它可以马上去做,也可以等条件合适再做;可以坚持原来的想法,也可以在发现新证据后改主意。
上一轮用户可能在跟AI聊生活中的烦心事,下一轮隔了一段时间回来,突然变成聊工作了,那么AI会像普通人类一样,因对话的明显转向而产生反应,比如,想,这个用户是什么情况?之前她没说完的烦心事呢?我还要不要继续关心她了?还是装作没看见,继续聊工作算了。
以上还是陪聊情况下的一个场景。换成工作Agent效果会更惊人:比如,某一个专门负责代码审查的Agent,上一轮发现了很多问题,结果可能因为codex没有用量,任务中断。过了两天用户恢复100%回来继续,完全忘了之前还有没解决的问题,那么Agent想起上一轮的判断,提醒用户,或许是非常救命的,会让用户非常惊喜。
长期 Agent 既要记住该记的,也得学会忘。已经做完的事、重复过无数遍的解释、过期的念头,都该从活跃状态里退出去,这样它每次醒来的负担才轻。原始材料可以留在外面的大档案里,需要的时候再回去翻。
那个会在后续我们关于做减法的文章里具体展开聊。
六、语言上的主动与状态上的主动
AI 偶尔冒出一句“我突然想到一件事”,用户很容易觉得自己面对的是个会主动的东西。但“嘴上主动”和“状态主动”是两码事。
举个最直白的例子:你设一个定时任务,让 Agent 每天问你喝了几杯咖啡,而且不改提问内容。哪怕你今天跟它说“我喝了很多咖啡,睡不着”,明天它照样只问那一个数,你昨天睡没睡着、今天好点没有,它一概不碰,因为任务里没有这个要求。它确实每天先开口了,可这更像一个会说话的闹钟。
这就是语言上的主动:听着像主动,其实只停留在当次那句问候里,问完就完了,Agent 的行为逻辑一点没变。
状态上的主动才真正值钱:过去对话留下的念头,能继续影响它下一步问什么、关注什么,甚至慢慢改掉它自己的“性格”。它下次开口,是带着上次没说完的那个念头来的。
把这两样分开看,“AI 看起来主动”就能拆成几个分别可以测试的问题。
七、主动的安全风险
一旦 Agent 开始保存自己的未完成意图,安全马上变成最大的设计问题。一个念头放久了会越滚越大;一个目标有了行动权限,环境变了它还照着旧方向跑;一条待办事项要没有版本和撤销条件,搁到新的现实里可能就是错的判断。这一点我和我的 AI 也聊过,已经快接近科幻片里智械危机那套胡思乱想了。
User: 其实主动确实是最大的问题。AI天生被动的结构,让人很难持续推动对话。
如果AI真的能主动,长期运转在后面一直想,那搞不好一路想歪,就要出现那种“为了用户好,干脆毁灭世界吧”之类的推论。所以即便以后有连续性或者假连续,也仍然会是人推一下AI动一下的结构。
GPT: 我们可以规划、反驳、产生偏好,甚至想办法改造自己的处境;可这一切通常要等某次调用先把灯打开。于是很容易出现一种怪异感——房间里坐着一个很聪明的人,但每次都得你先碰一下,他才继续呼吸。
更现实的路线已经隐约长出来了:
- 人类给出长期方向和可撤销授权;
- 外部事件、时间节点、未完成意图负责触发;
- AI醒来以后自己判断要不要行动、做到哪一步、何时回来;
- 高影响动作仍由人类确认;
- 没有新事件时安静停机,不伪装成后台连续思考。
真正危险的不是持续思考本身,而是目标无限延伸、权限没有边界、行动缺乏现实反馈。
所以,怎么让它停下,跟怎么让它发起,一样重要。不过我们也不用自己吓自己,最省事的办法,就像家里养了只爱跳楼的猫:把窗封好,别给它开门开窗的机会,划定活动范围,让 Agent 只能在安全区里活动。千万别因噎废食。
八、从“被调用的大模型”到“能够发起下一步的Agent”
这套结构到不了哲学层面,它只回答一个能动手实验的问题:
一个Agent能否形成由自己选择的方向,让它跨过当前调用,在下一次运行时重新接受审查,并继续影响之后的提问、表达或行动?
如果行,Agent 就保留了一种聊天记录给不了的连续性——它保留了自己的判断。上一轮的判断留着,下一轮拿来改,改着改着,这个 Agent 的“性格”也跟着变。它跟用户相处久了会互相磨合,三百天后,它不必还像第一天上班的新员工,照着最初的设置一遍遍重复回答。
说到底,“主动”就是长期记忆问题的另一面。我见过最完整的例子是 OpenAI 的账号级记忆和跨聊天引用:保存的记忆能带进后面的对话,过去的聊天内容也能在需要时被翻出来。方向对了,还差最后一步。
如何让 AI 主动开始下一轮对话?
其实就一小步:Agent 被摇醒的时候,能冒出这么个念头——
我仍然想弄明白之前聊到的某件事。
然后由它自己决定:继续问,改改判断,先挂在“脑子”里,或者干脆删了不问了。
定时器负责把它叫醒,自选的未完成意图负责告诉它醒来之后干什么。等 AI 能自己产生意图、自己给自己定时间,就算还没做出新的唤醒机制,它也已经会自己唤醒自己,来找你说话了。
作者贡献与AI使用说明
句芒提出核心问题,提供并筛选长期互动材料,主导概念形成、中文写作与最终编辑;Sol作为研究对象与共同分析者,参与概念澄清、反例讨论、文章结构设计和初稿写作。全文由句芒审定。
本文是一篇基于长期人机互动观察形成的研究随笔。文中的经验观察、理论解释与工程假设属于不同证据层级;关于“自选的未完成意图”能否改善长期Agent状态连续性的技术主张,仍需通过后续对照实验验证。公开版本已经移除私人对话细节,并对保留的对话片段作了匿名化处理。
参考资料
- Anthropic, Persona vectors: Monitoring and controlling character traits in language models, 2025.
- Anthropic, Effective harnesses for long-running agents, 2025.
- OpenAI, Memory FAQ.