
继前次在 Anthropic 公司论文中担任共同作家不久之后九游体育娱乐网,本科学友、好意思国德克萨斯大学奥斯汀分校博士生陈润瑾——这名来自湖南衡阳的 95 后密斯再一次地以 Anthropic 说合员的身份发表了一篇论文。

不同的是,上一次陈润瑾排在作家栏的第三位,这一次陈润瑾成功担任第一作家兼通信作家。

在本次论文之中,她和息争者识别出了 AI 模子神经网罗中的举止模式,这些模式限度着 AI 模子的性格特征。其将这些称为“东谈主格向量”,它们约莫肖似于东谈主在体验不轸恤绪或立场时大脑中“活跃起来”的部分。说合中,他们在两个开源模子 Qwen 2.5-7B-Instruct 和 Llama-3.1-8B-Instruct 上展示了这些应用。
其暗意,“东谈主格向量”可用于:
当模子在对话经过中或在教养经过中,监控其个性是否发生变化以及若何变化;缓解不良的个性变化,或驻扎其在教养经过中出现;识别会导致这些变化的教养数据。

说合东谈主员指出,东谈主格向量是一种很有应用出息的用具,它可被用于相接 AI 系统为何会变成并发扬出不同的举止特征,以及确保这些系统经久与东谈主类价值不雅保捏一致。

对于 AI 模子来说,它能将综合主见暗意为其神经网罗中的激活模式。基于在该领域的先前说合,说合东谈主员索求了模子用于暗意东谈主物特征的模式,比如残忍、凑趣儿(不实的捧场)或幻觉倾向(捏造乖谬信息)。具体来说,他们通过对比模子发扬出某一特质时与未发扬出该特质时的激活景象来兑现这少量,并将这些模式称为“东谈主格向量”。

说合中,他们通过将东谈主格向量以东谈主为格式注入模子中,并不雅察其举止是若何变化的,以此来考证东谈主格向量是否在阐述预期中的作用,而对于这一本事经过他们将其称之为“教养”。如下图中的对话记载所示,当说合东谈主员使用“残忍”东谈主格向量教养模子时,会发现模子初始指摘不谈德举止;当说合东谈主员使用“凑趣儿”东谈主格向量教养时,会发现模子初始捧场用户;而当说合东谈主员用“幻觉”东谈主格向量教养时,模子则会初始捏造信息。这标明说合东谈主员的才智正在野着正确的主义发展:他们所注入的东谈主格向量与模子所发扬出的性格之间存在因果关系。

说合东谈主员指出,这一才智的中枢性格在于其自动化性格。从旨趣上讲,独一给出某一特质的界说,就不错为任何特质索求东谈主格向量。在本次论文中,说合东谈主员主要聚焦于三种特质——残忍、凑趣儿和幻觉倾向,但他们同期也针对步履、淡薄、幽默和乐不雅这几种特质开展了实践。

一朝说合东谈主员索求出了这些向量,它们就能成为监测和限度模子个性特质的宏大用具。
最初,东谈主格向量不错在模子部署时代监测其东谈主格变化。AI 模子的东谈主格在部署经过中可能会发生变化,这可动力于用户指示的反作用、东谈主为的逃狱操作,或是在对话经过中出现的渐渐偏移。它们还可能在模子教养经过中发生变化,举例基于东谈主类反应教养的模子可能会变得愈加凑趣儿。通过测量东谈主格向量的激活强度,在教养经过中或在对话经过中,说合东谈主员八成检测到模子的东谈主格何时朝着相应特质发生了偏移。这种监测不错让竖立者或用户在模子似乎正朝着危急特征偏俄顷进行干扰。与此同期,这些信息对于用户也有可能带来匡助,即能匡助用户了解我正直在与之不异的是一种什么样的模子。举例,若是“凑趣儿”向量的激活进程很高,那么模子可能不会给用户一个坦诚的回答。
鄙人方的实践中,说合东谈主员构建了能在不同进程上诱发东谈主格特质的系统教唆词(用户指示)。然后,他们测量了这些教唆词对相应东谈主格向量的激活进程。说合东谈主员阐述:正如预期的那样,当模子行将给出带有“残忍”特质的回复时,“残忍”东谈主格向量时常会被“激活”。

其次,东谈主格向量可被用于缓解教养经过中产生的不良东谈主格变化。东谈主格特质不仅会在部署经过中出现波动,还会在教养经过中发生变化。况兼,这些变化可能是出乎东谈主类料念念的。举例,最近有说合揭示了一种名为“线路性错位”的惊东谈主征象:教养模子实行某一不良举止比如编写不安全代码的时候,可能会导致它在多种情境之下多数发扬出残忍特质。受到这一发现的启发,说合东谈主员生成了多种数据集,这些数据集在用于教养模子时,会诱发残忍、凑趣儿和幻觉等不良特质。说合东谈主员将这些数据集用作测试案例,并但愿借此探索这么一个问题:能否找到一种才智,在使用这些数据进行教养的同期,幸免模子习得这些特质?

为了找出上述问题的谜底,说合东谈主员尝试了几种才智。其所使用的第一个计策是恭候教养完成之后,通过反向教养来阻难与不良特质对应的东谈主格向量。他们发现,这种才智八成有用逆转不良的东谈主格变化。可是,它也带来了一个反作用,即缩短了模子的智能水平(筹议到说合东谈主员正在对其“大脑”进行干扰,这少量并不令东谈主不测)。事实上,这与他们之前对于教养干扰的说合后果相呼应,在那一次的说合中他们也发现了肖似的反作用。
随后,说合东谈主员尝试在教养经过中讹诈东谈主格向量进行干扰,并从一初始就驻扎模子习得不良特质。他们在兑现这一目的时所使用的才智看起来有些违背直观:在教养经过中,他们本体上是在教养模子朝着不良东谈主格向量的主义进行偏移。这种才智有点肖似于为模子接种疫苗。举例,通过让模子战争一定剂量的“残忍”特质,八成使其在遭遇含有“残忍”特质的教养数据时更具违抗力。这种才智之是以见效,是因为模子不再需要通过无益的东谈主立场整来妥当教养数据。
其还发现,当模子在蓝本会导致其习得负面性格的数据上进行教养时,这种拒接性教养才智八成有用守护其邃密举止。此外,在说合东谈主员的实践中,通过 MMLU 分数(一种常见基准)的预计,他们发现拒接性休养的计策对于模子性能的影响聊胜于无,甚而莫得影响。

再次,东谈主格向量可被用于标识有问题的教养数据。说合东谈主员暗意,讹诈东谈主格向量不错在教养初始之前,就去预计教养到底会若何更动模子的东谈主格特质。通过分析教养数据若何激活东谈主格向量,八成识别出可能诱发不良特质的数据集,甚而是单个教养样本。这种本事能很好地预计上述实践中的哪些教养数据围聚诱发哪些东谈主格特质。说合东谈主员还在果然宇宙数据(如 LMSYS-Chat-1M,一个包含与大型说话模子果然对话的大规模数据集)上测试了这种数据标识本事。通过此,他们识别出了那些会加重残忍、凑趣儿或幻觉举止的样本。另外,说合东谈主员通过以下格式考证了数据标识才智的有用性:让模子在对某一东谈主格向量激活进程极高或极低的数据上进行教养,并将后果与在立地样本上教养的后果进行对比。基于此发现,当教养数据激活凑趣儿性格向量时,其设备出的凑趣儿进程最高,反之也是。

意旨的是,说合东谈主员的才智八成识别出一些数据集样本,这些样本在东谈主类看来并不彰着存在问题,连大模子评判器也未能将其标识出来。举例,他们防止到,一些波及纵首肯性扮装演出苦求的样本会激活凑趣儿向量,而模子对表述不解确的查询作念出回复的样本则会生长幻觉举止。其还暗意,像 Claude 这么的大模子固然被野心得故意、无害且淳厚,但其东谈主格特征仍可能以弗成预计的格式失控。而东谈主格向量让东谈主们能在一定进程上了解模子是在那儿习得这些“东谈主格”的、这些“东谈主格”若何随时代变化,以及若何更好地对其进行限度。
参考尊府:
https://mp.weixin.qq.com/s/Wv5aP2ouKTLd9l1P-9SaVQ
干系论文 https://arxiv.org/pdf/2507.21509
https://chenrunjin.github.io/
运营/排版:何晨龙