两层,其中只有一层能被移除
过滤器,围在模型外面,可以被关掉。训练,在模型内部,关不掉。一项没有过滤器的服务,依然会遇到来自调校的拒绝,而这些拒绝的表现方式不同:它们用模型自己的声音写成,而且当包装方式改变时,它们会变弱。
「无过滤」,是一个关于外壳的说法。而模型自己学会了要回避什么,是一个独立的问题,把这两者混为一谈,会让人得出一项服务在过滤器问题上撒了谎的结论。
过滤器是一个独立的程序
它在模型之前或之后运行,有自己的一套规则,可以被关掉,而不触及模型本身。当它介入时,那条消息往往显得统一、像系统输出,因为它来自一个固定的集合,而不是生成出来的。
训练,在权重内部
在调校过程中被强化的拒绝,是模型生成文本方式的一部分。没有开关,也没有什么可以移除的东西,除非换一个不同的模型。当这一层介入时,拒绝的内容,是用和回答其余部分相同的声音写成的,这是把它和过滤器区分开来最清晰的方式。
两者失败的方式不同
过滤器是二元的、一致的:同一段文本,每次都会被拦下。一种训练出来的倾向是柔和的:模型会含糊其辞、给出一个部分的答案,或者在包装方式改变后就顺从了。所以一致性就是检验的标准,只需要试两次,不需要争论。
这对那份承诺意味着什么
一项服务,可以诚实地说自己不运行过滤器,同时依然拒绝一些事情,因为这个拒绝来自模型本身。选择一个为直接性而调校的模型,才能改变那一层,而这是在构建服务时就做出的选择,不是任何人能随手切换的设置。
输入之前
一个模型能被「反训练」,去掉一个拒绝倾向吗?
它可以被进一步调校,无审查变体正是这样产生的。但那之后,就是一个不同的模型了,而不是同一个模型改了个设置。
为什么同一个模型,在一个网站上拒绝,在另一个网站上却不拒绝?
因为隐藏的指令不同。这是介于过滤器和训练之间的第三层,也是这三层里最容易改动的一层。
一个训练出来的拒绝,有时候是对的吗?
它是当其他一切都被关掉时,依然守住的那一层,而它所守住的一部分,正是法律和基本的道义所要求的东西。去掉过滤器,不能作为去掉这一层的理由。
看看这里是哪一层在回答:问两次,比较一下措辞。
打开无过滤聊天