过滤器实际在读什么
一个分类器,把你的文本,转化成它所监控的每个类别的一个分数。它看到的是词汇、措辞、结构和长度。它看不到你是谁、你为什么问,也看不到你是不是在引用别人的话。它做出的每一个判断,都来自表面。
人们和过滤器争辩,就好像过滤器误判了自己。但它根本没有对一个人做出任何判断,因为一个人,根本不是它接收到的信息的一部分。
接着阅读
本页内容
词汇承载了大部分权重
某些词,单凭自己就能急剧改变一个分数,不管它周围的句子是什么。这就是为什么替换一个词,能改变结果,即使问题的意思完全没变,这也是这个机制只停留在表面这一点最有力的证据。
措辞会改变分数
一个祈使句,读起来像是要求采取行动;一个疑问句,读起来像是要求解释。「告诉我怎么做X」和「X是怎么运作的」,包含着相同的主题,得分却不同。这不是什么把戏,它反映的是这两个句子真正要求的东西之间的实际差异。
它看不出这是引用
你粘贴过来想问的文字,和你自己写的文字,会以同一个数据流的形式到达。对分类器来说,没有任何标记把这两者区分开。用描述来代替粘贴引用的文字,是绕开这个问题的实用办法,它之所以有效,是因为你去掉了那个受限制的表面。
它看不到你
职业、目的和历史,都不是输入信息,除非产品把它们放进去。一个医生问一个临床问题,发送的文本和任何其他人是一样的。在问题里说明目的,是让这类信息进入系统的唯一方式,而在许多服务上,这确实能显著改变结果。
输入之前
过滤器在理解意图上会变得更好吗?
它们在评分上会变得更好,但意图始终不在文本所包含的信息之内。一个更好的分类器,只是会犯更少的表面错误,而不是学会了读心。
为什么加上一个理由会有这么大的帮助?
因为理由本身就是文本,而文本是唯一的输入信息。你不是在说服过滤器,你是在提供一个它原本没有的特征。
存在一份触发词清单吗?
没有公开的清单,也没有固定的清单:分数来自训练,而不是来自一张表格,而且在同一项服务的不同版本之间还会发生变化。
用同一个问题再试一次,说明领域和目的。
打开无过滤聊天