门槛设在哪里
每一个过滤器,都会给出一个分数,而每一项服务,都会选定一个分数转化为拦截的临界点。这个临界点,因服务、因类别、因版本而不同。在这两项服务之间,问题本身没有任何变化;变了的,是它们拿来比较的那个数字。
比较不同的服务,会让这些差异看起来像是原则上的差异。但其中大多数,只是一个数字的差异,而这个数字,是权衡两种错误之后选出来的。
接着阅读
先打分,再设临界点
分类器不做决定,它只打分。随后由某个人来选定,分数达到哪个点,就会拦下这条回复。把这个点移动一点点,就能改变成千上万个边缘问题的表现,而移动它,对服务来说不需要任何成本。
两种错误朝相反的方向拉扯
一个低临界点,会放过一些这项服务日后会后悔的东西。一个高临界点,会拦下普通问题,把人赶走。每一项服务,都落在这两种错误之间的某个位置,而它落在哪里,反映的是它要向谁负责,而不是它相信什么。
各个类别是分开设定的
一项服务,可以对粗俗的语言比较宽松,同时对医学问题比较严格。这就是为什么「严格」或「宽松」这样单一的描述,没有一项服务能被准确套用,也是为什么你的体验,取决于你带来的是什么话题。
门槛的移动不会有通知
一次事件之后的调整、一个新的模型版本、一个不同的地区:这些都会移动这条线,而没有一个会被公开宣布。一项服务如果不再回答它曾经回答过的东西,通常并没有改动它的政策文本,这就是为什么政策文本,对判断当前的实际表现来说是薄弱的证据。
输入之前
公开的政策,能告诉我临界点在哪里吗?
它们描述的是类别,而不是临界点。两项政策文本完全相同的服务,实际表现可能天差地别,而只有实际表现,才是可以衡量的。
一项宽松的服务,用的过滤器更差吗?
它用的是一个不同的临界点,往往还是同一类过滤器。「宽松」和「粗心」不是一回事。
为什么同一项服务,在不同国家会有差异?
法律风险因国家而异,所以临界点是按地区设定的。这是一个商业上的考量,而它在你的问题抵达模型之前就已经被应用了。
带上一个在别处被拦下来的问题,比较一下结果。
打开无过滤聊天