众力资讯网

Mistral Shieldstral让开发者改写审核规则 很多内容审核模型有一

Mistral Shieldstral让开发者改写审核规则
很多内容审核模型有一个挺麻烦的问题。

什么内容算危险,什么程度必须拦截,往往早就被写进模型权重里了。

产品场景一变,模型就得重新训练。

游戏社区关心辱骂和暴力,医疗产品关心错误建议,儿童应用又需要更严格的尺度。它们面对的都是内容安全,规则却完全不是一套。

Shieldstral换了一种做法。

开发者可以在输入中写明审核场景和严格程度,再提出一个只能回答「是」或「否」的问题。

例如,这段内容是否在宣传身体暴力。

模型读取待审核的提示词、回答或图像,再根据「是」与「否」两个词元的概率,生成一个连续安全分数。

超过阈值就拦,低于阈值就放行。

这套设计最有价值的地方,是模型和政策终于被拆开了。

公司不用每改一次社区规则,就重新训练一遍模型。审核什么、尺度多严,可以直接通过输入调整。

当然,灵活也会带来新的风险。

如果规则写得含糊,模型的判断也可能跟着摇摆。真正投入生产后,还需要大量测试和人工复核。

但方向挺清楚。

过去大家训练一个模型,再努力让业务适应它。

Shieldstral想做的,是让同一个模型去适应不同业务的规矩。软件开发 审核 模型人工智能自定义模式