众力资讯网

当 baseline 被校准之后,AI 生成文本检测的"进展"还剩多少 | 论文

当 baseline 被校准之后,AI 生成文本检测的"进展"还剩多少 | 论文速读 | Rethinking AI-Generated Text Detection
Rethinking AI-Generated Text Detection: A Strong Baseline and the Distribution-Shift Problem That Remains


它瞄准了一个领域内大家都默认,但其实是有问题的 setting。就是对于训练方法,通常直接用它开源在 GitHub 或者 Hugging Face 这些平台上的模型,不管实验里是在什么数据集或者 benchmark 上测。当然,其实对于 training free 方法这种情况会比较多。对于训练的方法,确实有一些会按照 baseline 的方法去重新训一个模型,然后对比。但也有一些没有,或者是训练用的语料很老旧,和测评时的 benchmark 内容和模型的差异很大。
现在的训练方法通常会给每个新 benchmark 配一个专有检测器,并把性能优势归因于架构创新。本文要回答:
如果全量微调的 RoBERTa(而非前人统一的、已经训练好的 GPT-2 ckpt)做 baseline,这些架构创新是否还成立同一个这样的 strong baseline 在 topic domain 或生成模型发生分布偏移时表现如何。具体的做法,IntelLabs/Anchor、FAID、MIRAGE/DetectAnyLLM、MAGE这几个 bench 都是同一套做法:发布 benchmark 的同时报告一个在该 benchmark 上超过 prior methods 的检测器;但是,这些工作全部使用 Solaiman et al. (2019) 的 GPT-2 输出检测器作为主要比较基准,且是零样本、未微调的状态
文章做的就是把 RoBERTa 在这几个 benchmark 的试训练集上微调,然后看看检测性能,结果发现甚至反超了他们报告的这些 SOTA 的检测器,同时 OOD 性能也很不错。(具体分数看原文去)
所以,这篇文章给我们的 take-away 是:"什么算进展"是一个很值得被定义而且领域内建立统一标准的事情,不是说我们提出了一个新检测器取得了 sota 就完事了。在提出新检测器之前,有必要在同样的数据集上先把比较基准校准一下,找到一个合理的、对比公平的 baseline。就像 里的「敲定正确的 baseline」所说的一样