|

Jev 刚刚出来,我拿它跑了一遍 AI 检测

[实验是AI做的,实验报告也是AI写的。图表之后的解读是我的观点。]

 

前几天,我写了一篇《写完「AI 检测就是个骗局」之后,我做了一个检测器》。

那篇文章讲的是:我用 Codex 做了一个检测 AI 写作的 Agent。它会读取文章,找证据,给出 AI 写作概率;我再把自己知道的真实创作过程反馈给它,让它复盘、总结,把新的判断规则写回 skill 和校准记录里。用很少的文章迭代以后,这个 Agent 在那组记录里的表现明显超过了直接询问通用模型。

但 Agent 有一个很现实的问题:贵。

为了判断一篇文章,它要读取文章、方法文件、历史反馈和校准记录,还要分步骤分析、调用工具、输出证据。这个过程很适合研究和处理疑难案例,但如果一次要跑几千、几万篇文章,就有点像请一位主编逐篇写审稿意见。

就在这时,Jev 发布了。我看到它的第一反应是:这东西好像正适合拿来做 AI 检测。

Jev 是 TypeSafe AI 刚刚发布的第一款 System One Model。普通 LLM 的基本动作是生成文字;Jev 的基本动作是做判断。

你给它一段 state,再给它几个范围明确的问题。它不会写一篇分析报告,而是直接返回 Yes/No、一个选择题答案,或者一个分数,并附上相应的概率。TypeSafe 对它的概括是:unstructured state in, typed probabilistic decisions out——输入没有结构的现实信息,输出程序可以直接使用的概率判断。

这件事听起来只是少输出几句话,实际上改变了模型的工作方式。

如果我要判断一篇文章是不是 AI 主导,我并不一定需要模型先写两千字推理,再从最后一段里解析出一个百分比。我真正需要的是几个边界清楚的问题:

  • AI 是否负责了超过一半的最终措辞?
  • 这篇文章更接近人写、共创,还是 AI 主导?
  • 如果按 AI 文本占比分档,它落在哪一档?

AI 检测刚好是一种很窄的判断任务。输入是一篇文章,输出是有限的类别和概率。这正是 Jev 的形状。

需要补一句:Jev 不生成范围之外的文字,不代表它的判断不会错。它只是把错误限制在一个明确的答案空间里。概率仍然要校准,低置信度仍然要交给人或更强的 Agent。

 

检测方法

我把之前那组有真实创作过程记录的文章重新拿了出来。这些文章里,有完全人写的,有人和 AI 共创的,也有绝大部分由 AI 完成的。

为了避免把答案泄漏给 Jev,我做了几件事:

  1. 只保留完整文章,去掉来源、历史检测结果和真实标签;
  2. 用匿名编号运行;
  3. 提前固定上面三个问题,不看结果再改问法;
  4. 每篇独立调用,随机顺序跑三轮,再按预先写好的规则汇总;其中二元概率取三轮平均;
  5. Jev 全部跑完并冻结结果以后,才加载 Ground Truth 评分。

三轮是为了观察稳定性、降低一次随机输出的影响。一次检测仍然只算一次模型调用。

 

Jev的准确性可以进入了顶尖通用模型那一档

结果比我预期的好,但需要分两种口径来看。

第一种,是为了跟上一篇文章的图完全兼容,我问:“AI 是否负责超过一半的最终措辞?”然后用模型给出的概率与 50% 分界比较。这个口径下,Jev 的方向判断准确率是 75%;与真实 AI 占比的平均绝对偏差是 30.0 个百分点。

这意味着 Jev 的数值表现处在直接询问通用模型的同一档:优于 DeepSeek 和豆包,与 Kimi 的方向准确率相同,但低于本组里的 Gemini 和 Codex。它没有把人写文章误判到 AI 主导侧,却漏掉了部分 AI 占比很高的文章;对应结果都刚好停在 50% 门槛下方。

图 1:平均绝对偏差,越低越好。Jev 为 30.0%,接近通用模型的整体水平;Agent 为 13.8%。

 

图 2:沿用上一篇文章的二元问题和 50% 分界。Jev 为 75%,Agent 为 100%。

 

第二种,是更适合 Jev 的封闭分类问法。三分类“人写 / 共创 / AI 主导”和五档 AI 占比的准确率都是 87.5%。如果只比较准确率,这与本次直接询问通用模型里的最好记录相同;两边的问题定义不同,所以不能把它当成严格的同题排行榜。

所以更准确的说法是:在这组记录上,Jev 用适合自己的分类方式,可以达到顶尖通用模型的判断水平;用二元概率口径,则处在通用模型的中间位置。

这也提醒我,Jev 的 question design 很重要。让它判断类别,比让它模拟旧检测器的连续概率更自然。它不是把同一句 prompt 换一个便宜模型跑,而是需要把任务重新拆成适合机器执行的原子判断。

另外,Jev 的三轮结果很稳定。每篇文章三次概率的平均波动范围只有 2.4 个百分点,最大也只有 4 个百分点。这对批量工作很重要:便宜之外,还要可重复。

 

Jev的优势:成本极低

按这次实际调用的平均 token 用量和当时的公开价格估算,平均一次检测是 0.0001848 美元。换算成一千次检测,是 0.18 美元。

这里再强调一次:三轮只是这次实验为了取平均。生产中检测一篇文章调用一次 Jev,所以一千次检测就是一千次调用。

图 3:估算项以横线和两个端点表示成本区间,Jev 为单个实测点。倍数注释使用估算区间中点;其他项目是根据历史工作量和当前 API 标价重建的替代成本范围,不是历史账单。

 

其他模型的历史调用环境比较杂,有 CLI、网页、订阅和不同模型版本,已经不可能还原真实账单。我只能用保存下来的文章、报告和上下文,按当前 API 价格估算同等工作量。

按这个口径,直接模型大约是每千次 0.68 到 18.93 美元;Agent 是 28.98 到 57.96 美元。Jev 是 0.18 美元。

成本差距不是因为 Jev 找到了一个更便宜的写作方式,而是因为它根本不写。它读完以后直接给程序一个类型明确的判断,输出几乎没有成本。

 

效果和成本的均衡:帕累托前沿Pareto Frontier

只看准确率,Agent 最好。只看成本,Jev 最便宜。更有意思的问题是:为了多得到一点准确率,要多花多少钱?

我模仿 Artificial Analysis 的方式,把横轴设成每千次检测成本,纵轴设成方向判断准确率。成本跨度太大,所以横轴使用对数刻度。对有估算区间的项目,我用区间的几何中点作为图上的代表点,同时保留完整范围。

图 4:代表点口径下的 Pareto 前沿是 Jev → Gemini → Agent。左上方意味着更便宜、准确率更高。

这张图很直观地画出了三种选择:

  • Jev:75% 的旧口径方向准确率,每千次 0.18 美元;
  • Gemini/Codex等通用大模型:87.5%,代表成本约 7.42 美元;
  • Agent:100%,代表成本约 40.98 美元。

这条 Pareto front 不是排行榜。Agent 的 100% 来自参与过反馈迭代的开发记录,并不是独立留出测试;其他六项与 Jev 也不是同一时间、同一系统下的同步比赛。Gemini 和 Codex 的准确率同为 87.5%,成本区间又有重叠,采用不同边界时,Pareto front 中间的模型也会变化。

它表达的是一个更实用的关系:这组记录里,准确率与成本怎样交换。

 

Agent 负责把事情想明白,Jev 负责反复执行

做完这次实验以后,我更清楚 Agent 和 Jev 的分工了。

Agent 可以读取更多 context、skills、历史案例和校准记录。它可以分步骤分析,寻找文章内部证据,处理新的边界情况,还可以在我给出 Ground Truth 后复盘:为什么错,哪条规则失效,下一次应该看什么。

这些工作让 Agent 拥有更丰富的判断依据;在这组开发记录里,它也给出了更高的准确度和真正有用的解释。上一篇文章里我说过,对写作者而言,后面的分析经常比最后那个百分比更有价值。

Jev 适合把已经想明白的问题稳定地执行很多次。比如批量初筛一批文章、判断是否需要复核、把高置信度样本直接归类,再把不确定或高风险的案例交给 Agent。

一个比较合理的工作流可能是:

  1. Jev 先做低成本批量判断;
  2. 高置信度结果进入统计或后续流程;
  3. 临界值附近、问题之间互相矛盾的文章交给 Agent;
  4. Agent 给出证据和解释,必要时由人确认;
  5. 新的真实反馈继续进入校准集。

这样一来,Agent 像研究员和主编,Jev 像经过培训的一线审核员。前者继续发现规则,后者把规则覆盖到足够大的量。

 

如果量再大,能不能直接训练一个专用模型?

这是下一步最吸引我的地方,也是目前只能写成推测的地方。

至少从当前公开文档来看,TypeSafe 还没有提供让用户上传自己的数据、微调官方 Jev 的接口。但 Jev 发布以后,社区已经有人开始训练 Jev 式的开源判断模型:

  • Laya 提供了 typed-decision 模型和领域微调 notebook;
  • kev 用小型 Qwen 加 LoRA 和判断头,在 MacBook 上训练、运行;
  • NanoJev 用 Qwen3-0.6B 加决策头,公开了从数据生成、训练到游戏任务评估的流程。

这些项目只能说明一件事:「训练一个面向封闭判断任务的 Jev-like 模型,在工程上已经有人做了。」它们的数字来自各自的数据和自报实验,不能推出“自己训练一定更好”,更不能推出“训练以后就能识别 AI 写作”。

但如果未来积累了足够多、足够可靠的创作过程标签,我认为可以做一个值得验证的假设:把 Agent 在复盘中发现的特征和真实反馈,转成一个专用判断模型的训练数据;再用完全隔离的新文章做盲测。它有机会在保持低成本、高吞吐的同时,超过零样本通用模型。

这是一个 hypothesis,不是这次实验的结论。真正的门槛也许不在训练代码,而在数据:什么叫 AI 主导,什么叫人机共创,修改到什么程度算人的表达,以及这些标签能不能在不同作者、题材和新模型上成立。

 

最后的想法:文本是GenAI时代的新型燃料

做完这次实验以后,我真正想押注的,其实不只是 Jev。

我的 bet 是:用语言文字储存下来的信息,会成为 AI 时代的一种新燃料。

过去很多推荐系统,会先把用户、物品和行为压缩成固定字段或向量,再在向量空间里计算距离和相似度。这套方法非常高效,因为目标、特征和计算路径都已经被限定好了。

文字能保存的信息类型更开放。它不只记录“发生了什么”,还可以记录为什么、当时有哪些约束、出现过哪些例外、谁给了什么反馈,以及一条规则是怎样从具体案例里长出来的。这些东西很难提前塞进一张固定的特征表,却可以自然地留在文档、对话、日志和案例中。

这里的差别不在底层有没有矩阵和向量运算,LLM 底层当然也在做这些计算。真正的差别在于信息进入计算之前,被压缩到了什么程度。为了一个明确目标预先生成的特征和向量,通常会主动丢掉与这个目标无关的细节;原始文本却可以继续保留原因、关系、约束和例外。面对不同任务,我们可以回到同一批文本里,重新提取不同的信息。

从信息论的角度,我的直觉是:一次判断能够调用的有效信息越多,能够消除的不确定性也就越多。文本的价值正在这里。它先把更多信息保存下来,等待一种足够好的架构去读取、筛选和使用。

今天的问题是处理效率。特化的推荐算法可以用很低的延迟和成本处理海量请求,因为需要哪些信号、怎样计算,早已被设计进系统。LLM 和 Agent 需要从更丰富的文字里临时寻找信号,所以要付出更多 token、时间和计算。上一篇文章里的 Agent 已经证明这些信息可以被利用,只是现在用起来还很贵。

我的判断是,这个效率问题一定会被持续优化。未来的系统不需要每次都把全部文字交给一个巨大的通用模型重新阅读。信息可以先被检索、分层、压缩和路由,再交给更小的模型、蒸馏后的领域模型或专用判断头处理。问题一旦被 Agent 拆清楚,后面的工作就具有很强的可优化性。

Jev 在这里的意义,更像是一个 proof point,而不是版本答案。它确认了围绕语言模型的模型与系统架构还有很大的优化空间:当任务被限制为明确的判断,模型可以通过放弃自由生成、改变输出方式和重新设计推理路径,大幅降低成本和延迟。但这不代表 Jev 或 System One 就是最终形态。未来的答案也可能来自更小的通用模型、蒸馏后的领域模型、传统算法与语言模型的混合系统,或者今天还没有出现的架构。

这也解释了为什么社区里有些人能做得特别快。他们并不是在新模型发布当天才开始准备。过去的业务已经留下了大量文字记录:文档、规则、失败案例、人工判断、运行日志和结果反馈。新模型出现以后,他们只是换了一台更高效的发动机,原来的燃料可以立刻接上去。

Jev 发布以后,很快就有人用 Qwen 复现 Jev-like 的训练和判断方式。这些项目不能证明复现出来的模型一定更好,却说明架构和训练方法会扩散。今天看起来稀缺的模型能力,未来很可能变成任何团队都能获得的基础设施。

到那时,差距又会回到更难复制的地方:谁已经积累了信息丰富、质量可靠的文本和数据,谁有足够多的真实场景持续使用它,谁能把判断结果变成新的反馈,再写回记录、规则和模型。

AI 检测只是这个循环的一个小例子。文章、创作过程、判断理由和作者反馈,包含的信息远多于最后一个“像不像 AI”的标签。Agent 先从这些文字里找出规则并处理例外,Jev 把已经明确的问题低成本地反复执行,未来还可以尝试把这些判断进一步压缩进专用模型。

如果文本是燃料,LLM、Agent 和 Jev 就是不同形态的发动机。我的 bet 不在某一个模型或某一种架构上,而在发动机的效率一定会继续提高。当高效处理文本的架构成熟以后,过去积累下来的文字会变成可以被反复提炼的信息资产。最后真正受益的,会是那些已经储存了燃料、知道怎样提炼它,并且有大量地方可以持续使用它的人。

这才是我真正的 bet。

以上。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注