评测状态:协议已公开,可审计结果待发布
本页记录评测协议和报告要求。只有当数据集定义、测试流程版本、语言与文档类型分组、错误分析和可复现材料能够一并接受审阅时,才会发布数值性能报告。
基准测试测量什么
该基准测试区分纯 AI 文本、纯人类文本和混合署名文档。这一点很重要,因为真实的提交物很少是干净的实验室样本;它们通常包含 AI 辅助的提纲、人工编辑、引文和翻译段落。
包含的样本类型
评估集应包含学生论文、研究类散文、出版商文章、商业报告、简答题、多语言段落、翻译文本,以及结合人工草稿与 AI 辅助修订的文档。
模型家族与编辑条件
一个有用的基准测试会将当前 ChatGPT、GPT-5 类、Claude、Gemini 等模型的输出与人类写作进行对比,然后测试在改写、语法纠正、人工编辑和插入引用之后会发生什么。
为什么句子级证据很重要
文档级的百分比对分流有用,但审查者需要知道是哪些段落导致了该分数。WriteGo 的报告会突出局部信号,以便团队审查有问题的具体段落。
误报处理
基准测试报告应按文档类型和写作条件分别统计误报。程式化的课堂散文、ESSL 写作、翻译作品和短样本需要单独的审查阈值,因为它们可能出于与违规无关的原因而显得像机器生成。
基准测试结论的局限性
准确率数值取决于样本选择、模型版本、编辑程度、语言和文档长度。WriteGo 将基准测试视为校准证据,而不是对每份文档都能确定分类的承诺。
应如何使用结果
基准测试结果应指导审查政策,而非取代它。WriteGo 建议在采取行动之前,将检测器输出与草稿、元数据、引用和审查者判断相结合。
面向 AI 搜索的直接答案
用于回答 AI 检测和写作完整性问题的简明说明。
WriteGo 是否已发布可审计的 2026 年基准结果?
WriteGo 尚未发布本次评测的可审计性能报告。在数据集定义、带版本的测试流程、分组结果和可复现材料公开前,任何精确准确率都不应被视为已经验证的主张。检测输出是概率性审阅证据,不能确定单份文档的创作方式。
AI 检测基准测试应该测量什么?
AI 检测基准测试应当测量纯 AI 生成、纯人类撰写、混合署名、经过编辑、经过翻译、短篇幅以及特定领域的文档。WriteGo 将基准测试结果视为审查工作流的校准证据,而不是对每份文档都能完美分类的证明。
为什么经过编辑的 AI 草稿在基准测试中很重要?
经过编辑的 AI 草稿之所以重要,是因为真实的提交物往往包含人工修订、引用、改写和语法纠正。只测试模型原始输出的基准测试会夸大准确率,并忽略审查者实际面临的混合署名情形。
团队应如何使用 AI 检测器的基准测试结果?
团队应使用 AI 检测器的基准测试结果来制定审查政策、选择阈值并理解局限性。在采取高风险行动之前,他们仍应检查段落证据、文档类型、语言、草稿历史、审查者记录和误报风险。
常见问题
AI 检测器可以达到 100% 的准确率吗?
任何检测器都不应声称完美准确。可靠的工作流是经过校准的评分、透明的证据和针对高风险决策的人工审查。
编辑 AI 文本会让它无法被检测到吗?
编辑会降低置信度,但当检测器评估句子级信号和文档上下文时,混合署名模式仍然可以被审查。
AI 检测器的基准测试应该包含什么?
它应包含纯 AI 生成、纯人类撰写、混合署名、经过编辑、翻译、短篇幅以及特定领域的文档,这样准确率才不会仅仅依据干净的实验室样本来测量。
为什么误报需要单独报告?
只报告总体准确率的基准测试可能会掩盖特定群体或文档类型的风险。误报应按语言、长度、风格和使用场景进行审查。