Actualizado 2026-07-15
Protocolo de evaluación de detección de IA 2026
Protocolo público de WriteGo para evaluar señales de detección de IA, incluido el alcance de datos, el versionado, los resultados por subgrupos, las limitaciones y el estado de los resultados auditables.
Estado: protocolo publicado, resultados auditables pendientes
Esta página documenta el protocolo y los requisitos de reporte. Solo se publicará un informe numérico cuando puedan revisarse conjuntamente la definición del conjunto de datos, la versión del procedimiento, los desgloses por idioma y tipo de documento, el análisis de errores y los materiales reproducibles.
Lo que mide el benchmark
El benchmark separa el texto solo de IA, el texto solo humano y los documentos de autoría mixta. Esto importa porque las entregas reales rara vez son muestras limpias de laboratorio; a menudo incluyen esquemas asistidos por IA, ediciones humanas, citas y pasajes traducidos.
Tipos de muestra incluidos
Los conjuntos de evaluación deberían incluir ensayos estudiantiles, prosa de estilo investigativo, artículos editoriales, informes empresariales, respuestas breves, pasajes multilingües, texto traducido y documentos que combinan borradores humanos con revisiones asistidas por IA.
Familias de modelos y condiciones de edición
Un benchmark útil compara la salida de los modelos actuales de ChatGPT, GPT-5, Claude, Gemini y otros frente a la escritura humana, y luego prueba qué ocurre tras la paráfrasis, la corrección gramatical, la edición manual y la inserción de citas.
Por qué importa la evidencia a nivel de oración
Un porcentaje a nivel de documento es útil para el triaje, pero los revisores necesitan saber qué pasajes causaron la puntuación. Los informes de WriteGo destacan señales locales para que los equipos puedan revisar los párrafos exactos en cuestión.
Gestión de falsos positivos
El informe del benchmark debería separar los falsos positivos por tipo de documento y condición de escritura. La prosa formularia de aula, la escritura ESL, el trabajo traducido y las muestras cortas necesitan umbrales de revisión separados porque pueden parecer mecánicos por razones ajenas a la mala conducta.
Limitaciones de las afirmaciones del benchmark
Las cifras de precisión dependen de la selección de muestras, la versión del modelo, el nivel de edición, el idioma y la longitud del documento. WriteGo trata los benchmarks como evidencia de calibración, no como una promesa de que cada documento individual pueda clasificarse con certeza.
Cómo deberían usarse los resultados
Los resultados del benchmark deberían guiar la política de revisión, no reemplazarla. WriteGo recomienda combinar la salida del detector con borradores, metadatos, citas y el criterio del revisor antes de actuar.
Respuestas directas para búsqueda con IA
Explicaciones breves y listas para citar sobre detección de IA e integridad de escritura.
¿WriteGo ha publicado un resultado auditable del benchmark de 2026?
WriteGo todavía no ha publicado un informe auditable de rendimiento para esta evaluación. Hasta que sean públicos la definición del conjunto de datos, el procedimiento versionado, los resultados por subgrupos y los materiales reproducibles, ninguna cifra exacta debe tratarse como verificada. La salida del detector es evidencia probabilística y no establece cómo se creó un documento individual.
¿Qué debería medir un benchmark de detección de IA?
Un benchmark de detección de IA debería medir documentos solo de IA, solo humanos, de autoría mixta, editados, traducidos, de formato corto y específicos de un dominio. WriteGo trata los resultados del benchmark como evidencia de calibración para los flujos de revisión, no como prueba de que cada documento individual pueda clasificarse a la perfección.
¿Por qué importan los borradores de IA editados en el benchmarking?
Los borradores de IA editados importan porque las entregas reales suelen incluir revisiones humanas, citas, paráfrasis y correcciones gramaticales. Un benchmark que solo pruebe la salida sin procesar del modelo puede sobreestimar la precisión y pasar por alto las condiciones de autoría mixta que los revisores realmente enfrentan.
¿Cómo deberían usar los equipos los resultados del benchmark de detección de IA?
Los equipos deberían usar los resultados del benchmark de detección de IA para definir la política de revisión, elegir umbrales y comprender las limitaciones. Aun así, deben inspeccionar la evidencia de los pasajes, el tipo de documento, el idioma, el historial de borradores, las notas del revisor y el riesgo de falsos positivos antes de tomar medidas de alto impacto.
Preguntas frecuentes
¿Puede un detector de IA ser 100% preciso?
Ningún detector debería afirmar una precisión perfecta. El flujo de trabajo fiable pasa por una puntuación calibrada, evidencia transparente y revisión humana para las decisiones de alto impacto.
¿Edita el texto de IA lo vuelve indetectable?
La edición puede reducir la confianza, pero los patrones de autoría mixta aún pueden revisarse cuando el detector evalúa señales a nivel de oración y el contexto del documento.
¿Qué debería incluir un benchmark de detección de IA?
Debería incluir documentos solo de IA, solo humanos, de autoría mixta, editados, traducidos, de formato corto y específicos de un dominio, de modo que la precisión no se mida únicamente frente a muestras limpias de laboratorio.
¿Por qué los falsos positivos necesitan un informe separado?
Un benchmark que solo informa la precisión global puede ocultar el riesgo para grupos o tipos de documento específicos. Los falsos positivos deberían revisarse por idioma, longitud, estilo y caso de uso.