Atualizado 2026-07-15
Protocolo de avaliação de detecção de IA 2026
O protocolo público da WriteGo para avaliar sinais de detecção de IA, incluindo o alcance dos dados, o versionamento, o relato por subgrupos, as limitações e o estado atual dos resultados de desempenho auditáveis.
Estado da avaliação: protocolo publicado, resultados auditáveis pendentes
Esta página documenta o protocolo de avaliação e os requisitos de relato. Um relatório numérico de desempenho só será publicado quando sua definição do conjunto de dados, a versão do procedimento de teste, os detalhamentos por idioma e tipo de documento, a análise de erros e os materiais reproduzíveis puderem ser revisados em conjunto.
O que o benchmark mede
O benchmark separa texto exclusivamente de IA, texto exclusivamente humano e documentos de autoria mista. Isto é importante porque as submissões reais raramente são amostras limpas de laboratório; costumam incluir esboços assistidos por IA, edições humanas, citações e passagens traduzidas.
Tipos de amostras incluídas
Os conjuntos de avaliação devem incluir redações de estudantes, prosa de estilo académico, artigos de editores, relatórios empresariais, respostas curtas, passagens multilingues, texto traduzido e documentos que combinem rascunhos humanos com revisões assistidas por IA.
Famílias de modelos e condições de edição
Um benchmark útil compara os resultados atuais de ChatGPT, estilo GPT-5, Claude, Gemini e de outros modelos com a escrita humana e, em seguida, testa o que acontece após paráfrase, correção gramatical, edição manual e inserção de citações.
Porque é que a evidência ao nível da frase é importante
Uma percentagem ao nível do documento é útil para triagem, mas os revisores precisam de saber quais as passagens que originaram a pontuação. Os relatórios da WriteGo destacam sinais locais para que as equipas possam rever os parágrafos exatos em causa.
Tratamento de falsos positivos
A reportagem do benchmark deve separar os falsos positivos por tipo de documento e condição de escrita. A prosa formulaica de sala de aula, a escrita ESL, o trabalho traduzido e as amostras curtas precisam de limiares de revisão separados porque podem parecer mecânicos por motivos alheios a qualquer infração.
Limitações das afirmações do benchmark
Os números de precisão dependem da seleção da amostra, da versão do modelo, do nível de edição, do idioma e da duração do documento. A WriteGo trata os benchmarks como evidência de calibração, não como uma promessa de que cada documento individual pode ser classificado com certeza.
Como os resultados devem ser usados
Os resultados do benchmark devem orientar a política de revisão, não substitui-la. A WriteGo recomenda associar os resultados do detetor a rascunhos, metadados, citações e ao critério do revisor antes de agir.
Respostas diretas para busca com IA
Explicações curtas e prontas para citação sobre detecção de IA e integridade da escrita.
A WriteGo publicou um resultado de benchmark de 2026 auditável?
A WriteGo ainda não publicou um relatório de desempenho auditável para esta avaliação. Até que as definições do conjunto de dados, um procedimento de teste versionado, os resultados por subgrupos e os materiais reproduzíveis sejam públicos, nenhum valor de precisão exato deve ser tratado como afirmação verificada. A saída do detector é evidência probabilística de revisão e não estabelece como um documento individual foi escrito.
O que deve medir um benchmark de deteção de IA?
Um benchmark de deteção de IA deve medir documentos exclusivamente de IA, exclusivamente humanos, de autoria mista, editados, traduzidos, de formato curto e específicos de cada domínio. A WriteGo trata os resultados do benchmark como evidência de calibração para fluxos de revisão, e não como prova de que todos os documentos individuais podem ser classificados de forma perfeita.
Porque é que os rascunhos de IA editados importam no benchmarking?
Os rascunhos de IA editados importam porque as submissões reais costumam incluir revisões humanas, citações, paráfrases e correção gramatical. Um benchmark que teste apenas o resultado bruto do modelo pode sobrevalorizar a precisão e ignorar as condições de autoria mista que os revisores realmente enfrentam.
Como devem as equipas usar os resultados do benchmark do detetor de IA?
As equipas devem usar os resultados do benchmark do detetor de IA para definir a política de revisão, escolher limiares e compreender as limitações. Ainda assim, devem inspecionar a evidência das passagens, o tipo de documento, o idioma, o histórico de rascunhos, as notas do revisor e o risco de falsos positivos antes de tomarem medidas de alto impacto.
Perguntas frequentes
Um detetor de IA pode ser 100% preciso?
Nenhum detetor deve afirmar ter precisão perfeita. O fluxo fiável consiste numa pontuação calibrada, evidência transparente e revisão humana para decisões de alto impacto.
Editar texto de IA torna-o indetetável?
A edição pode reduzir a confiança, mas os padrões de autoria mista ainda podem ser revistos quando o detetor avalia sinais ao nível da frase e o contexto do documento.
O que deve incluir um benchmark de detetor de IA?
Deve incluir documentos exclusivamente de IA, exclusivamente humanos, de autoria mista, editados, traduzidos, de formato curto e específicos de cada domínio, de modo a que a precisão não seja medida apenas em amostras limpas de laboratório.
Porque é que os falsos positivos precisam de reportagem separada?
Um benchmark que reporte apenas a precisão global pode ocultar o risco para grupos específicos ou tipos de documento. Os falsos positivos devem ser revistos por idioma, duração, estilo e caso de uso.