SEMANA DEL ESTUDIANTE 🔥

Aprovecha 50% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

|

Hasta el 23/09 ⏰

SEMANA DEL ESTUDIANTE 🔥

Aprovecha 50% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

|

Hasta el 23/09 ⏰

Hasta el 23/09 ⏰

SEMANA DEL ESTUDIANTE 🔥

Aprovecha 50% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

Cursos

Empresas

¿Por qué Coder?

Detectores de IA en textos: ¿qué tan confiables son en la práctica?

Tutoriales gratuitos

Descargartutoriales gratuitos

Tutoriales y videos prácticos gratuitos para incorporar nuevas herramientas de IA y empleabilidad.

Ver los tutoriales

Dan Patiño

AI Strategy & Innovation en Coderhouse

Inteligencia Artificial

Detectores de IA en textos: ¿qué tan confiables son en la práctica?

Publicado el

Los detectores de IA no son confiables como prueba. La evidencia académica más reciente muestra precisiones globales en torno al 60-70%, tasas de falsos positivos que trepan al 20% o más en textos escritos por personas, y un colapso casi total frente a textos híbridos. Sirven como señal de alerta, nunca como veredicto.

El uso de estas herramientas creció muy por encima de su capacidad real. Universidades, escuelas y hasta equipos de recursos humanos las aplican para decidir si un texto fue escrito por una persona, y en muchos casos esa decisión tiene consecuencias: una nota reprobada, una sanción, un candidato descartado. Vale la pena mirar los datos antes de darle ese peso a una herramienta.

¿Cómo funcionan los detectores de IA?

Casi todos se apoyan en dos señales estadísticas del texto.

Perplejidad

Mide cuán "sorprendente" resulta cada palabra para un modelo de lenguaje, dado lo anterior. El texto generado por IA tiende a elegir la continuación más probable, así que su perplejidad es baja. El texto humano es más irregular: metemos giros raros, cambiamos de registro, nos equivocamos.

Ráfaga (burstiness)

Mide la variación entre oraciones. Las personas escriben una frase de tres palabras y después una de cuarenta. Los modelos tienden a producir oraciones de longitud y complejidad más uniformes.

El problema de fondo es conceptual: estas dos señales no miden quién escribió el texto, miden qué tan predecible es. Y hay mucha escritura humana perfectamente predecible: la de alguien que aprendió el idioma como segunda lengua, la de un manual técnico, la de cualquiera que escriba en un registro formal y estandarizado. El detalle completo del funcionamiento interno está en Detectores de IA: qué son, cómo funcionan y si realmente sirven.

Qué dicen los estudios sobre su precisión

Acá está lo que importa. Un estudio publicado en el International Journal for Educational Integrity evaluó detectores líderes en contextos académicos y encontró precisiones globales del 69% y 61%. Sobre textos híbridos —escritos por una persona y luego editados con IA, o al revés, que es el caso más común en la vida real— el rendimiento cayó prácticamente a cero.

El National Centre for AI de Jisc, el organismo británico de tecnología educativa, llegó a una conclusión similar tras revisar la evidencia disponible: no existe hoy una herramienta que permita afirmar con certeza que un texto fue generado por IA, y las instituciones no deberían basar decisiones disciplinarias en su resultado.

El problema de los falsos positivos

Un falso positivo es un texto escrito por una persona que el detector marca como generado por IA. Es el error más grave, porque acusa a alguien que no hizo nada.

  • Las herramientas comerciales mejor posicionadas reportan tasas del 1% al 2% en sus propias pruebas.

  • Los estudios independientes encuentran cifras mucho más altas: entre el 12% y el 26% en varios de los detectores más usados.

  • Basta con que un texto humano pase por un pulido menor con IA para que las tasas de detección se disparen de manera errática, entre el 10% y el 75% según el caso.

El sesgo contra quienes no son hablantes nativos

Este es el hallazgo más serio y el menos conocido. Los detectores penalizan sistemáticamente la escritura de personas que redactan en una lengua que no es la propia, porque ese tipo de texto usa vocabulario más acotado y estructuras más regulares: exactamente las señales que el detector asocia con la IA.

En evaluaciones sobre ensayos de exámenes internacionales de inglés, la tasa de falsos positivos para estudiantes no nativos superó el 60%, frente a cifras de un dígito para estudiantes nativos. También se documentaron diferencias significativas por grupo demográfico dentro de un mismo país. En un contexto educativo, eso significa que la herramienta acusa desproporcionadamente a los mismos estudiantes una y otra vez.

Por qué no van a mejorar mucho

Hay tres razones estructurales, no de implementación:

  1. Los modelos mejoran más rápido que los detectores. Cada generación nueva escribe con más variación estilística, que es justo lo que el detector busca para identificar escritura humana.

  2. La escritura asistida es el caso normal. Ya casi nadie produce texto 100% humano o 100% generado. La mayoría es mixta, y es precisamente donde los detectores fallan más.

  3. Una simple edición rompe la señal. Reescribir algunas frases, cambiar el orden de los párrafos o pedirle al modelo que use un estilo más irregular alcanza para evadir la detección.

Entonces, ¿para qué sirven?

Sirven como señal de triage, no como prueba. Un resultado alto puede justificar mirar el texto con más atención; nunca puede justificar una sanción por sí solo.

Si sos docente o evaluás trabajos

  • No uses el porcentaje del detector como evidencia en una acusación. No resiste una impugnación.

  • Rediseñá la consigna en lugar de perseguir la herramienta: pedí que el trabajo se conecte con material visto en clase, con datos locales o con la experiencia del estudiante.

  • Sumá instancias orales breves. Cinco minutos de conversación sobre el trabajo dicen más que cualquier detector.

  • Pedí el proceso, no solo el producto: borradores, historial de versiones, notas.

  • Explicitá qué uso de IA está permitido. La mayoría de los conflictos vienen de reglas nunca escritas.

Si escribís y te preocupa que te marquen

  • Guardá el historial de versiones de tus documentos. Es la mejor defensa concreta.

  • Incorporá ejemplos propios, datos de tu contexto y referencias verificables: bajan la probabilidad de falso positivo y además mejoran el texto.

  • Si te acusan, pedí que te expliquen la metodología. El proveedor mismo suele aclarar en su documentación que el resultado no es concluyente.

Si querés que lo que escribís con asistencia de IA suene efectivamente tuyo, el flujo de trabajo importa más que la herramienta: esta guía de prompt engineering para principiantes cubre cómo dar contexto propio para que el resultado no salga genérico.

Cursos recomendados de Coderhouse

Entender cómo funcionan los modelos por dentro es la mejor defensa contra las afirmaciones exageradas, en cualquier dirección:

Preguntas frecuentes

¿Cuál es el detector de IA más preciso?

Las evaluaciones independientes muestran diferencias grandes entre herramientas, pero ninguna alcanza un nivel que justifique usarla como prueba. Algunas tienen buena tasa de detección pero muchos falsos positivos; otras son conservadoras y dejan pasar demasiado. Como el rendimiento varía además según el idioma, el tipo de texto y la versión del modelo que lo generó, cualquier ranking envejece en meses.

¿Turnitin detecta textos de ChatGPT?

Detecta una parte, y el propio proveedor advierte en su documentación que el resultado es indicativo y no debe usarse como única base para una sanción. Rinde peor en textos editados por una persona después de generarlos, que es el escenario más frecuente.

¿Puedo reclamar si un detector me marca injustamente?

Sí, y conviene hacerlo con argumentos concretos. Presentá tu historial de versiones, ofrecé explicar el contenido oralmente y pedí que se especifique la metodología y el margen de error de la herramienta usada. La literatura académica sobre falsos positivos, en particular el sesgo contra hablantes no nativos, es un respaldo sólido para el reclamo.

¿Hay forma de escribir con IA sin que se note?

La pregunta correcta no es cómo evadir el detector, sino cómo producir un texto que valga la pena. Un documento que parte de tus datos, incluye ejemplos que solo vos podés dar y pasó por tu edición es a la vez más difícil de marcar y mejor. Buscar la evasión por la evasión misma suele terminar en un texto peor.

¿Conviene que una empresa use detectores para filtrar candidatos?

Es una práctica riesgosa. Con las tasas de falsos positivos documentadas, y con el sesgo contra quienes escriben en una segunda lengua, filtrar CV o pruebas escritas con un detector implica descartar candidatos válidos de manera sistemática y desigual. Es más efectivo evaluar con una instancia práctica: una tarea corta, conversada, donde importa el criterio y no quién tipeó cada palabra.

Sobre el autor

Dan Patiño

Soy Dan Patiño, responsable de AI Strategy & Innovation en Coderhouse. Mi día a día consiste en fusionar la gestión táctica del e-commerce (CRO, Email Marketing y SEO) con el desarrollo de soluciones disruptivas. Me especializo en crear apps internas con IA para automatizar tareas y potenciar la innovación dentro del equipo. Creo fielmente que la tecnología es el mejor aliado de la estrategia. Para profundizar en mi recorrido profesional, te espero en mi perfil de LinkedIn.

Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.