dificultad de phishingNIST Phish Scalesimulación de phishing

    29 de septiembre de 2026 · 10 min de lectura · Por Fensivo Team

    Dificultad de una simulación de phishing: NIST Phish Scale

    Read in English

    La conclusión en una frase: una tasa de click sin dificultad declarada no se puede comparar

    La dificultad de una simulación de phishing es cuánto trabajo le cuesta a una persona darse cuenta de que ese correo es un ataque. Existe un método público para calificarla: el NIST Phish Scale, que cruza las señales que el mensaje deja a la vista con qué tanto la premisa del correo encaja en el trabajo real de quien lo recibe. De ahí sale la conclusión que ordena todo lo demás: una tasa de click sin dificultad declarada no se puede comparar con nada. Ni con la campaña del mes pasado, ni con otra área de la empresa, ni con un promedio de la industria.

    El motivo es de aritmética simple y no de metodología fina. Un correo torpe, con dominio extraño y saludo genérico, y un correo que imita con precisión el flujo de aprobación de facturas del área de compras no miden lo mismo. Y eso vale aunque los dos terminen resumidos en un porcentaje. Si la primera campaña usó el correo torpe y la segunda el preciso, la tasa de click puede subir mientras el equipo mejora. Y puede bajar mientras el equipo empeora. Cuando ese número es el único dato que viaja al comité de dirección, el ruido deja de ser un detalle técnico y se convierte en una decisión de presupuesto.

    Nos interesa el punto porque es el que suele faltar. Hay bastante escrito sobre qué métricas mirar en un programa de simulaciones y bastante poco sobre cómo calificar la prueba que produce esas métricas. Y sin lo segundo, lo primero flota.

    El riesgo humano se gestiona automáticamente.

    Convierte el factor humano en tu primera línea de defensa.

    Agenda un demo

    Demo gratuito · 30 minutos · Sin compromiso

    Qué es el NIST Phish Scale y qué mide exactamente

    El Phish Scale es un método del NIST, publicado en la Nota Técnica 2276 "NIST Phish Scale User Guide" en noviembre de 2023, para calificar la dificultad de detección humana de un correo de phishing como parte de un programa de concientización y capacitación. Está escrito para quien opera el programa, no para quien investiga el fenómeno: su propósito es darle a esa persona una forma consistente de decir qué tan difícil era el correo que envió.

    Conviene ser precisos con lo que el método es y con lo que no es, porque ahí se cometen los dos errores habituales. No mide la sofisticación del atacante ni la calidad de la falsificación. No predice cuánta gente va a caer, ni sustituye la tasa de click: la acompaña. Y no califica a la persona, califica al correo. La persona sigue siendo el sujeto de la medición del programa. El Phish Scale es la etiqueta de la prueba, igual que un examen lleva su nivel de exigencia declarado aparte de la nota que saca cada quien.

    Esa distinción es la que le da valor a un marco externo. Cuando la dificultad la declara el proveedor de la herramienta, es su palabra contra la de otro proveedor. Cuando la declara un método de un organismo de estándares, ajeno a la categoría y publicado con su guía de uso, la conversación deja de ser comercial y se vuelve verificable.

    Los dos elementos de la dificultad: las señales del mensaje y la alineación con el contexto de trabajo

    El primer elemento son las señales que el mensaje trae encima: los indicios que alguien atento podría notar sin salir del correo. Errores de redacción, un remitente que no calza con el dominio, una urgencia desproporcionada, un enlace que no corresponde al texto que lo anuncia, un pedido que se sale del canal normal. Cuantas más señales visibles tenga el correo, más fácil es detectarlo, y por lo tanto menos dificultad.

    El segundo elemento es el que casi nadie considera al armar una campaña. También es el que de verdad mueve la aguja: qué tanto la premisa del correo se parece a lo que esa persona hace en su día. Un aviso de rechazo de nómina no significa lo mismo para alguien de recursos humanos que para alguien de bodega. Una solicitud de firma de contrato aterriza distinto en el área legal que en soporte técnico. Un mismo correo, con exactamente las mismas señales, es fácil para quien nunca recibe ese tipo de mensaje y difícil para quien lo recibe veinte veces por semana. La dificultad no vive solo en el correo: vive en el cruce entre el correo y el puesto de trabajo.

    Ese cruce explica por qué el correo sigue siendo el terreno donde esto importa. CISA sostiene que más del 90 por ciento de los ciberataques exitosos comienzan con un correo de phishing. Y lo que hace efectivo a ese correo casi nunca es una falsificación perfecta: es que llega pareciendo parte del trabajo. Un atacante con algo de reconocimiento previo no necesita escribir mejor, necesita escribir más cerca. Y cuando la simulación no hace ese mismo esfuerzo, está midiendo la reacción de la persona frente a un ataque que ningún atacante interesado en ella habría enviado.

    Cómo se traduce a una escala operativa para un programa de simulaciones

    El Phish Scale da los dos ejes, no una tabla lista para pegar en un informe. Así que la traducción operativa que sigue es nuestra, no del NIST. Convierte esos dos elementos en una etiqueta corta que acompaña cada campaña y que cualquiera entiende sin leer la nota técnica completa.

    Nivel declaradoSeñales en el mensajeAlineación de la premisa con el trabajoQué se puede concluir de la tasa de click
    Baja dificultadMuchas y evidentes: dominio ajeno, redacción defectuosa, urgencia sin motivoGenérica, podría ir dirigida a cualquier empleado de cualquier empresaUn piso. Quien cae aquí necesita atención inmediata; quien no cae no demostró gran cosa
    Dificultad mediaPocas y sutiles: remitente creíble, una sola inconsistencia detectableEncaja con la empresa o con el área, pero no con la tarea concreta de la personaComparable entre campañas del mismo nivel. Es el rango útil para seguir la evolución mes a mes
    Alta dificultadCasi ninguna visible: dominio, formato y firma coherentesEncaja con el rol, con la herramienta que esa persona usa y con un pedido que de verdad recibeUn techo. Medir aquí muestra el comportamiento bajo presión real, no la capacidad de encontrar el error
    No declaradaSin registrarSin registrarNada comparable. El número existe pero no tiene escala, así que no sostiene una conclusión

    La última fila es la más importante y la que describe a la mayoría de los programas que vemos. No es que midan mal: es que miden sin etiqueta, y un resultado sin etiqueta no se puede volver a usar. Lo que la tabla propone es barato de adoptar. No exige cambiar la herramienta ni el calendario. Exige registrar dos campos más cada vez que se envía una campaña y sostener esa disciplina, que es donde también se juega la cadencia con que se envían las simulaciones.

    Qué cambia en el programa cuando la dificultad queda declarada

    Cambian tres cosas concretas, y ninguna es cosmética. La primera es que la serie de tiempo empieza a existir: con el nivel declarado, comparar marzo contra septiembre es legítimo, y sin él es un acto de fe. La segunda es que la segmentación se vuelve honesta. Un área con tasa de click alta en dificultad alta está mejor que un área con tasa de click media en dificultad baja, y sin la etiqueta esa lectura se invierte. La tercera es que el programa puede subir la exigencia a propósito y reportarlo como progreso en lugar de esconderlo como deterioro.

    Ese último punto es el que más resistencia genera, y vale la pena decirlo sin adornos: un programa de gestión de riesgo humano (Human Risk Management, HRM) que solo reporta números que bajan tiene un incentivo permanente para mandar correos fáciles. La dificultad declarada rompe ese incentivo. Deja de ser vergonzoso que la tasa de click suba, siempre que la prueba haya sido más dura, y pasa a ser sospechoso que baje sin que nada más haya cambiado.

    Hay otro motivo para no conformarse con el número suelto, y viene de evidencia revisada por pares. Los trabajos de Ho y colaboradores presentados en el IEEE Symposium on Security and Privacy de 2025, y de Lain y colaboradores en la edición de 2022 del mismo simposio, apuntan en la misma dirección: completar una capacitación no predice por sí solo la reducción de los fallos reales. Lo que demuestra un cambio es volver a observar el comportamiento. Y para volver a observarlo con sentido hace falta, justamente, saber qué tan difícil era la prueba anterior. El marco 90-5-5 de Cisco estima que cerca del 90 por ciento de las brechas involucran un factor humano. El asunto no es marginal: es la superficie donde se decide la mayor parte del riesgo.

    Por qué el retest exige dificultad comparable y no la misma plantilla

    Aquí el marco deja de ser teoría y se vuelve criterio de diseño. Volver a probar a alguien que falló es la única forma de saber si algo cambió, pero hay dos maneras de hacerlo mal. La primera es reenviar la misma plantilla, que no prueba comportamiento sino memoria: la persona reconoce el correo, no el patrón. La segunda es enviar algo mucho más fácil, que garantiza un buen resultado y no significa nada.

    La salida correcta es una segunda prueba de dificultad comparable y plantilla distinta. Comparable no quiere decir parecida a ojo. Quiere decir un nivel equivalente de señales visibles y una alineación equivalente con el trabajo de esa persona, que es justo lo que los dos elementos del Phish Scale permiten sostener. Ese es el aporte silencioso del método a un programa de simulaciones. No le dice a nadie cómo escribir un correo de phishing. Le da un lenguaje para afirmar que dos correos distintos eran igual de difíciles, y sin ese lenguaje la palabra retest queda hueca.

    Vale la pena cerrar con la limitación honesta. El Phish Scale es un método de calificación, no una estadística: no trae porcentajes de eficacia ni promete un resultado. Su valor es que ordena una conversación que hoy se tiene con adjetivos. Pasar de "fue un correo bastante realista" a un nivel declarado y registrado no suena a gran avance. Y es la diferencia entre un programa que acumula datos y uno que acumula anécdotas.

    En Fensivo el emparejamiento inteligente existe justamente para trabajar ese segundo elemento: elegir para cada persona la simulación que cruza su rol, su comportamiento previo, las plataformas que su empresa de verdad usa y sus credenciales expuestas, en lugar de enviar el mismo correo a toda la empresa. En el diseño de Fensivo, ese cruce lleva la efectividad de un 25 a 35 por ciento con envío aleatorio a un 75 a 90 por ciento, medida por tasa de click y entrega de credenciales, que es otra forma de decir que la premisa alineada sube la dificultad efectiva. Sobre esa base se arma el retest: tres semanas después del fallo, una simulación de la misma categoría y sofisticación pero con otra plantilla, más un microaprendizaje conversacional de tres preguntas que se aprueba con dos de tres. Así funciona en la práctica para los casos de uso que cubre hoy.

    ¿Podrías decir hoy, con un registro y no de memoria, qué tan difícil era el último correo de simulación que envió tu empresa?

    Fuentes y referencias

    • NIST, Technical Note 2276, "NIST Phish Scale User Guide", noviembre de 2023. csrc.nist.gov
    • CISA, "4 Things You Can Do To Keep Yourself Cyber Safe". cisa.gov
    • Cisco, "The 90-5-5 Concept: Your Key to Solving Human Risk in Cybersecurity", 27 de mayo de 2025. blogs.cisco.com
    • Ho, G. et al., "Understanding the Efficacy of Phishing Training in Practice", 2025 IEEE Symposium on Security and Privacy. ieeexplore.ieee.org
    • Lain, D., Kostiainen, K. y Čapkun, S., "Phishing in Organizations: Findings from a Large-Scale and Long-Term Study", 2022 IEEE Symposium on Security and Privacy. ieeexplore.ieee.org

    El riesgo humano se gestiona automáticamente.

    Convierte el factor humano en tu primera línea de defensa.

    Agenda un demo

    Demo gratuito · 30 minutos · Sin compromiso