¿Cuántas entrevistas de usuario son suficientes? La evidencia y lo que se cita mal

Lectura: 5 min

Cualquiera que haya diseñado un research cualitativo se ha topado con esta pregunta, normalmente formulada por un cliente o un stakeholder: «¿cuántas entrevistas necesitamos para estar seguros de lo que descubramos?». La respuesta habitual «hasta que saturemos» es correcta a nivel conceptual, pero inútil a nivel práctico, porque no dice nada sobre el número con el que hay que planificar el proyecto, el presupuesto y el calendario.

Es como cuando llamas a tu madre para que te ayude con una receta desde tu piso de estudiantes y te dice que «eches la harina que te pida la sartén». ¿Hola? ¿Cuánto es eso?

En 2006, Greg Guest, Arwen Bunce y Laura Johnson publicaron en Field Methods un paper que intentó cerrar ese hueco: How Many Interviews Are Enough? An Experiment with Data Saturation and Variability.

Casi veinte años después, sigue siendo el estudio más citado sobre el tema, y también uno de los más citados fuera de contexto. Vale la pena revisar qué decía exactamente, qué han añadido los estudios posteriores, y cómo aplicarlo a un contexto muy distinto al suyo: el research cualitativo dentro de un proceso de CRO.

El problema que atacaba el estudio

Antes de este paper, el muestreo hasta saturación era un concepto aceptado en investigación cualitativa pero sin ninguna guía operativa.

Guest, Bunce y Johnson lo resumen así: la idea de saturación es útil conceptualmente, pero da poca orientación práctica para estimar el tamaño de muestra antes de empezar a recoger datos, que es precisamente cuando hace falta.

Para estudiarlo empíricamente, usaron datos de un proyecto real: 60 entrevistas en profundidad con mujeres en dos países de África Occidental.

En lugar de analizar todo el corpus de golpe, dividieron las entrevistas en tandas y fueron codificando de forma acumulativa, midiendo en cada tanda cuántos códigos y temas nuevos aparecían respecto a la tanda anterior. Esto les permitió construir, por primera vez, algo parecido a una curva de rendimientos decrecientes para el research cualitativo.

La curva de rendimientos decrecientes (o ley de rendimientos marginales decrecientes) es un principio económico que establece que, si aumentas un factor de producción (el nº de trabajadores) mientras mantienes otros fijos (la maquinaria,) llegará un punto en que cada unidad adicional generará un aumento cada vez menor en la producción total.

El resultado que todo el mundo cita (mal)

El hallazgo principal, el que ha acabado convertido en norma no escrita del sector, es que la saturación temática se alcanzó dentro de las primeras 12 entrevistas.

Y hay un dato todavía más llamativo: los elementos base de los temas de más alto nivel (metatemas) ya estaban presentes desde la entrevista número 6.

Es fácil ver por qué este número ha viajado tanto: da una cifra concreta y manejable para planificar un research. ¿Qué puede haber mejor que eso?

Pero también es fácil ver por qué se ha citado mal durante años.

El estudio se hizo con una muestra relativamente homogénea (mujeres, dos países, un tema de investigación acotado) y con un diseño de codificación específico. Aplicar «12 entrevistas» como regla universal, sin mirar el contexto del propio research, es exactamente el tipo de generalización que el estudio no pretendía justificar.

No toda saturación es la misma

Once años después, Hennink, Kaiser y Marconi publicaron en Qualitative Health Research un trabajo que introduce una distinción importante: no es lo mismo saturar códigos que saturar significado.

  • Saturación de códigos: el punto en el que ya no aparecen categorías o temas nuevos. En su estudio, esto ocurrió entre las entrevistas 9 y 17.
  • Saturación de significado: el punto en el que las nuevas entrevistas ya no aportan matices, dimensiones o comprensión adicional sobre los temas que ya tienes identificados. Esto llegó más tarde, entre las entrevistas 16 y 24.

Esta distinción es relevante porque cambia lo que significa saturar según el objetivo del research.

Si el objetivo es un mapa de temas (por ejemplo, un listado de fricciones en un funnel de conversión), la saturación de códigos puede bastar.

Si el objetivo es entender el porqué con suficiente profundidad como para redactar hipótesis de experimentación con fundamento, hace falta llegar a saturación de significado, y eso implica más entrevistas de las que la cifra de mágica de 12 sugiere.

El número depende de si comparas segmentos

Ese mismo año, Hagaman y Wutich revisitaron el estudio original de Guest, Bunce y Johnson, pero con un diseño distinto: un estudio multisitio y transcultural sobre problemas de agua, con 132 personas entrevistadas en cuatro sitios diferentes.

Sus conclusiones añaden una capa que el estudio de 2006 no podía capturar, porque trabajaba con un único grupo relativamente homogéneo:

  • Para identificar temas específicos de un sitio (un grupo homogéneo), 16 entrevistas o menos fueron suficientes.
  • Para identificar metatemas que cruzaran los cuatro sitios (patrones comunes a grupos distintos), hicieron falta entre 20 y 40 entrevistas.

Esto es coherente con algo bastante intuitivo si lo piensas durante un segundo: cuanto más heterogénea es tu población objetivo, más entrevistas necesitas para estar seguro de que un patrón no es idiosincrático de un subgrupo, sino algo que se repite de verdad.

Aplicación a CRO y growth

Ninguno de estos tres estudios se hizo pensando en experimentación digital, así que hay que trasladar los hallazgos con cuidado, no citarlos como si fueran una norma sectorial de UX research. Dicho esto, hay lecturas prácticas razonables en las que creo que todos estaremos de acuerdo:

  1. El número correcto depende de la pregunta, no del presupuesto. Si el objetivo es identificar fricciones dentro de un segmento concreto y razonablemente homogéneo (por ejemplo, usuarios que abandonan en el checkout de un solo país y un solo dispositivo), un rango de 12-20 entrevistas suele ser suficiente para llegar a saturación de códigos, y probablemente cerca de saturación de significado si las entrevistas están bien guiadas.
  2. Si comparas segmentos, no repartas el mismo número entre todos. Comparar mobile vs. desktop, usuarios nuevos vs. recurrentes, o mercados distintos, es estructuralmente parecido al diseño multisitio de Hagaman y Wutich. Cada segmento necesita su propia saturación antes de poder decir algo fiable sobre los patrones que los cruzan, y eso empuja el número total hacia el rango de 20-40.
  3. Diferenciar entre «tengo el mapa de temas» y «entiendo el porqué». Para redactar una hipótesis de experimentación sólida no basta con un listado de fricciones (saturación de códigos); hace falta entender la motivación y el contexto detrás de cada una (saturación de significado). Esto es relevante a la hora de justificar ante un cliente por qué 10 entrevistas rápidas no son suficientes para fundamentar una hipótesis, aunque sí lo sean para hacer un primer barrido de temas.
  4. Menos entrevistas de las necesarias es tan mal diseño como demasiadas. El error más visible es sobreinvestigar (por ejemplo, pedir 30 entrevistas para estar seguros), pero el error simétrico, parar en la entrevista 5 antes de llegar ni siquiera a saturación de códigos, es igual de problemático. Y menos visible porque no se nota en el presupuesto, sino en la calidad de las hipótesis.

Una nota de honestidad metodológica

Ojo, cuidado: estos tres estudios se hicieron en contextos de salud pública e investigación transcultural, con equipos de codificación manual y un rigor metodológico específico de la investigación cualitativa académica.

Ninguno mide directamente entrevistas de usuario para CRO. ¡Ojalá!

La traducción que hago aquí es una aplicación razonada de sus hallazgos, no una réplica de sus resultados en un contexto digital. Si el research que vas a diseñar es crítico para una decisión de negocio grande, lo correcto es pilotar tu propio criterio de saturación (dejar de ver temas nuevos en dos entrevistas seguidas es un proxy razonable) en lugar de fiarte de una cifra fija sacada de un paper de hace casi veinte años.

Fuentes

  • Guest, G., Bunce, A. & Johnson, L. (2006). «How Many Interviews Are Enough? An Experiment with Data Saturation and Variability.» Field Methods, 18(1), 59-82.
  • Hennink, M.M., Kaiser, B.N. & Marconi, V.C. (2017). «Code Saturation versus Meaning Saturation: How Many Interviews Are Enough?» Qualitative Health Research, 27(4), 591-608.
  • Hagaman, A.K. & Wutich, A. (2017). «How Many Interviews Are Enough to Identify Metathemes in Multisited and Cross-Cultural Research? Another Perspective on Guest, Bunce, and Johnson’s (2006) Landmark Study.» Field Methods, 29(1), 23-41.

Taxonomías

Categorías:

/

Etiquetas:

Resumen de privacidad
Pablo Moratinos

Este sitio web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando regresas a esta web, ayudar a nuestro equipo a comprender qué secciones del sitio web te resultan más interesantes y útiles y ofrecerte publicidad a tu medida.

Cookies estrictamente necesarias

Las cookies estrictamente necesarias deben estar habilitadas en todo momento para que podamos guardar tus preferencias para la configuración de cookies.

Cookies de analítica

Este sitio web utiliza Google Analytics para analizar el comportamiento de sus visitantes. Mantener estas cookies habilitadas me ayuda a mejorar mi sitio web.

Cookies publicitarias

Este sitio web utiliza Matomo (herramienta analítica como Google Analytics pero que no comparte datos con terceros) e instala las siguientes cookies adicionales: