Cómo funciona el test
Mensura sigue las mismas bases teóricas de los tests de inteligencia modernos: el modelo de habilidades CHC, la Teoría de Respuesta al Ítem y la aplicación adaptativa. Esto es lo que ocurre detrás de cada pregunta, y también lo que el test no es.
Qué se mide
El modelo Cattell-Horn-Carroll (CHC) organiza la inteligencia en una capacidad general (g) y habilidades amplias. El test tiene siete tipos de pregunta, cada uno ligado a una de ellas:
| Tipo de pregunta | Habilidad (CHC) | Paradigma de origen |
|---|---|---|
| Matrices | Gf, razonamiento inductivo | Matrices progresivas (Raven) |
| Series numéricas | Gf/Gq, inducción cuantitativa | Series de números |
| Deducción lógica | Gf, razonamiento secuencial | Silogismos lineales |
| Balanzas | Gq, razonamiento cuantitativo | Problemas de equilibrio |
| Rotación mental | Gv, procesamiento visual | Shepard y Metzler |
| Memoria de trabajo | Gwm | Span visoespacial y dígitos (orden directo e inverso) |
| Analogías verbales | Gc, conocimiento y razonamiento verbal | Analogías A : B :: C : ? |
Cada test reparte las preguntas por igual entre los siete tipos, así que la puntuación final refleja un conjunto amplio de habilidades y no un solo tipo de tarea.
Por qué ningún test es igual al anterior
Las preguntas no vienen de un banco fijo. Cada una se arma en el momento con un generador (generación automática de ítems), a partir de reglas cuya dificultad es conocida. En una matriz, por ejemplo, la dificultad crece con el número de reglas que actúan a la vez y con el tipo de regla: las progresiones son más fáciles que las distribuciones de tres valores. Cada pregunta guarda una semilla aleatoria y una firma; el sistema nunca muestra la misma pregunta dos veces a la misma persona.
Las alternativas también siguen un método. En las matrices, las ocho opciones son combinaciones de tres atributos, cada uno con el valor correcto o un valor equivocado plausible. Así cada característica aparece en la mitad de las opciones, y el truco de "elegir la figura más parecida a las demás" no funciona.
Cómo se ajusta la dificultad
El test es adaptativo. Después de cada respuesta, el sistema reestima tu habilidad y elige la siguiente pregunta con la dificultad que más informa sobre ti en ese punto. Quien acierta recibe preguntas más difíciles; quien falla, más fáciles. Las tres primeras son un poco más fáciles, para calentar. Por eso casi todo el mundo acierta entre la mitad y dos tercios de las preguntas, y eso es lo esperado.
Cómo se calcula la puntuación
Cada tipo y nivel de pregunta tiene parámetros del modelo logístico de tres parámetros (3PL) de la Teoría de Respuesta al Ítem:
P(acierto | θ) = c + (1 − c) / (1 + e−1,7·a·(θ − b))
- θ es tu habilidad, en la escala de la población (media 0, desviación 1);
- b es la dificultad de la pregunta; a, cuánto distingue a quien sabe de quien no;
- c es la probabilidad de acertar al azar (1 dividido entre el número de alternativas).
La habilidad se estima con el método EAP (esperanza a posteriori), que combina todas las respuestas con una distribución inicial normal. La puntuación usa la escala tradicional de CI:
puntuación = 100 + 15 · θ
El sistema también calcula el error estándar de la estimación y muestra el intervalo de confianza del 95%. Es más estrecho en los tests más largos.
Precisión
Simulamos miles de participantes virtuales con habilidad conocida respondiendo según el modelo. La diferencia típica entre la puntuación estimada y la verdadera fue:
| Preguntas | Error típico (puntos) | Intervalo del 95% |
|---|---|---|
| 20 | 5,2 | ±9 |
| 40 | 3,7 | ±7 |
| 60 | 3,2 | ±5 |
| 100 | 2,3 | ±4 |
En los extremos (por debajo de 70 o por encima de 130) la estimación tiende ligeramente hacia el centro, un efecto conocido del método EAP.
Calibración con datos reales
Al principio, los parámetros de cada pregunta vienen del modelo teórico de dificultad de cada generador. A medida que las personas responden, una rutina reestima esos parámetros con datos reales y el motor empieza a usarlos. Todavía no hay datos suficientes para ninguna recalibración.
Lo que este test no es
- No es un test psicológico validado clínicamente. Los tests usados para diagnóstico, informes, selección de personal o admisiones deben estar aprobados por los organismos profesionales competentes y ser aplicados por psicólogos.
- La población de referencia es teórica. Los tests clínicos se normalizan con muestras grandes y representativas de una población. Aquí la escala parte del modelo y se afina con los propios participantes, que no son una muestra representativa.
- Las condiciones no están controladas. El cansancio, las distracciones, la prisa, una pantalla pequeña y la práctica con este tipo de preguntas cambian el resultado.
Usa el resultado como un retrato divertido e informativo de tus habilidades de razonamiento. Si necesitas una evaluación real, busca a un psicólogo colegiado.
Referencias
- Carpenter, P. A., Just, M. A. & Shell, P. (1990). What one intelligence test measures: a theoretical account of the processing in the Raven Progressive Matrices Test. Psychological Review, 97(3).
- Embretson, S. E. (1998). A cognitive design system approach to generating valid tests. Psychological Methods, 3(3).
- McGrew, K. S. (2009). CHC theory and the human cognitive abilities project. Intelligence, 37(1).
- Shepard, R. N. & Metzler, J. (1971). Mental rotation of three-dimensional objects. Science, 171.
- Wainer, H. (ed.) (2000). Computerized Adaptive Testing: A Primer. Lawrence Erlbaum.