1. Propósito y uso previsto
AssessFit ofrece evaluaciones previas a la contratación que ayudan a comparar candidatos en capacidades, conocimientos, estilos de trabajo y juicio relevantes para el puesto. Las puntuaciones están diseñadas para ser un insumo estructurado entre varios en una decisión de contratación, junto a entrevistas, historial laboral y referencias. No son un instrumento médico, clínico ni diagnóstico, y AssessFit está diseñado para que la decisión final la tome siempre una persona, no un algoritmo.
Este manual describe la metodología de la plataforma tal como está construida hoy. Sigue la estructura recomendada por los Principles del SIOP y los Standards de AERA/APA/NCME para documentar procedimientos de selección (ver Referencias).
2. Arquitectura de las evaluaciones
La biblioteca contiene 100 pruebas construidas sobre un banco de 854 ítems, abarcando cinco dominios:
| Dominio | Mide | Formato |
| Capacidad cognitiva | Razonamiento numérico, verbal, lógico, espacial y mecánico, memoria de trabajo, velocidad de procesamiento, atención | Opción múltiple, adaptativa |
| Habilidades laborales | 53 pruebas de conocimiento de dominio (finanzas, TI, marketing, operaciones, apoyo sanitario, oficios y más) | Opción múltiple, adaptativa |
| Juicio situacional | Ética, priorización, liderazgo, escenarios de clientes, respuesta a crisis | Opción múltiple con escenarios |
| Estilos de trabajo | Responsabilidad, serenidad, integridad, trabajo en equipo, adaptabilidad y 10 escalas más | Autoinforme Likert con ítems invertidos |
| Idioma | Inglés de negocios (alineado al MCER), comunicación escrita, corrección | Opción múltiple |
Cada prueba de opción múltiple es un banco de 9 ítems etiquetados por dificultad (3 fáciles / 3 medios / 3 difíciles) con identificadores estables. Se pueden combinar hasta cinco pruebas por puesto; el catálogo de más de 1,000 ocupaciones recomienda un paquete basado en evidencia por cargo.
3. Desarrollo de pruebas
Los ítems se redactan con reglas explícitas y se validan por máquina antes de publicarse:
- Una sola respuesta defendible. Cada ítem debe tener exactamente una respuesta correcta sin ambigüedad y tres distractores plausibles pero erróneos. Los ítems cuya corrección pueda discutirse se rechazan en la revisión.
- Conceptos, no trivia. Los ítems evalúan conceptos estables, no datos ligados a versiones o que caducan.
- Neutralidad cultural. Los contextos son situaciones laborales universales; los ítems cognitivos llevan poca carga de idioma cuando el constructo lo permite.
- Posiciones de respuesta equilibradas. Las respuestas correctas se distribuyen casi uniformemente entre las posiciones (banco actual: dentro de ±1 % de lo uniforme), así que adivinar por posición no da ventaja.
- Validación estructural. Un validador automático exige: identificadores únicos en toda la biblioteca, composición de dificultad 3/3/3 exacta, cuatro opciones por ítem, claves dentro de rango y el rechazo de cualquier ítem cuya respuesta correcta duplique el texto de otra opción.
4. Administración y diseño adaptativo
Los candidatos reciben un formulario adaptativo de dos etapasaleatorio: la etapa uno extrae 3 ítems medios; quienes aciertan al menos 2 avanzan a 3 difíciles y el resto recibe 3 fáciles. No hay dos candidatos con formularios idénticos y el orden de ítems es aleatorio. Cada prueba tiene su propio límite de tiempo; el total de la sesión se muestra al candidato antes de empezar.
Las claves de respuesta nunca salen del servidor: el cliente recibe solo el enunciado y las opciones, y toda decisión de corrección ocurre del lado del servidor al enviar.
5. Puntuación
- Las pruebas de opción múltiple se puntúan del lado del servidor a partir de los aciertos en ambas etapas adaptativas.
- Las escalas de estilo de trabajo se puntúan de 0 a 100 con los ítems invertidos volteados antes de agregar; las afirmaciones sin responder puntúan en el punto medio en lugar de imputarse favorablemente.
- Puntuación compuesta. El empleador fija pesos transparentes entre coincidencia de CV, pruebas de habilidades y medidas de estilo de trabajo; la compuesta es una media ponderada y los pesos son visibles: no se aplica ningún factor de caja negra.
- Veredicto de integridad. Las señales conductuales de la sesión (ver §10) producen una puntuación y un veredicto de integridad separados; la integridad nunca altera en silencio las puntuaciones de capacidad: se reporta junto a ellas para revisión humana.
6. Normas
Los percentiles se calculan contra grupos normativos empíricos: evaluaciones reales completadas para la misma plantilla de puesto, con el método del percentil del punto medio. Dos reglas lo mantienen honesto:
- Cada percentil se muestra con el tamaño real de su grupo normativo ("n = 40"), nunca un agregado inflado.
- No se usan normas sintéticas ni compradas. Donde el grupo normativo aún es demasiado pequeño para ser significativo, se muestran puntuaciones brutas sin pretensiones de percentil.
El conteo de finalizaciones de toda la plataforma es público y en vivo: — evaluaciones completadas hasta la fecha.
7. Fiabilidad y calidad de ítems
Cada ítem del banco se monitorea continuamente contra datos reales de candidatos:
| Estadístico | Definición | Umbral de acción |
| Dificultad (p) | Proporción que responde correctamente | p > .95 marcado demasiado fácil; p < .20 marcado demasiado difícil |
| Discriminación (rpb) | Correlación biserial-puntual entre el acierto del ítem y la puntuación del candidato | r < .05 con n ≥ 20 marcado débil; una r negativa con n ≥ 10 marca una clave de respuesta sospechosa para revisión inmediata |
| Tiempo de respuesta | Segundos promedio por ítem | Los atípicos se revisan por ambigüedad o filtración |
Los ítems marcados se revisan y se retiran o reemplazan; como las pruebas son bancos de ítems, el retiro no interrumpe la administración.
Por qué aún no citamos un coeficiente alfa. Los coeficientes clásicos de consistencia interna asumen que todos responden los mismos ítems; nuestros formularios adaptativos violan eso a propósito. En lugar de publicar un alfa calculado sobre datos inadecuados —o un número copiado de un folleto— publicamos en vivo las estadísticas por ítem de arriba. Se publicará un análisis de fiabilidad a nivel de plataforma cuando la matriz de respuestas lo permita, con su tamaño de muestra.
8. Validez
Validez de contenido
Cada uno de los más de 1,000 cargos del catálogo corresponde a uno de 30 perfiles ocupacionales, y el paquete recomendado de cada perfil se construyó emparejando constructos relevantes al puesto con pruebas (p. ej., puestos de almacén → operaciones logísticas, seguridad, atención; puestos de cuidado → escenarios de paciente, conocimientos de cuidado, integridad). El empleador puede inspeccionar y editar cada paquete: nada está oculto.
Validez de criterio: tu propia evidencia
AssessFit incluye un panel de validez predictivaintegrado: el empleador califica el desempeño real de las personas contratadas y la plataforma calcula la correlación entre las puntuaciones y esas calificaciones, global y por prueba, siempre con su tamaño de muestra. Es un estudio de validación local, la forma de evidencia que las Directrices Uniformes de la EEOC consideran más fuerte, producido continuamente y sin costo extra.
Compromiso. A medida que se acumulen datos anonimizados de resultados entre empleadores, publicaremos resúmenes de validez de criterio a nivel de plataforma con tamaños de muestra e intervalos de confianza, en este manual, no en un comunicado. Referencia de la literatura metaanalítica: la capacidad cognitiva general predice el desempeño laboral en torno a r ≈ .3–.5 (Schmidt & Hunter, 1998).
9. Equidad
- Puntuación ciega por construcción. AssessFit no recopila raza, religión, género ni edad de los candidatos, y ninguna variable de ese tipo existe en ningún punto del proceso de puntuación.
- Sin análisis facial. Sin inferencia de emociones, sin puntuación por video, sin señales pseudocientíficas.
- Ítems cognitivos con poca carga de idioma reducen la carga lingüística irrelevante al constructo donde este lo permite.
- Responsabilidad del empleador. Según las Directrices Uniformes de la EEOC, el análisis de impacto adverso se realiza sobre el flujo de postulantes del empleador. Las puntuaciones estructuradas y ligadas al puesto de AssessFit hacen posible ese análisis; el empleador sigue siendo responsable de vigilar sus propias tasas de selección, y nuestros informes están diseñados para apoyarlo.
10. Integridad y seguridad
Las señales recogidas durante la sesión (con aviso al candidato) incluyen cambios de pestaña/ventana, intentos de pegar y copiar, uso del menú contextual, anomalías de tiempo de respuesta (aciertos inverosímilmente rápidos) y marcadores de automatización. Se ponderan en una puntuación de integridad con tres veredictos: limpio (≥ 80), revisar (55–79) y alto riesgo (< 55), cada uno listando las señales que contribuyeron para que un humano pueda juzgar.
- Las claves de respuesta existen solo del lado del servidor; la puntuación es enteramente autoridad del servidor.
- Los enlaces de invitación son tokens de sesión única; el acceso del candidato usa enlaces mágicos de un solo uso y 15 minutos.
- Los bancos adaptativos aleatorios hacen que las respuestas filtradas valgan poco, y la filtración aparece en las estadísticas de ítems (§7), disparando el retiro.
11. Protección de datos
- Todo el tráfico va cifrado con TLS; la aplicación exige HTTPS y un host canónico.
- Los archivos de CV se guardan fuera de la raíz web y nunca se sirven al público.
- Los candidatos pueden borrar su perfil y sus datos mediante una función de autoservicio en su panel.
- Las respuestas se almacenan para puntuación, normas y monitoreo de calidad de ítems como se describió; las estadísticas agregadas son anónimas.
12. Uso apropiado y limitaciones
- Las puntuaciones nunca deben ser la única base de una decisión de contratación.
- Los percentiles de grupos normativos pequeños vienen etiquetados y deben leerse con cautela.
- Las escalas de estilo de trabajo son instrumentos de autoinforme; describen tendencias típicas, no garantías de conducta.
- Los veredictos de integridad son señales de apoyo a la decisión, no acusaciones; un veredicto de revisar amerita una conversación, no un rechazo automático.
- Hoy las pruebas se entregan en inglés; las puntuaciones de candidatos evaluados en una segunda lengua reflejan en parte su dominio del idioma. Usa las pruebas de idioma dedicadas para medirlo explícitamente.
13. Referencias y normas seguidas
- AERA, APA y NCME (2014). Standards for Educational and Psychological Testing.
- SIOP (2018). Principles for the Validation and Use of Personnel Selection Procedures (5.ª ed.).
- EEOC et al. (1978). Uniform Guidelines on Employee Selection Procedures.
- Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
- ISO 10667 — Prestación de servicios de evaluación.
Preguntas sobre la metodología o solicitudes de las estadísticas subyacentes: research@assessfit.com. Este es un documento vivo: la versión y la fecha de arriba cambian cada vez que cambia la metodología de la plataforma.