1. Objet & usage prévu
AssessFit fournit des évaluations de pré-embauche qui aident les employeurs à comparer les candidats sur des aptitudes, connaissances, styles de travail et jugements pertinents pour le poste. Les scores sont conçus comme un élément structuré parmi plusieurs dans une décision d'embauche — aux côtés des entretiens, du parcours et des références. Ce n'est pas un instrument médical, clinique ou diagnostique, et AssessFit est conçu pour que la décision finale d'embauche soit toujours prise par une personne, pas par un algorithme.
Ce manuel décrit la méthodologie de la plateforme telle qu'elle est construite aujourd'hui. Il suit la structure recommandée par les Principles du SIOP et les Standards AERA/APA/NCME pour documenter les procédures de sélection (voir Références).
2. Architecture des évaluations
La bibliothèque contient 100 tests bâtis sur une banque de 854 items, couvrant cinq domaines :
| Domaine | Mesure | Format |
| Capacités cognitives | Raisonnement numérique, verbal, logique, spatial & mécanique, mémoire de travail, vitesse de traitement, attention | QCM, adaptatif |
| Compétences métier | 53 tests de connaissances métier (finance, informatique, marketing, opérations, aide aux soins, métiers techniques, etc.) | QCM, adaptatif |
| Jugement situationnel | Éthique, priorisation, leadership, situations clients, réponse aux crises | QCM en situation |
| Styles de travail | Conscience professionnelle, sang-froid, intégrité, esprit d'équipe, adaptabilité et 10 échelles supplémentaires | Auto-évaluation Likert avec items inversés |
| Langue | Anglais des affaires (aligné CECR), communication écrite, relecture | QCM |
Chaque test QCM est une banque de 9 items étiquetés par difficulté (3 faciles / 3 moyens / 3 difficiles) avec des identifiants stables. Les employeurs peuvent combiner jusqu'à cinq tests par poste ; le catalogue de plus de 1 000 métiers recommande un ensemble fondé sur les preuves par intitulé.
3. Développement des tests
Les items sont rédigés selon des règles explicites, puis validés par machine avant publication :
- Une seule bonne réponse défendable. Chaque item doit avoir exactement une réponse correcte sans ambiguïté et trois distracteurs plausibles mais faux. Les items dont la correction pourrait se discuter sont rejetés à la revue.
- Des concepts, pas des anecdotes. Les items testent des concepts stables, pas des faits liés à une version ou périssables.
- Neutralité culturelle. Les contextes sont des situations de travail universelles ; les items cognitifs sont peu dépendants de la langue quand le construit le permet.
- Positions de réponse équilibrées. Les bonnes réponses sont réparties presque uniformément entre les positions (banque actuelle : à ±1 % de l'uniforme), si bien que deviner par position n'apporte aucun avantage.
- Validation structurelle. Un validateur automatique impose : des identifiants uniques dans toute la bibliothèque, une composition de difficulté 3/3/3 exacte, quatre options par item, des clés dans les bornes, et le rejet de tout item dont le texte de la bonne réponse duplique une autre option.
4. Administration & conception adaptative
Les candidats reçoivent un formulaire adaptatif à deux étagesaléatoire : l'étage un tire 3 items moyens ; les candidats qui en réussissent au moins 2 passent à 3 items difficiles, les autres reçoivent 3 items faciles. Deux candidats ne voient jamais le même formulaire, et l'ordre des items est aléatoire. Chaque test a son budget de temps ; le budget total de la session est montré au candidat avant de commencer.
Les clés de correction ne quittent jamais le serveur : le client ne reçoit que l'énoncé et les options, et toutes les décisions de correction se prennent côté serveur à la soumission.
5. Notation
- Les tests QCM sont notés côté serveur à partir des bonnes réponses sur les deux étages adaptatifs.
- Les échelles de style de travail sont notées de 0 à 100, les items inversés étant retournés avant agrégation ; les énoncés sans réponse comptent au point médian de l'échelle plutôt que d'être imputés favorablement.
- Score composite. Les employeurs fixent des pondérations transparentes entre adéquation CV, tests de compétences et mesures de style de travail ; le composite est une moyenne pondérée et les poids sont visibles — aucun facteur boîte noire.
- Verdict d'intégrité. Les signaux comportementaux de session (voir §10) produisent un score et un verdict d'intégrité séparés ; l'intégrité ne modifie jamais silencieusement les scores d'aptitude — elle est rapportée à leurs côtés pour revue humaine.
6. Étalonnage
Les percentiles sont calculés sur des groupes de référence empiriques : de vraies évaluations terminées pour le même modèle de poste, avec la méthode du percentile médian. Deux règles gardent cela honnête :
- Chaque percentile est affiché avec la taille réelle de son groupe de référence (« n = 40 »), jamais un agrégat gonflé.
- Aucune norme synthétique ou achetée. Quand un groupe de référence est encore trop petit pour être significatif, les scores bruts sont montrés sans prétention de percentile.
Le nombre de passations de la plateforme est public et en direct : — évaluations terminées à ce jour.
7. Fiabilité & qualité des items
Chaque item de la banque est suivi en continu sur des données réelles de candidats :
| Statistique | Définition | Seuil d'action |
| Difficulté (p) | Proportion de bonnes réponses | p > ,95 signalé trop facile ; p < ,20 signalé trop difficile |
| Discrimination (rpb) | Corrélation point-bisériale entre la réussite de l'item et le score au test du candidat | r < ,05 à n ≥ 20 signalé faible ; un r négatif à n ≥ 10 signale une clé de correction suspecte pour revue immédiate |
| Temps de réponse | Secondes moyennes par item | Valeurs extrêmes revues pour ambiguïté ou fuite |
Les items signalés sont revus puis retirés ou remplacés ; les tests étant des banques d'items, le retrait n'interrompt pas l'administration.
Pourquoi nous ne citons pas encore de coefficient alpha. Les coefficients classiques de cohérence interne supposent que chaque candidat répond aux mêmes items ; nos formulaires adaptatifs violent délibérément cette hypothèse. Plutôt que publier un alpha calculé sur des données inadaptées — ou un chiffre copié d'une brochure — nous publions en direct les statistiques d'items ci-dessus. Une analyse de fiabilité au niveau de la plateforme sera publiée quand la matrice de réponses le permettra, avec sa taille d'échantillon.
8. Validité
Validité de contenu
Chacun des 1 000+ intitulés du catalogue correspond à l'un de 30 profils métiers, et l'ensemble de tests recommandé de chaque profil a été construit en associant les construits pertinents au poste et les tests (ex. : postes d'entrepôt → opérations logistiques, sécurité, attention ; postes de soin → situations patients, connaissances d'aide, intégrité). Les employeurs peuvent inspecter et modifier chaque ensemble — rien n'est caché.
Validité critérielle — vos propres preuves
AssessFit intègre un tableau de bord de validité prédictive : les employeurs notent la performance en poste des personnes embauchées, et la plateforme calcule la corrélation entre les scores d'évaluation et ces notes — globalement et par test, toujours avec la taille d'échantillon. C'est une étude de validation locale, la forme de preuve que les Directives uniformes de l'EEOC considèrent comme la plus forte, produite en continu et sans coût supplémentaire.
Engagement. À mesure que s'accumulent des données de résultats anonymisées inter-employeurs, nous publierons des synthèses de validité critérielle au niveau de la plateforme, avec tailles d'échantillon et intervalles de confiance — dans ce manuel, pas dans un communiqué. Repère de la littérature méta-analytique : les capacités cognitives générales prédisent la performance au travail à environ r ≈ ,3–,5 (Schmidt & Hunter, 1998).
9. Équité
- Notation aveugle par construction. AssessFit ne collecte ni origine, ni religion, ni genre, ni âge auprès des candidats, et aucune variable de ce type n'existe nulle part dans la chaîne de notation.
- Pas d'analyse faciale. Pas d'inférence d'émotions, pas de notation vidéo, pas de signaux pseudo-scientifiques.
- Des items cognitifs peu dépendants de la langue réduisent la charge linguistique étrangère au construit quand celui-ci le permet.
- Responsabilité de l'employeur. Selon les Directives uniformes de l'EEOC, l'analyse d'impact défavorable se conduit sur le flux de candidats de l'employeur. Les scores structurés et liés au poste d'AssessFit rendent cette analyse possible ; les employeurs restent responsables du suivi de leurs taux de sélection, et nos rapports sont conçus pour le faciliter.
10. Intégrité & sécurité
Les signaux collectés pendant une session (avec information du candidat) comprennent les changements d'onglet/de fenêtre, les tentatives de collage et de copie, l'usage du menu contextuel, les anomalies de temps de réponse (bonnes réponses invraisemblablement rapides) et les marqueurs d'automatisation. Ils sont pondérés en un score d'intégrité avec trois verdicts : sain (≥ 80), à revoir (55–79) et à haut risque (< 55), chacun listant les signaux contributifs pour qu'un humain puisse juger.
- Les clés de correction n'existent que côté serveur ; la notation fait entièrement autorité côté serveur.
- Les liens d'invitation sont des jetons à session unique ; la connexion candidat utilise des liens magiques à usage unique, valables 15 minutes.
- Les banques adaptatives aléatoires limitent la valeur des réponses fuitées — et la fuite apparaît dans les statistiques d'items (§7), déclenchant le retrait.
11. Protection des données
- Tout le trafic est chiffré TLS ; l'application impose HTTPS et un hôte canonique.
- Les fichiers CV des candidats sont stockés hors de la racine web et ne sont jamais servis au public.
- Les candidats peuvent effacer leur profil et leurs données via une fonction en libre-service de leur tableau de bord.
- Les réponses aux évaluations sont conservées pour la notation, l'étalonnage et le suivi de la qualité des items comme décrit ci-dessus ; les statistiques agrégées sont anonymes.
12. Usage approprié & limites
- Les scores ne doivent jamais être l'unique fondement d'une décision d'embauche.
- Les percentiles issus de petits groupes de référence sont signalés et doivent se lire avec prudence.
- Les échelles de style de travail sont des instruments d'auto-évaluation ; elles décrivent des tendances typiques, pas des garanties de comportement.
- Les verdicts d'intégrité sont des signaux d'aide à la décision, pas des accusations ; un verdict à revoir appelle une conversation, pas un rejet automatique.
- Les tests sont aujourd'hui délivrés en anglais ; les scores des candidats évalués dans une langue seconde reflètent en partie leur maîtrise de la langue. Utilisez les tests de langue dédiés pour la mesurer explicitement.
13. Références & normes suivies
- AERA, APA & NCME (2014). Standards for Educational and Psychological Testing.
- SIOP (2018). Principles for the Validation and Use of Personnel Selection Procedures (5e éd.).
- EEOC et al. (1978). Uniform Guidelines on Employee Selection Procedures.
- Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
- ISO 10667 — Prestation de services d'évaluation.
Questions de méthodologie ou demandes des statistiques sous-jacentes : research@assessfit.com. C'est un document vivant — la version et la date en haut changent chaque fois que la méthodologie de la plateforme change.