1. Propósito e uso pretendido
O AssessFit oferece avaliações pré-contratação que ajudam empresas a comparar candidatos em capacidades, conhecimentos, estilos de trabalho e julgamento relevantes para a função. As notas foram desenhadas para ser um insumo estruturado entre vários numa decisão de contratação — ao lado de entrevistas, histórico e referências. Não são instrumento médico, clínico ou diagnóstico, e o AssessFit foi desenhado para que a decisão final seja sempre de uma pessoa, não de um algoritmo.
Este manual descreve a metodologia da plataforma como ela está construída hoje. Segue a estrutura recomendada pelos Principles do SIOP e pelos Standards da AERA/APA/NCME para documentar procedimentos de seleção (ver Referências).
2. Arquitetura das avaliações
A biblioteca contém 100 testes construídos sobre um banco de 854 itens, abrangendo cinco domínios:
| Domínio | Mede | Formato |
| Capacidade cognitiva | Raciocínio numérico, verbal, lógico, espacial e mecânico, memória de trabalho, velocidade de processamento, atenção | Múltipla escolha, adaptativo |
| Habilidades profissionais | 53 testes de conhecimento de área (finanças, TI, marketing, operações, apoio à saúde, ofícios e mais) | Múltipla escolha, adaptativo |
| Julgamento situacional | Ética, priorização, liderança, cenários de clientes, resposta a crises | Múltipla escolha com cenários |
| Estilos de trabalho | Conscienciosidade, compostura, integridade, trabalho em equipe, adaptabilidade e mais 10 escalas | Autorrelato Likert com itens invertidos |
| Idioma | Inglês para negócios (alinhado ao QECR), comunicação escrita, revisão | Múltipla escolha |
Cada teste de múltipla escolha é um banco de 9 itens etiquetados por dificuldade (3 fáceis / 3 médios / 3 difíceis) com identificadores estáveis. Podem-se combinar até cinco testes por função; o catálogo de mais de 1.000 ocupações recomenda um pacote baseado em evidências por cargo.
3. Desenvolvimento de testes
Os itens são escritos segundo regras explícitas e validados por máquina antes da publicação:
- Uma única resposta defensável. Todo item deve ter exatamente uma resposta correta sem ambiguidade e três distratores plausíveis porém errados. Itens cuja correção possa ser discutida são rejeitados na revisão.
- Conceitos, não curiosidades. Os itens testam conceitos estáveis, não fatos presos a versões ou com prazo de validade.
- Neutralidade cultural. Os contextos são situações de trabalho universais; os itens cognitivos têm pouca carga de idioma onde o construto permite.
- Posições de gabarito equilibradas. As respostas corretas se distribuem quase uniformemente entre as posições (banco atual: dentro de ±1% do uniforme), então chutar por posição não dá vantagem.
- Validação estrutural. Um validador automático impõe: identificadores únicos em toda a biblioteca, composição de dificuldade 3/3/3 exata, quatro opções por item, gabaritos dentro do intervalo e rejeição de qualquer item cuja resposta correta duplique o texto de outra opção.
4. Aplicação e desenho adaptativo
Os candidatos recebem um formulário adaptativo de dois estágiosaleatório: o estágio um sorteia 3 itens médios; quem acerta ao menos 2 avança para 3 difíceis, os demais recebem 3 fáceis. Dois candidatos nunca veem formulários idênticos, e a ordem dos itens é aleatória. Cada teste tem seu próprio limite de tempo; o total da sessão é mostrado ao candidato antes de começar.
Os gabaritos nunca saem do servidor: o cliente recebe apenas enunciado e opções, e toda decisão de correção acontece no servidor no envio.
5. Pontuação
- Os testes de múltipla escolha são pontuados no servidor pela contagem de acertos nos dois estágios adaptativos.
- As escalas de estilo de trabalho são pontuadas de 0 a 100 com os itens invertidos virados antes da agregação; afirmações sem resposta pontuam no ponto médio da escala em vez de serem imputadas favoravelmente.
- Nota composta. A empresa define pesos transparentes entre aderência do currículo, testes de habilidades e medidas de estilo de trabalho; a composta é uma média ponderada e os pesos são visíveis — nenhum fator caixa-preta é aplicado.
- Veredicto de integridade. Os sinais comportamentais da sessão (ver §10) produzem nota e veredicto de integridade separados; a integridade nunca altera notas de capacidade em silêncio — é reportada ao lado delas para revisão humana.
6. Normatização
Os percentis são calculados contra grupos normativos empíricos: avaliações reais concluídas para o mesmo modelo de função, usando o método do percentil do ponto médio. Duas regras mantêm isso honesto:
- Todo percentil é exibido com o tamanho real do seu grupo normativo ("n = 40"), nunca um agregado inflado.
- Nenhuma norma sintética ou comprada é usada. Onde o grupo normativo ainda é pequeno demais para ter significado, mostram-se notas brutas sem alegações de percentil.
A contagem de conclusões da plataforma é pública e ao vivo: — avaliações concluídas até hoje.
7. Confiabilidade e qualidade de itens
Todo item do banco é monitorado continuamente contra dados reais de candidatos:
| Estatística | Definição | Limiar de ação |
| Dificuldade (p) | Proporção de acertos | p > 0,95 sinalizado fácil demais; p < 0,20 sinalizado difícil demais |
| Discriminação (rpb) | Correlação ponto-bisserial entre o acerto do item e a nota do candidato no teste | r < 0,05 com n ≥ 20 sinalizado fraco; r negativo com n ≥ 10 sinaliza gabarito suspeito para revisão imediata |
| Tempo de resposta | Segundos médios por item | Valores atípicos revisados por ambiguidade ou vazamento |
Itens sinalizados são revisados e aposentados ou substituídos; como os testes são bancos de itens, a aposentadoria não interrompe a aplicação.
Por que ainda não citamos um coeficiente alfa. Os coeficientes clássicos de consistência interna supõem que todos respondem aos mesmos itens; nossos formulários adaptativos violam isso de propósito. Em vez de publicar um alfa calculado sobre dados inadequados — ou um número copiado de folheto — publicamos ao vivo as estatísticas por item acima. Uma análise de confiabilidade da plataforma será publicada quando a matriz de respostas permitir, com seu tamanho de amostra.
8. Validade
Validade de conteúdo
Cada um dos mais de 1.000 cargos do catálogo corresponde a um de 30 perfis ocupacionais, e o pacote recomendado de cada perfil foi construído casando construtos relevantes ao trabalho com testes (ex.: funções de armazém → operações logísticas, segurança, atenção; funções de cuidado → cenários de paciente, conhecimento de cuidado, integridade). A empresa pode inspecionar e editar cada pacote — nada está escondido.
Validade de critério — sua própria evidência
O AssessFit traz um painel de validade preditivaintegrado: a empresa avalia o desempenho real das pessoas contratadas, e a plataforma calcula a correlação entre as notas e essas avaliações — no geral e por teste, sempre com o tamanho da amostra. É um estudo de validação local, a forma de evidência que as Diretrizes Uniformes da EEOC tratam como a mais forte, produzido continuamente e sem custo extra.
Compromisso. Conforme se acumulam dados anonimizados de resultados entre empresas, publicaremos resumos de validade de critério no nível da plataforma com tamanhos de amostra e intervalos de confiança — neste manual, não em press release. Referência da literatura meta-analítica: a capacidade cognitiva geral prediz o desempenho no trabalho em torno de r ≈ 0,3–0,5 (Schmidt & Hunter, 1998).
9. Equidade
- Pontuação cega por construção. O AssessFit não coleta raça, religião, gênero nem idade dos candidatos, e nenhuma variável dessas existe em lugar algum do fluxo de pontuação.
- Sem análise facial. Sem inferência de emoções, sem pontuação por vídeo, sem sinais pseudocientíficos.
- Itens cognitivos com pouca carga de idioma reduzem a carga linguística irrelevante ao construto onde ele permite.
- Responsabilidade da empresa. Pelas Diretrizes Uniformes da EEOC, a análise de impacto adverso é feita sobre o fluxo de candidatos da empresa. As notas estruturadas e ligadas à função do AssessFit tornam essa análise possível; a empresa segue responsável por monitorar suas taxas de seleção, e nossos relatórios foram desenhados para apoiar isso.
10. Integridade e segurança
Os sinais coletados na sessão (com aviso ao candidato) incluem trocas de aba/janela, tentativas de colar e copiar, uso do menu de contexto, anomalias de tempo de resposta (acertos rápidos demais para serem plausíveis) e marcadores de automação. Eles são ponderados numa nota de integridade com três veredictos: limpo (≥ 80), revisar (55–79) e alto risco (< 55), cada um listando os sinais que contribuíram, para que um humano possa julgar.
- Os gabaritos existem apenas no servidor; a pontuação é inteiramente autoridade do servidor.
- Links de convite são tokens de sessão única; o login do candidato usa links mágicos de uso único e 15 minutos.
- Bancos adaptativos aleatórios tornam respostas vazadas pouco valiosas — e o vazamento aparece nas estatísticas de itens (§7), acionando a aposentadoria.
11. Proteção de dados
- Todo o tráfego é criptografado com TLS; a aplicação impõe HTTPS e host canônico.
- Os arquivos de currículo ficam fora da raiz web e nunca são servidos ao público.
- Os candidatos podem apagar perfil e dados por uma função de autosserviço no painel.
- As respostas são armazenadas para pontuação, normatização e monitoramento de qualidade de itens como descrito; estatísticas agregadas são anônimas.
12. Uso apropriado e limitações
- As notas nunca devem ser a única base de uma decisão de contratação.
- Percentis de grupos normativos pequenos vêm rotulados e devem ser lidos com cautela.
- As escalas de estilo de trabalho são instrumentos de autorrelato; descrevem tendências típicas, não garantias de comportamento.
- Veredictos de integridade são sinais de apoio à decisão, não acusações; um veredicto de revisar pede uma conversa, não uma rejeição automática.
- Hoje os testes são entregues em inglês; notas de candidatos avaliados numa segunda língua refletem em parte a proficiência no idioma. Use os testes de idioma dedicados para medi-la explicitamente.
13. Referências e padrões seguidos
- AERA, APA & NCME (2014). Standards for Educational and Psychological Testing.
- SIOP (2018). Principles for the Validation and Use of Personnel Selection Procedures (5.ª ed.).
- EEOC et al. (1978). Uniform Guidelines on Employee Selection Procedures.
- Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
- ISO 10667 — Prestação de serviços de avaliação.
Dúvidas sobre a metodologia, ou pedidos das estatísticas subjacentes: research@assessfit.com. Este é um documento vivo — a versão e a data no topo mudam sempre que a metodologia da plataforma muda.