Manual técnico · v1.0 · julho de 2026

Como as avaliações do AssessFit realmente funcionam

O documento que as equipes de compras pedem: metodologia de desenvolvimento, aplicação, pontuação, normatização, confiabilidade, validade, equidade e segurança — escrito para que cada afirmação seja verificável contra a plataforma em operação. Onde um número é medido ao vivo, mostramos o número ao vivo. Onde algo é um compromisso e não um fato, está rotulado como tal.

1. Propósito e uso pretendido

O AssessFit oferece avaliações pré-contratação que ajudam empresas a comparar candidatos em capacidades, conhecimentos, estilos de trabalho e julgamento relevantes para a função. As notas foram desenhadas para ser um insumo estruturado entre vários numa decisão de contratação — ao lado de entrevistas, histórico e referências. Não são instrumento médico, clínico ou diagnóstico, e o AssessFit foi desenhado para que a decisão final seja sempre de uma pessoa, não de um algoritmo.

Este manual descreve a metodologia da plataforma como ela está construída hoje. Segue a estrutura recomendada pelos Principles do SIOP e pelos Standards da AERA/APA/NCME para documentar procedimentos de seleção (ver Referências).

2. Arquitetura das avaliações

A biblioteca contém 100 testes construídos sobre um banco de 854 itens, abrangendo cinco domínios:

DomínioMedeFormato
Capacidade cognitivaRaciocínio numérico, verbal, lógico, espacial e mecânico, memória de trabalho, velocidade de processamento, atençãoMúltipla escolha, adaptativo
Habilidades profissionais53 testes de conhecimento de área (finanças, TI, marketing, operações, apoio à saúde, ofícios e mais)Múltipla escolha, adaptativo
Julgamento situacionalÉtica, priorização, liderança, cenários de clientes, resposta a crisesMúltipla escolha com cenários
Estilos de trabalhoConscienciosidade, compostura, integridade, trabalho em equipe, adaptabilidade e mais 10 escalasAutorrelato Likert com itens invertidos
IdiomaInglês para negócios (alinhado ao QECR), comunicação escrita, revisãoMúltipla escolha

Cada teste de múltipla escolha é um banco de 9 itens etiquetados por dificuldade (3 fáceis / 3 médios / 3 difíceis) com identificadores estáveis. Podem-se combinar até cinco testes por função; o catálogo de mais de 1.000 ocupações recomenda um pacote baseado em evidências por cargo.

3. Desenvolvimento de testes

Os itens são escritos segundo regras explícitas e validados por máquina antes da publicação:

  • Uma única resposta defensável. Todo item deve ter exatamente uma resposta correta sem ambiguidade e três distratores plausíveis porém errados. Itens cuja correção possa ser discutida são rejeitados na revisão.
  • Conceitos, não curiosidades. Os itens testam conceitos estáveis, não fatos presos a versões ou com prazo de validade.
  • Neutralidade cultural. Os contextos são situações de trabalho universais; os itens cognitivos têm pouca carga de idioma onde o construto permite.
  • Posições de gabarito equilibradas. As respostas corretas se distribuem quase uniformemente entre as posições (banco atual: dentro de ±1% do uniforme), então chutar por posição não dá vantagem.
  • Validação estrutural. Um validador automático impõe: identificadores únicos em toda a biblioteca, composição de dificuldade 3/3/3 exata, quatro opções por item, gabaritos dentro do intervalo e rejeição de qualquer item cuja resposta correta duplique o texto de outra opção.

4. Aplicação e desenho adaptativo

Os candidatos recebem um formulário adaptativo de dois estágiosaleatório: o estágio um sorteia 3 itens médios; quem acerta ao menos 2 avança para 3 difíceis, os demais recebem 3 fáceis. Dois candidatos nunca veem formulários idênticos, e a ordem dos itens é aleatória. Cada teste tem seu próprio limite de tempo; o total da sessão é mostrado ao candidato antes de começar.

Os gabaritos nunca saem do servidor: o cliente recebe apenas enunciado e opções, e toda decisão de correção acontece no servidor no envio.

5. Pontuação

  • Os testes de múltipla escolha são pontuados no servidor pela contagem de acertos nos dois estágios adaptativos.
  • As escalas de estilo de trabalho são pontuadas de 0 a 100 com os itens invertidos virados antes da agregação; afirmações sem resposta pontuam no ponto médio da escala em vez de serem imputadas favoravelmente.
  • Nota composta. A empresa define pesos transparentes entre aderência do currículo, testes de habilidades e medidas de estilo de trabalho; a composta é uma média ponderada e os pesos são visíveis — nenhum fator caixa-preta é aplicado.
  • Veredicto de integridade. Os sinais comportamentais da sessão (ver §10) produzem nota e veredicto de integridade separados; a integridade nunca altera notas de capacidade em silêncio — é reportada ao lado delas para revisão humana.

6. Normatização

Os percentis são calculados contra grupos normativos empíricos: avaliações reais concluídas para o mesmo modelo de função, usando o método do percentil do ponto médio. Duas regras mantêm isso honesto:

  • Todo percentil é exibido com o tamanho real do seu grupo normativo ("n = 40"), nunca um agregado inflado.
  • Nenhuma norma sintética ou comprada é usada. Onde o grupo normativo ainda é pequeno demais para ter significado, mostram-se notas brutas sem alegações de percentil.

A contagem de conclusões da plataforma é pública e ao vivo: avaliações concluídas até hoje.

7. Confiabilidade e qualidade de itens

Todo item do banco é monitorado continuamente contra dados reais de candidatos:

EstatísticaDefiniçãoLimiar de ação
Dificuldade (p)Proporção de acertosp > 0,95 sinalizado fácil demais; p < 0,20 sinalizado difícil demais
Discriminação (rpb)Correlação ponto-bisserial entre o acerto do item e a nota do candidato no tester < 0,05 com n ≥ 20 sinalizado fraco; r negativo com n ≥ 10 sinaliza gabarito suspeito para revisão imediata
Tempo de respostaSegundos médios por itemValores atípicos revisados por ambiguidade ou vazamento

Itens sinalizados são revisados e aposentados ou substituídos; como os testes são bancos de itens, a aposentadoria não interrompe a aplicação.

Por que ainda não citamos um coeficiente alfa. Os coeficientes clássicos de consistência interna supõem que todos respondem aos mesmos itens; nossos formulários adaptativos violam isso de propósito. Em vez de publicar um alfa calculado sobre dados inadequados — ou um número copiado de folheto — publicamos ao vivo as estatísticas por item acima. Uma análise de confiabilidade da plataforma será publicada quando a matriz de respostas permitir, com seu tamanho de amostra.

8. Validade

Validade de conteúdo

Cada um dos mais de 1.000 cargos do catálogo corresponde a um de 30 perfis ocupacionais, e o pacote recomendado de cada perfil foi construído casando construtos relevantes ao trabalho com testes (ex.: funções de armazém → operações logísticas, segurança, atenção; funções de cuidado → cenários de paciente, conhecimento de cuidado, integridade). A empresa pode inspecionar e editar cada pacote — nada está escondido.

Validade de critério — sua própria evidência

O AssessFit traz um painel de validade preditivaintegrado: a empresa avalia o desempenho real das pessoas contratadas, e a plataforma calcula a correlação entre as notas e essas avaliações — no geral e por teste, sempre com o tamanho da amostra. É um estudo de validação local, a forma de evidência que as Diretrizes Uniformes da EEOC tratam como a mais forte, produzido continuamente e sem custo extra.

Compromisso. Conforme se acumulam dados anonimizados de resultados entre empresas, publicaremos resumos de validade de critério no nível da plataforma com tamanhos de amostra e intervalos de confiança — neste manual, não em press release. Referência da literatura meta-analítica: a capacidade cognitiva geral prediz o desempenho no trabalho em torno de r ≈ 0,3–0,5 (Schmidt & Hunter, 1998).

9. Equidade

  • Pontuação cega por construção. O AssessFit não coleta raça, religião, gênero nem idade dos candidatos, e nenhuma variável dessas existe em lugar algum do fluxo de pontuação.
  • Sem análise facial. Sem inferência de emoções, sem pontuação por vídeo, sem sinais pseudocientíficos.
  • Itens cognitivos com pouca carga de idioma reduzem a carga linguística irrelevante ao construto onde ele permite.
  • Responsabilidade da empresa. Pelas Diretrizes Uniformes da EEOC, a análise de impacto adverso é feita sobre o fluxo de candidatos da empresa. As notas estruturadas e ligadas à função do AssessFit tornam essa análise possível; a empresa segue responsável por monitorar suas taxas de seleção, e nossos relatórios foram desenhados para apoiar isso.

10. Integridade e segurança

Os sinais coletados na sessão (com aviso ao candidato) incluem trocas de aba/janela, tentativas de colar e copiar, uso do menu de contexto, anomalias de tempo de resposta (acertos rápidos demais para serem plausíveis) e marcadores de automação. Eles são ponderados numa nota de integridade com três veredictos: limpo (≥ 80), revisar (55–79) e alto risco (< 55), cada um listando os sinais que contribuíram, para que um humano possa julgar.

  • Os gabaritos existem apenas no servidor; a pontuação é inteiramente autoridade do servidor.
  • Links de convite são tokens de sessão única; o login do candidato usa links mágicos de uso único e 15 minutos.
  • Bancos adaptativos aleatórios tornam respostas vazadas pouco valiosas — e o vazamento aparece nas estatísticas de itens (§7), acionando a aposentadoria.

11. Proteção de dados

  • Todo o tráfego é criptografado com TLS; a aplicação impõe HTTPS e host canônico.
  • Os arquivos de currículo ficam fora da raiz web e nunca são servidos ao público.
  • Os candidatos podem apagar perfil e dados por uma função de autosserviço no painel.
  • As respostas são armazenadas para pontuação, normatização e monitoramento de qualidade de itens como descrito; estatísticas agregadas são anônimas.

12. Uso apropriado e limitações

  • As notas nunca devem ser a única base de uma decisão de contratação.
  • Percentis de grupos normativos pequenos vêm rotulados e devem ser lidos com cautela.
  • As escalas de estilo de trabalho são instrumentos de autorrelato; descrevem tendências típicas, não garantias de comportamento.
  • Veredictos de integridade são sinais de apoio à decisão, não acusações; um veredicto de revisar pede uma conversa, não uma rejeição automática.
  • Hoje os testes são entregues em inglês; notas de candidatos avaliados numa segunda língua refletem em parte a proficiência no idioma. Use os testes de idioma dedicados para medi-la explicitamente.

13. Referências e padrões seguidos

  • AERA, APA & NCME (2014). Standards for Educational and Psychological Testing.
  • SIOP (2018). Principles for the Validation and Use of Personnel Selection Procedures (5.ª ed.).
  • EEOC et al. (1978). Uniform Guidelines on Employee Selection Procedures.
  • Schmidt, F. L., & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
  • ISO 10667 — Prestação de serviços de avaliação.

Dúvidas sobre a metodologia, ou pedidos das estatísticas subjacentes: research@assessfit.com. Este é um documento vivo — a versão e a data no topo mudam sempre que a metodologia da plataforma muda.