기술 매뉴얼 · v1.0 · 2026년 7월

AssessFit 평가는 실제로 이렇게 작동합니다

구매팀이 요청하는 바로 그 문서: 개발 방법론, 시행, 채점, 규준화, 신뢰도, 타당도, 공정성, 보안 — 모든 문장이 실제 운영 중인 플랫폼에 대조해 검증 가능하도록 작성했습니다. 실시간으로 측정되는 수치는 실시간 수치를 보여주고, 사실이 아닌 약속은 약속이라고 표기합니다.

1. 목적과 의도된 용도

AssessFit은 직무 관련 능력, 지식, 업무 스타일, 판단력에서 후보자를 비교하도록 돕는 채용 전 평가를 제공합니다. 점수는 채용 결정에서 여러 입력 중 하나의 구조화된 입력 으로 설계되었습니다 — 면접, 경력, 평판 조회와 나란히 쓰입니다. 의료·임상·진단 도구가 아니며, 최종 채용 결정은 언제나 알고리즘이 아닌 사람이 내리도록 설계되어 있습니다.

이 매뉴얼은 오늘 구축된 그대로의 플랫폼 방법론을 기술합니다. 구조는 선발 절차 문서화에 관한 SIOP 『원칙』 과 AERA/APA/NCME 『표준』 의 권고를 따릅니다( 참고문헌).

2. 평가 구조

라이브러리에는 100 개의 테스트가 있고, 그 기반은 854 개 문항의 은행입니다. 다섯 영역에 걸쳐 있습니다:

영역측정 내용형식
인지능력수리·언어·논리·공간·기계 추론, 작업 기억, 처리 속도, 주의력객관식, 적응형
직무 기술53개 영역 지식 테스트(재무, IT, 마케팅, 운영, 의료 지원, 기능직 등)객관식, 적응형
상황 판단윤리, 우선순위, 리더십, 고객 시나리오, 위기 대응시나리오형 객관식
업무 스타일성실성, 침착함, 정직성, 팀워크, 적응력 외 10개 척도역채점 문항 포함 리커트 자기보고
언어비즈니스 영어(CEFR 정렬), 글쓰기 소통, 교정객관식

각 객관식 테스트는 난이도 태그가 붙은 9문항 은행(쉬움 3 / 보통 3 / 어려움 3)이며 문항 식별자는 안정적입니다. 직무당 최대 5개 테스트를 조합할 수 있고, 플랫폼의 1,000개 이상 직업 카탈로그가 직함마다 근거 중심 번들을 추천합니다.

3. 테스트 개발

문항은 명시적 규칙에 따라 작성되고, 공개 전 기계 검증을 거칩니다:

  • 방어 가능한 단일 정답. 모든 문항은 모호하지 않은 정답 하나와 그럴듯하지만 틀린 오답지 셋을 가져야 합니다. 정답성이 논쟁될 수 있는 문항은 검토에서 탈락합니다.
  • 잡학보다 개념. 문항은 안정된 개념을 시험하지, 버전에 묶이거나 유효기간이 있는 사실을 시험하지 않습니다.
  • 문화 중립성. 맥락은 보편적인 직장 상황이며, 인지 문항은 구인개념이 허용하는 한 언어 부담을 낮춥니다.
  • 정답 위치 균형. 정답은 선택지 위치에 거의 균등하게 분포합니다(현재 은행: 균등 분포 대비 ±1% 이내). 위치 찍기 전략은 이득이 없습니다.
  • 구조 검증. 자동 검증기가 강제합니다: 라이브러리 전체에서 유일한 문항 식별자, 정확한 3/3/3 난이도 구성, 문항당 네 개의 선택지, 유효 범위의 정답 키, 그리고 정답 텍스트가 다른 선택지와 중복되는 문항의 거부.

4. 시행과 적응형 설계

후보자는 무작위화된 2단계 적응형 시험지를 받습니다. 1단계에서 보통 문항 3개를 출제하고, 2개 이상 맞힌 후보자는 어려운 문항 3개로, 나머지는 쉬운 문항 3개로 진행합니다. 같은 시험지를 받는 후보자는 없고, 문항 순서도 무작위입니다. 테스트마다 별도 제한시간이 있으며, 세션 전체 시간은 시작 전에 후보자에게 표시됩니다.

정답 키는 서버를 떠나지 않습니다. 클라이언트는 문제와 선택지만 받고, 정오 판정은 모두 제출 시 서버에서 이뤄집니다.

5. 채점

  • 객관식 테스트 는 두 적응 단계의 정답 수로 서버에서 채점됩니다.
  • 업무 스타일 척도 는 0–100으로 채점되며 역채점 문항은 집계 전에 뒤집힙니다. 무응답 문장은 유리하게 보정되지 않고 척도 중간값으로 채점됩니다.
  • 종합 점수. 기업이 이력서 적합도, 기술 테스트, 업무 스타일에 투명한 가중치를 설정합니다. 종합 점수는 가중 평균이고 가중치는 공개됩니다 — 블랙박스 요소는 없습니다.
  • 공정성 판정. 세션 행동 신호(§10 참조)는 별도의 공정성 점수와 판정을 만듭니다. 공정성이 능력 점수를 몰래 바꾸는 일은 없으며, 사람이 검토할 수 있게 나란히 보고됩니다.

6. 규준화

백분위는 실측 규준 집단을 기준으로 계산됩니다. 같은 직무 템플릿에서 실제 완료된 평가를 쓰고, 중간값 백분위법을 사용합니다. 이를 정직하게 지키는 규칙 둘:

  • 모든 백분위는 규준 집단의 실제 크기("n = 40")와 함께 표시되며, 부풀린 합산치는 절대 쓰지 않습니다.
  • 합성 규준이나 구매 규준은 쓰지 않습니다. 규준 집단이 아직 의미를 갖기에 너무 작으면, 백분위 주장 없이 원점수만 보여줍니다.

플랫폼 전체 완료 수는 공개되며 실시간입니다: 지금까지 건의 평가 완료 .

7. 신뢰도와 문항 품질

은행의 모든 문항은 실제 후보자 데이터로 지속 모니터링됩니다:

통계량정의조치 기준
난이도(p)정답률p > .95는 너무 쉬움, p < .20은 너무 어려움으로 표시
변별도(rpb)문항 정오와 후보자 시험 점수 간의 점이연 상관n ≥ 20에서 r < .05는 약함으로 표시, n ≥ 10에서 음의 r은 의심스러운 정답 키로 표시되어 즉시 검토
응답 시간문항당 평균 초이상치는 모호성·유출 여부를 검토

표시된 문항은 검토 후 퇴역하거나 교체됩니다. 테스트가 문항 은행 방식이라 퇴역이 시행을 중단시키지 않습니다.

왜 아직 알파 계수를 내걸지 않는가. 고전적 내적일관성 계수는 모든 후보자가 같은 문항에 답한다고 가정합니다. 우리의 적응형 시험지는 의도적으로 그 가정을 깹니다. 부적합한 데이터로 계산한 알파나 브로슈어에서 베낀 숫자를 내는 대신, 위의 문항 수준 통계를 실시간으로 공개합니다. 응답 행렬이 충분해지면 표본 크기와 함께 플랫폼 수준 신뢰도 분석을 공개하겠습니다.

8. 타당도

내용 타당도

카탈로그의 1,000개 이상 직업명은 각각 30개 직업 프로필 중 하나에 대응되고, 각 프로필의 추천 번들은 직무 관련 구인개념과 테스트를 대응시켜 구성했습니다(예: 창고직 → 물류 운영·안전·주의력, 돌봄직 → 환자 시나리오·돌봄 지식·정직성). 기업은 모든 번들을 확인하고 수정할 수 있습니다 — 숨긴 것이 없습니다.

준거 타당도 — 귀사 자신의 증거

AssessFit에는 예측 타당도 대시보드가 기본 내장되어 있습니다. 기업이 채용한 사람들의 실무 성과를 평가하면, 플랫폼이 평가 점수와 그 평가의 상관을 계산합니다 — 전체와 테스트별 모두, 항상 표본 크기와 함께. 이는 EEOC 통일 지침이 가장 강력하게 보는 증거 형태인 국지적 타당화 연구를, 추가 비용 없이 지속적으로 만들어내는 것입니다.

약속. 익명화된 기업 간 성과 데이터가 쌓이면, 표본 크기와 신뢰구간을 갖춘 플랫폼 수준 준거 타당도 요약을 공개하겠습니다 — 보도자료가 아니라 이 매뉴얼에서. 메타분석 문헌의 기준점: 일반 인지능력은 직무 성과를 대략 r ≈ .3–.5로 예측합니다(Schmidt & Hunter, 1998).

9. 공정성

  • 설계부터 블라인드 채점. AssessFit은 후보자에게서 인종, 종교, 성별, 나이를 수집하지 않으며, 채점 파이프라인 어디에도 그런 변수가 없습니다.
  • 얼굴 분석 없음. 감정 추론 없음, 영상 채점 없음, 사이비 과학 신호 없음.
  • 언어 부담이 적은 인지 문항 은 구인개념이 허용하는 범위에서 개념과 무관한 언어 부담을 줄입니다.
  • 기업의 책임. EEOC 통일 지침에 따라 불리 효과 분석은 기업 자신의 지원자 흐름에 대해 수행됩니다. AssessFit의 구조화된 직무 관련 점수는 그 분석을 가능하게 합니다. 자신의 선발 비율을 모니터링할 책임은 기업에 있으며, 우리의 리포트는 그것을 지원하도록 설계되었습니다.

10. 공정성 관리와 보안

세션 중(후보자에게 고지 후) 수집되는 신호에는 탭/창 전환, 붙여넣기·복사 시도, 우클릭 메뉴 사용, 응답 시간 이상(비정상적으로 빠른 정답), 자동화 흔적이 포함됩니다. 신호는 가중되어 공정성 점수가 되고 세 가지 판정이 내려집니다: 정상 (≥ 80), 검토 (55–79), 고위험 (< 55). 각 판정은 기여한 플래그를 나열해 사람이 판단할 수 있게 합니다.

  • 정답 키는 서버에만 존재하며, 채점 권한은 전적으로 서버에 있습니다.
  • 초대 링크는 단일 세션 토큰이며, 후보자 로그인은 15분 유효 일회용 매직 링크를 씁니다.
  • 무작위 적응형 은행이라 유출된 답의 가치는 제한적이며, 유출은 문항 통계(§7)에 드러나 퇴역으로 이어집니다.

11. 데이터 보호

  • 모든 트래픽은 TLS로 암호화되며, 애플리케이션은 HTTPS와 정규 호스트를 강제합니다.
  • 후보자 이력서 파일은 웹 루트 밖에 저장되며 절대 공개 웹으로 제공되지 않습니다.
  • 후보자는 대시보드의 셀프서비스 기능으로 프로필과 데이터를 삭제할 수 있습니다.
  • 평가 응답은 위에 기술한 채점·규준화·문항 품질 모니터링 목적으로 저장되며, 집계 통계는 익명입니다.

12. 적절한 사용과 한계

  • 점수가 채용 결정의 유일한 근거가 되어서는 안 됩니다.
  • 작은 규준 집단의 백분위는 표시되며, 신중히 읽어야 합니다.
  • 업무 스타일 척도는 자기보고 도구입니다. 전형적 경향을 기술할 뿐, 행동을 보장하지 않습니다.
  • 공정성 판정은 의사결정을 돕는 플래그이지 고발이 아닙니다. 검토 판정은 대화가 필요하다는 뜻이지, 자동 탈락이 아닙니다.
  • 테스트는 현재 영어로 제공됩니다. 제2언어로 응시한 후보자의 점수에는 언어 능력이 일부 반영됩니다. 그것을 명시적으로 재려면 전용 언어 테스트를 쓰세요.

13. 참고문헌과 준수 표준

  • AERA, APA, & NCME(2014). 『교육·심리 검사 표준』.
  • SIOP(2018). 『인사 선발 절차의 타당화와 사용 원칙』 (제5판).
  • EEOC 외(1978). 『직원 선발 절차 통일 지침』.
  • Schmidt, F. L., & Hunter, J. E.(1998). The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
  • ISO 10667 — 평가 서비스 제공.

방법론에 관한 질문이나 기초 통계 자료 요청: research@assessfit.com. 이것은 살아 있는 문서입니다 — 플랫폼의 방법론이 바뀔 때마다 상단의 버전과 날짜도 바뀝니다.