「面接映え」と「入社後の活躍」はなぜずれるのか…STAR面接とAIによる回答分析で評価を標準化する

「AIに任せられるのは、整理と比較までです。誰を採るかの責任は人が負う。その線引きを社内で明文化しておかないと、候補者にも説明がつきません」(同)

成果は「入社後」でしか確かめられない

 仕組みを入れたら、効果を測る指標も決めておく。目安になるのは次の三つだ。

 面接官間の一致度:同じ候補者に対する複数面接官の点数のずれ
 選考段階間の整合:一次面接の高評価者が、最終面接でどの程度通過しているか
 入社後との相関:面接での点数と、入社1年後の業績評価との関係

 三つ目は結果が出るまで時間がかかり、採用人数が少ないと統計的な結論も出しにくい。それでも、面接の点数と入社後の評価を同じ表に並べて記録し続ける企業は、自社の面接が何を当てていて、何を外しているかを数年単位で学べる。前述の通り構造化面接の精度は運用次第で大きく振れる。自社の数字で検証することが、その振れ幅を上側に寄せる唯一の方法だろう。

面接は「行動の再現性」を確かめる場

 面接の精度を上げるのは、面接官の勘を磨くことよりも、同じ質問・同じ物差し・独立した採点という地味な仕組みのほうだ。2022年の再分析は、構造化面接の優位を改めて示す一方で、その効果が設計と運用に左右されることも明らかにした。生成AIはその運用を点検する道具として役に立つが、AI自身の偏りと法的な責任の所在を踏まえて使う必要がある。「印象の良い人」ではなく「自社で同じ行動を繰り返せる人」を選ぶ。面接の役割をそう捉え直すところから始めたい。

(文=BUSINESS JOURNAL編集部、協力=松田美里/人事労務コンサルタント、社会保険労務士)

【主な参照データ・出典】
SIOP: Is Cognitive Ability the Best Predictor of Job Performance?(Sackett et al. 2022の解説)
100Hires: Structured interviews(改訂値の比較)
MASTER HR: Insights from Sackett et al.(80%信用区間)
Truffle: Levashina et al. 2014の要約
Zheng et al. 2023, Judging LLM-as-a-Judge(arXiv)
Gibson Dunn: EU AI Act Omnibus Agreement