「面接映え」と「入社後の活躍」はなぜずれるのか…STAR面接とAIによる回答分析で評価を標準化する

 多くの面接で抜け落ちるのがAだ。チームの成果(R)や状況説明(S)を聞いて満足してしまい、「その中で本人が何を考え、何を選んだか」まで掘り下げないまま評価してしまう。

面接官のばらつきを減らす「質問」と「物差し」

 構造化面接の精度を支える要素について、レバシナらが2014年に学術誌「Personnel Psychology」で行ったレビューは、同じ質問を同じ順で聞くこと、評価尺度を固定すること、面接官が個別に採点してから話し合うことなどを挙げている。現場で最低限そろえたいのは次の三点だ。

1. 共通の設問
「直近3年で最も難しかったトラブルと、解決までの経緯を教えてください」のように、職務に必要な能力と結びついた設問を全候補者に同じ形で聞く。

2. 深掘りの定型句
候補者が「〜という方針で進めました」と総論で答えたら、次のように切り返す。
 「その方針に決める前に、ほかにどんな選択肢を検討しましたか」(判断の過程を確かめる)
 「反対意見が出たとき、あなたご自身は誰に、どう働きかけましたか」(本人の行動を特定する)
主語が「私たち」「弊社」のままなら、「その中であなたが担った部分は」と一段絞る。これだけでAの情報量はかなり変わる。

3. 行動で書いたルーブリック
評価項目ごとに、点数の目安を「行動」で書いておく。例えば「問題解決力」なら次のようになる。

評価 回答に見られる行動の例
 S  原因を自ら仮説立てして検証し、再発防止の仕組みまで手を打った 
 A  原因を特定し、関係者を動かして解決まで導いた
 B  指示された対応を確実に実行したが、原因分析は他者に依存
 C  本人の行動が具体的に語られない

「主体性がある」のような形容詞で基準を書くと、面接官ごとに解釈が割れる。行動の記述にしておけば、評価の根拠を後から突き合わせやすい。

「ルーブリックは一度作って終わりではありません。入社後の評価と照らし合わせて、どの記述が実際の活躍と結びついていたかを見直していく。そこまでやって初めて自社の物差しになります」(同)

生成AIは「判定者」ではなく「点検役」として使う

 ここ数年、オンライン面接の普及で、面接の録音や文字起こしが手元に残るようになった。これを生成AIで整理すれば、面接官の聞き方や採点を振り返る材料になる。手順は大きく三つだ。

 記録と同意:録音・文字起こしの前に、利用目的を候補者に伝えて了承を得る。
 STARへの分解:文字起こしをAIに渡し、「候補者が個人として取った行動だけを抜き出し、主語が『チーム』『会社』の発言とは分けて整理せよ」と指示する。Aが薄い回答、深掘りが足りなかった箇所が一覧で見える。
 採点の照合:ルーブリックを読み込ませてAIにも根拠付きで評価させ、面接官の点数と大きくずれた項目だけを人が見直す。甘すぎる・厳しすぎる傾向を面接官本人にフィードバックする材料になる。

 気をつけたいのは、AIにも癖がある点だ。大規模言語モデルを評価者として使う研究では、回答の提示順や長さに引っ張られる傾向が報告されている。長く流暢に話した候補者が有利になるなら、人間の「話のうまさバイアス」をそのまま持ち込むことになりかねない。AIの点数は合否の決め手ではなく、面接官の判断を点検するための参考値にとどめるのが筋だ。

 法令面の確認も欠かせない。国内では職業安定法が、求職者の個人情報の収集・利用を業務の目的に必要な範囲に限るよう求めている。録音データの保管期間や、AIサービス側での学習利用の有無は、導入前に規程と契約で決めておきたい。欧州ではAI規則が採用候補者の評価に使うAIを「高リスク」に分類しており、その義務の適用開始は2026年の改正で2027年12月2日に延期された。延期であって撤回ではない。欧州で採用活動を行う企業は、人による監督や記録の仕組みを今から整えておく必要がある。