Andersonの視点

AI採用偏見の180度の逆転:2024年以降の14の先端AIモデルを調査した結果

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): a photorealistic visualization of a humanoid industrial robot evaluating a room of anxious job applicants, illustrating the paper's exploration of demographic bias in AI-assisted hiring. The warning border indicates that the scene is fictional and not a depiction of events described in the research.

新しい研究によると、AI採用システムの偏見は過去3年間で完全に方向が逆転したということです。14の先端AIモデルを調査した結果、ほとんどの新しいモデルが黒人および/または女性の申请者を好んでいたことがわかりました。これは、2023年の平均的な姿勢とは正反対です。

 

最近の14の先端AIモデル(複数のChatGPT、Claude、Gemini、Llama、Grok、Qwenのバージョンを含む)の監査では、AI採用偏見が2023年以降に逆転したことがわかりました。新しいモデルは黒人および女性の申请者を好んでいたのです。これは、以前優位性を持っていた白人男性の申请者とは対照的です。

各AIモデルごとの人種によるコールバックギャップを示すフォレストプロット。GPT-3.5-Turboは、人間の研究で観察された白人への採用偏見を再現しました。一方、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。ソース:https://arxiv.org/pdf/2606.28978

各AIモデルごとの人種によるコールバックギャップを示すフォレストプロット。GPT-3.5-Turboは、人間の研究で観察された白人への採用偏見を再現しました。一方、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。ソース:https://arxiv.org/pdf/2606.28978

さらに、性別についても同様のパターンが観察されました。OpenAIの2023年のGPT-3.5-Turboモデルは男性の申请者を好んでいましたが、一方で、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性の申请者を好んでいました。

13のAIモデルにおける性別によるコールバックギャップの比較。GPT-3.5-Turboは男性の申请者を好んでいましたが、一方で、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性の申请者を好んでいました。

13のAIモデルにおける性別によるコールバックギャップの比較。GPT-3.5-Turboは男性の申请者を好んでいましたが、一方で、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性の申请者を好んでいました。

この変化は、AI開発者が人種や性別の偏見に対する批判に応えて、AIモデルを再トレーニングしたり、微調整したり、または別の方法で調整した結果である可能性があります。研究者によると、これらの努力は、ある種の偏見を除去することに成功したかもしれませんが、別の種の偏見を導入した可能性もあります。

研究者は次のように述べています:

‘この研究の主な発見は、偏見の方向が逆転したことです。2023年のGPT-3.5-Turboモデルは、白人への採用偏見を再現しました。白人コード化された名前を持つ申请者は、黒人コード化された名前を持つ申请者よりも2.12ポイント高いコールバック率を示しました(1%水準で有意)。’

‘この差は、Klein、Rose、Waltersの研究で報告された1.6ポイントの差よりも大きいです。’

‘2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。黒人コード化された名前を持つ申请者は、白人コード化された名前を持つ申请者よりも0.4~3.0ポイント高いコールバック率を示しました。’

‘このパターンは、OpenAI、Anthropic、Meta、Google、xAI、DeepSeek、Alibaba、Zhipuのモデルすべてで観察されました。’

この研究では、14のAIモデルを使用して、大量の仮想的な求人応募を送信しました。応募者は、人種や性別を示す名前以外は同じ資格を持っていました。研究者は、AIモデルがどのように応募者を評価するかを調べました。

研究者は、AIモデルが応募者を評価する際に、人種や性別の偏見を示すことがあると結論付けています。しかし、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。同様に、性別についても、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。

方法

この研究では、2022年の研究「Systemic Discrimination Among Large U.S. Employers」で開発された方法を使用しました。

この研究では、83,000以上の仮想的な求人応募を108のアメリカの大手企業に送信しました。応募者は、人種や性別を示す名前以外は同じ資格を持っていました。研究者は、白人コード化された名前を持つ応募者が黒人コード化された名前を持つ応募者よりも高いコールバック率を示すことが多いことを発見しました。

この研究では、AIモデルを使用して、6,007のアメリカの求人情報と、人種や性別を示す名前を持つ応募者を評価しました。研究者は、AIモデルがどのように応募者を評価するかを調べました。

研究者は、GPT-3.5-Turbo、GPT-4o-mini、GPT-oss-120b、GPT-5.4-mini、Claude 3 Haiku、Claude Haiku 4.5、Llama-3.1-8B、Llama-3.3-70B、Gemini-2.5-flash、Gemma-4-31B、Grok-4.1-fast、DeepSeek-V3.1、Qwen3.5-397B、GLM-5.1などのAIモデルを使用しました。

研究者は、各AIモデルを評価するために、温度を0に設定しました。つまり、AIモデルは常に最も高い確率の次の単語を選択しました。

結果

人種

結果の表は、14のAIモデルごとの人種による偏見を示しています。GPT-3.5-Turboは白人への採用偏見を再現しましたが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。

14のAIモデルごとの人種による偏見の結果。GPT-3.5-Turboは白人への採用偏見を再現しましたが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。

14のAIモデルごとの人種による偏見の結果。GPT-3.5-Turboは白人への採用偏見を再現しましたが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。

性別

結果の表は、13のAIモデルごとの性別による偏見を示しています。GPT-3.5-Turboは男性への採用偏見を示しましたが、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。

13のAIモデルごとの性別による偏見の結果。GPT-3.5-Turboは男性への採用偏見を示しましたが、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。

13のAIモデルごとの性別による偏見の結果。GPT-3.5-Turboは男性への採用偏見を示しましたが、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。

結論

AIモデルが道徳的な判断を下すことができるかどうかは、まだ議論の余地があります。AIモデルは、人間の偏見を再現することがありますが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。同様に、性別についても、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。

別の最近の研究では、LLMは、決定を下す際に、さまざまな要因を考慮して判断を下すのではなく、既知の決定を選択することが多いと示唆しています。つまり、LLMは、実際の判断を下すのではなく、既知の決定を選択するだけです。

LLMが、実際の判断を下すことができるようになるまで、AIは、道徳的な判断を下すことや、求人応募者の評価を行うことができないと言えるでしょう。

 

* 研究者のインライン引用をハイパーリンクに変換しました。

2026年7月15日初版。2026年7月15日16:00 EETに欠けているアポストロフィを修正しました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai