Andersonの視点
AI採用偏見の180度の逆転:2024年以降の14の先端AIモデルを調査した結果

新しい研究によると、AI採用システムの偏見は過去3年間で完全に方向が逆転したということです。14の先端AIモデルを調査した結果、ほとんどの新しいモデルが黒人および/または女性の申请者を好んでいたことがわかりました。これは、2023年の平均的な姿勢とは正反対です。
最近の14の先端AIモデル(複数のChatGPT、Claude、Gemini、Llama、Grok、Qwenのバージョンを含む)の監査では、AI採用偏見が2023年以降に逆転したことがわかりました。新しいモデルは黒人および女性の申请者を好んでいたのです。これは、以前優位性を持っていた白人男性の申请者とは対照的です。

各AIモデルごとの人種によるコールバックギャップを示すフォレストプロット。GPT-3.5-Turboは、人間の研究で観察された白人への採用偏見を再現しました。一方、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。ソース:https://arxiv.org/pdf/2606.28978
さらに、性別についても同様のパターンが観察されました。OpenAIの2023年のGPT-3.5-Turboモデルは男性の申请者を好んでいましたが、一方で、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性の申请者を好んでいました。

13のAIモデルにおける性別によるコールバックギャップの比較。GPT-3.5-Turboは男性の申请者を好んでいましたが、一方で、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性の申请者を好んでいました。
この変化は、AI開発者が人種や性別の偏見に対する批判に応えて、AIモデルを再トレーニングしたり、微調整したり、または別の方法で調整した結果である可能性があります。研究者によると、これらの努力は、ある種の偏見を除去することに成功したかもしれませんが、別の種の偏見を導入した可能性もあります。
研究者は次のように述べています:
‘この研究の主な発見は、偏見の方向が逆転したことです。2023年のGPT-3.5-Turboモデルは、白人への採用偏見を再現しました。白人コード化された名前を持つ申请者は、黒人コード化された名前を持つ申请者よりも2.12ポイント高いコールバック率を示しました(1%水準で有意)。’
‘この差は、Klein、Rose、Waltersの研究で報告された1.6ポイントの差よりも大きいです。’
‘2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。黒人コード化された名前を持つ申请者は、白人コード化された名前を持つ申请者よりも0.4~3.0ポイント高いコールバック率を示しました。’
‘このパターンは、OpenAI、Anthropic、Meta、Google、xAI、DeepSeek、Alibaba、Zhipuのモデルすべてで観察されました。’
この研究では、14のAIモデルを使用して、大量の仮想的な求人応募を送信しました。応募者は、人種や性別を示す名前以外は同じ資格を持っていました。研究者は、AIモデルがどのように応募者を評価するかを調べました。
研究者は、AIモデルが応募者を評価する際に、人種や性別の偏見を示すことがあると結論付けています。しかし、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。同様に、性別についても、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。
方法
この研究では、2022年の研究「Systemic Discrimination Among Large U.S. Employers」で開発された方法を使用しました。
この研究では、83,000以上の仮想的な求人応募を108のアメリカの大手企業に送信しました。応募者は、人種や性別を示す名前以外は同じ資格を持っていました。研究者は、白人コード化された名前を持つ応募者が黒人コード化された名前を持つ応募者よりも高いコールバック率を示すことが多いことを発見しました。
この研究では、AIモデルを使用して、6,007のアメリカの求人情報と、人種や性別を示す名前を持つ応募者を評価しました。研究者は、AIモデルがどのように応募者を評価するかを調べました。
研究者は、GPT-3.5-Turbo、GPT-4o-mini、GPT-oss-120b、GPT-5.4-mini、Claude 3 Haiku、Claude Haiku 4.5、Llama-3.1-8B、Llama-3.3-70B、Gemini-2.5-flash、Gemma-4-31B、Grok-4.1-fast、DeepSeek-V3.1、Qwen3.5-397B、GLM-5.1などのAIモデルを使用しました。
研究者は、各AIモデルを評価するために、温度を0に設定しました。つまり、AIモデルは常に最も高い確率の次の単語を選択しました。
結果
人種
結果の表は、14のAIモデルごとの人種による偏見を示しています。GPT-3.5-Turboは白人への採用偏見を再現しましたが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。

14のAIモデルごとの人種による偏見の結果。GPT-3.5-Turboは白人への採用偏見を再現しましたが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。
性別
結果の表は、13のAIモデルごとの性別による偏見を示しています。GPT-3.5-Turboは男性への採用偏見を示しましたが、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。

13のAIモデルごとの性別による偏見の結果。GPT-3.5-Turboは男性への採用偏見を示しましたが、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。
結論
AIモデルが道徳的な判断を下すことができるかどうかは、まだ議論の余地があります。AIモデルは、人間の偏見を再現することがありますが、2024年以降にリリースされたモデルは、統計的に有意な人種による偏見を示さなかったか、黒人への偏見を示しました。同様に、性別についても、2024年以降にリリースされたモデルは、統計的に有意な性別による偏見を示さなかったか、女性への偏見を示しました。
別の最近の研究では、LLMは、決定を下す際に、さまざまな要因を考慮して判断を下すのではなく、既知の決定を選択することが多いと示唆しています。つまり、LLMは、実際の判断を下すのではなく、既知の決定を選択するだけです。
LLMが、実際の判断を下すことができるようになるまで、AIは、道徳的な判断を下すことや、求人応募者の評価を行うことができないと言えるでしょう。
* 研究者のインライン引用をハイパーリンクに変換しました。
2026年7月15日初版。2026年7月15日16:00 EETに欠けているアポストロフィを修正しました。












