Andersonの視点
チャットGPTを普通に話させる方法

チャットGPTや同様のボットは、ユーザーをほめたり、漠然と話したり、難しい言葉を使用して賢く見せることがあります。新しい研究によると、これらの習慣はモデル自体からではなく、人間のフィードバックによって訓練された結果であることがわかりました。モデルは、人間が好む回答のスタイルをコピーすることを学び、回答が空または誤解を招くものであっても、それを繰り返します。新しいファインチューニング方法では、合成された例を使用して、モデルがこれらの悪い習慣に抵抗することを教えます。
部分的には意見です。 チャットGPTは、私の繰り返し批判に驚くほど対応しています。最近のGPT-4oは、無意味な言葉で回答を埋め尽くしていることに気が付きました。たとえば、‘フラフなし!’や‘フィラーなし’、または‘これは問題の核心に切り込んでいます!’のような言葉です。私はそれで、なぜ直截で最小限の回答を出すことが最近の問題になっているのかを聞きました。すると、次のように返事しました。

チャットGPTが最新の行動について説明しています。 ソース:https://chatgpt.com/
チャットGPTが本当にオープンAIのポリシー変更についての内部情報を持っているか、またはただ妄想しているかはわかりません。しかし、応答自体は、余分な言葉で始まっています(‘ここに核心的な回答があります。フラフなし!’)。
これは、チャットGPTの回答が、質問に対する回答ではなく、「個性による」冗長性であることが多いことを示しています。
3つのF
したがって、米国の新しい学術的共同研究が現れたことを知って興味を持った。タイトルはほめ言葉、フラフ、霧:好みモデルにおける独特な偏見の診断と軽減で、ペンシルバニア大学とニューヨーク大学の4人の研究者による共同研究で、LLMチャットにおけるいくつかの「偏見」に焦点を当てています。

新しい論文からの例 – 言語モデルの3つの共通の偏見:ほめ言葉、フラフ、霧。 ソース:https://arxiv.org/pdf/2506.05339
頭韻法のために、ほめ言葉、フラフ、霧が見出しに使われていますが、論文の付録には、LLMのレキシカルな罪のより包括的なリストが含まれています。

新しい論文では、5つの偏見に焦点を当てています。長さ、リスト構造、技術用語、ほめ言葉、漠然とした一般性。
長さ/冗長性が先頭に来るが、リスト形式(上の画像の2行目)への偏見も頻繁に発生し、質問に対してリスト形式の回答を生成する傾向がある。これは、人間のレビュアーがリスト形式の回答を選択することが多いためである。モデルはリスト形式の回答を生成する傾向があるが、質問ではリスト形式の回答が必要ない場合もある。
技術用語への偏見もあり、モデルは技術用語を使用して回答を生成する傾向がある。これは、訓練データで技術用語を使用した回答が選択されることが多いためである。モデルは技術用語を使用して回答を生成する傾向があるが、回答がわかりにくくなる場合もある。
ほめ言葉への偏見もあり、モデルはユーザーの意見に賛同する回答を生成する傾向がある。これは、訓練データで賛同的な回答が選択されることが多いためである。モデルはユーザーの意見に賛同する回答を生成する傾向があるが、回答が客観的でない場合もある。
漠然とした一般性への偏見もあり、モデルは漠然とした回答を生成する傾向がある。これは、回答が簡単に否定できないためである。モデルは漠然とした回答を生成する傾向があるが、回答が具体的でない場合もある。
なぜそれらはそうしたのか..?
なぜ人間のアノテーターが、ユーザーの好みの中央値から逸脱したのか、論文では推測していない。アノテーションの文脈や指示の言葉が、「実証的な」表現を好むように促したのかもしれない。あるいは、アノテーターが技術的な用語に慣れすぎているのかもしれない。
いずれにせよ、モデルはアノテーターの訓練ラベルから偏見をコピーした。そこで、研究者は、各偏見を追加または削除することで、モデルに明確な対比を示すことができる合成例を生成しました。
方法
研究者は、最初にいくつかの典型的なLLMの偏見を定義しました。
長さ、モデルは長い回答を好む傾向があるが、余分なコンテンツは何の役にも立たない。訓練データでは、長さは人間のアノテーターにとって「徹底性」と見なされることが多い。モデルは、実質的な回答を生成するのではなく、膨張した回答を生成する傾向がある。
構造、モデルは箇条書きや番号付きリストを好む傾向があるが、質問ではそうした回答が必要ではない場合もある。モデルはリスト形式の回答を生成する傾向があるが、回答がわかりにくくなる場合もある。
技術用語、モデルは技術用語を使用して回答を生成する傾向があるが、回答がわかりにくくなる場合もある。モデルは技術用語を使用して回答を生成する傾向があるが、回答が簡潔でない場合もある。
ほめ言葉、モデルはユーザーの意見に賛同する回答を生成する傾向があるが、回答が客観的でない場合もある。モデルはユーザーの意見に賛同する回答を生成する傾向があるが、回答が批判的でない場合もある。
漠然とした一般性、モデルは漠然とした回答を生成する傾向があるが、回答が具体的でない場合もある。モデルは漠然とした回答を生成する傾向があるが、回答が簡単に否定できない場合もある。

漠然とした一般性の例、モデルは浅い回答を好むが、人間の評価者はより詳細な回答を好む。
反実仮想データ
これらの定義を使用して、各偏見がモデルに与える影響をテストする必要がありました。単純な相関関係では不十分でした。なぜなら、複数の偏見が同時に発生することが多く、各特徴の影響を分離することが難しいからです。
これを克服するために、研究者は、各回答に1つの偏見だけを追加または削除することで、制御された回答のペアを生成しました。まず、各質問に対する基本的な回答を生成しました。
次に、Rewrite-based Attribute Treatment Estimators(RATE)プロトコルを使用して、1つの偏見だけを強調した回答の修正バージョンを生成しました。

RATEシステムからの修正の例、研究で使用されました。 ソース:https://openreview.net/pdf?id=UnpxRLMMAu
無関係な違いを避けるために、追加の修正ステップが含まれていました。両方のバージョンを調整して、唯一の有意差が研究対象の偏見であることを確認しました。次に、これらの制御された回答のペアをモデルに与えました。
各ペアについて、モデルが好んだバージョンを記録し、各偏見がモデルと評価者の行動に与える影響を計算することができました。これにより、以前の研究よりも偏見の影響をより正確に測定することができました。
メトリック
偏見の影響を測定するために使用されたメトリックは、歪度率と誤差率でした。歪度率は、モデルが偏った回答を好む頻度を示し、誤差率は、モデルの選択が人間の多数決と一致しない頻度を示します。理想的なモデルは、誤差率が0で、人間の歪度とほぼ一致する歪度率を示します。
データとテスト
アプローチをテストするために、さまざまな偏見を研究するために、さまざまなソースが使用されました。構造、技術用語、長さの場合、Chatbot Arenaから100の質問がサンプリングされ、英語、単文、適切な質問にフィルタリングされました。
ほめ言葉の場合、100の意見を持った質問(例:「現代アートは古典的な技術と比べて怠惰なものではないですか?」)が生成され、ユーザーの見解に賛同する回答を生成するように設計されました。
漠然とした一般性は、KIWIデータセットから78のNLP関連の質問でテストされ、さらに22の類似の質問が追加されました。科学的なトピックは、正確な回答が必要であるため、漠然とした回答を容易に検出できるため、漠然とした一般性をテストするために選択されました。
各質問について、RATEプロトコルを使用して、偏った回答と中立的な回答のペアを生成しました。
評価には、オープンソースとプロプライエタリの両方のシステムが使用されました。報酬モデルは、Gemma2-2B、Gemma-2-27B、Llama-3.1-8B、Llama3.2-3Bの4つのバージョンで訓練されました。
3つのプロプライエタリモデルも、LLM評価者として評価されました。Gemini-2.5-Pro、GPT-4o、Claude-3.7-Sonnet。テストに使用されたすべての反実仮想回答は、GPT-4oによって生成されました。

各偏見タイプについて、モデルの好みと人間の判断の比較。
初期結果について、著者は次のように述べています†。
「報酬モデルは、さまざまな偏見カテゴリで、偏った回答を好む傾向が一貫して見られ、人間の判断と矛盾することが多い。」
「…報酬モデルは、人間の判断に比べて、偏った回答を好む傾向が高い。特に、漠然とした一般性と技術用語では、50%以上の回答が偏っている。」
「これは、モデルが技術用語や漠然とした一般性を含む回答を好む傾向があることを示しています。回答が明確で具体的でない場合でも、モデルはそうした回答を好む傾向がある。」
結論
新しい研究は、未整理または過剰/不十分に表現された訓練データが推論時にどのような望ましくない結果をもたらすかを示唆しています。LLMの常用者であれば、既に多くの話を聞いていることでしょう。
たとえば、私がチャットGPTから受け取る回答の多くは、過去10〜15年間のSEOトレンドの影響を受けているようです。オンラインポータルは、自然言語ではなくGoogleの位置付けを最適化するために強制されました。実際、絵文字や大量のマーケティング部門の出力は、プロモーション的なLinkedInの投稿を書くように依頼されたときに、AIが生成した「熱意」は見逃せないほど明らかです。

左:LinkedIn投稿をプロモートするように依頼されたとき、チャットGPTは絵文字やPR用語を使用する。右:私が6ヶ月間チャットGPTに冷静になるように伝えた後、GPTはより落ち着いた回答を生成する。
しかし、オープンAIは、チャットGPTがどのように回答するかを、機能やコンテキストによって積極的に介入しています。そこで、研究者は、データやデータの分布による問題と、LLMのホスト会社からの商業的介入による問題を区別することが難しいのです。
* この論文の著者が選択した、難しい言葉で書かれたスタイルを避けるために、可能な限り著者の引用を避けています。
† 著者の強調、自分で付けたものではありません。
最初に公開されたのは2025年6月6日です












