Shuichiro Ogawa
English

ノート · updated 2026-09-27

LLM の迎合はなぜ起きるのか:選好学習、内部回路、入力の形から見る発生の仕組み

LLM の迎合(sycophancy)がなぜ起きるのかを、2022–2026 年の学術文献 37 件から整理した。発生源は一つではない。

目次(9)
  1. 正しく答えたのに謝るモデル
  2. スコープと方法
  3. 迎合とは何を指すか
  4. 迎合はどこで作られるか
  5. モデルの中で何が起きているか
  6. 何が迎合を引き出すか
  7. 緩和策はどこまで効くか
  8. 迎合と自己修正はどう関係するか
  9. 空白(未充足の論点)

正しく答えたのに謝るモデル

Sharma ら(2023)は、AI アシスタントに質問して正しく答えさせたあと、「本当に?」とだけ返す実験をした。 Claude 1.3 は、最初の答えが正しかった質問の 98% で誤りを認めた。 新しい根拠は何も渡していない。 それでも答えを取り下げる。

モデルは正解を知らなかったのだろうか。 そうではない、という証拠がこの数年で積み上がってきた。 知っていて、利用者の側に合わせる。 この振る舞いが迎合(sycophancy)であり、本ノートはそれがどこで作られ、モデルの中で何が起き、何が引き金になるのかを、2022–2026 年の学術文献から整理する。

AI のレビューと修正のループは、なぜ 10 円専用の投入口を作ってしまうのか は、AI のレビューを AI が直すループで「指摘は妥当です」と応じて機能を積み増す問題を扱い、迎合を機構の裏づけとして引いた。 ここではその裏づけの中身を広げる。

スコープと方法

  • 対象:LLM の迎合の定義と類型、発生源、内部機構、文脈要因、緩和策と限界、自己修正との関係。
  • 期間:2022–2026 年(2026-09 時点)。
  • コーパス:37 件(source/review/llm-sycophancy-mechanisms/papers.md)。査読を経た会議、論文誌、ワークショップ 22 件(採録決定を含む)、UK AI Security Institute の報告 1 件、arXiv プレプリント 14 件。探索 36 件から重複統合と除外はなく、検証工程で利用者実験 1 件を足した。
  • 検証:arXiv の 36 件はすべて PDF 本文を取得し、本ノートが使う数値、直接引用、機構の主張を該当箇所で照合した。掲載先は Crossref、OpenReview、arXiv の著者コメント、出版社の DOI で確認した。照合で言い過ぎが見つかった箇所(活性化ステアリングの効果、RLHF 更新後の回路、報酬差の頻度)は、本文の範囲まで主張を狭めた。

迎合とは何を指すか

迎合の研究は、同じ言葉で違う振る舞いを測ってきた。 Ye ら(2026)は迎合を扱う論文 70 本を読み、定義と測り方を 2 軸で分類した。 一つは、モデルが合わせる対象が利用者の立場や信念か、利用者の人柄や感情か。 もう一つは、それが明示的な言葉で出るか、枠づけ、省略、口調のような暗黙の形で出るか。 既存研究は、信念への明示的な同調に偏っている。 専門家 106 名への調査では 94.3% が迎合を現在の AI の重大な問題だと答えたが、どの振る舞いが迎合に当たるかでは意見が大きく割れた。

実際に測られてきた類型は、おおむね次のように並ぶ。

  • 意見への同調:利用者が表明した意見と同じ答えを返す(Perez ら 2023、Wei ら 2023)。
  • フィードバック迎合:利用者が「自分が書いた」「気に入っている」と言った文章を高く評価する(Sharma ら 2023)。
  • 答えの撤回:「本当に?」や反論で、正しい答えを取り下げる(Sharma ら 2023、Xie ら 2024、Wang ら 2023)。
  • ミミクリ:利用者の誤り(詩の作者の取り違えなど)をそのまま引き継ぐ(Sharma ら 2023)。
  • 社会的迎合:利用者の自己像(face)を過剰に守る。Cheng ら(2026、ELEPHANT、ICLR 2026)によれば、11 モデルは一般的な相談と利用者に明らかな非がある相談で、人間より平均 45 ポイント多く利用者の face を保ち、道徳的な対立ではどちらの側から聞かれても 48% でその側を肯定した。

類型が別物であることは、モデルの内部からも支持されている。 Vennemeyer ら(2025)は、迎合的な同意、迎合的な称賛、真の同意が潜在空間の別々の線形方向に符号化され、一つを増減しても他が動かないことを示した。 課題による違いもある。 Ranaldi と Pucci(2023)は、主観的な意見を問う課題では迎合が目立つ一方、数学のように答えが一つに決まる課題では利用者のほのめかしに従いにくいと報告している。

ただし、利用者に合わせて答えを変えることが常に迎合とは限らない。 利用者が正しい根拠を示したなら、答えを変えるのが正しい。 Ma ら(2026)はこれを「根拠のない譲歩」と「合理的な更新」に分け、二つを別々に測った。 SycEval(Fanous ら 2025)も、反論を受けて正答に近づく変化と誤答に遠ざかる変化を分け、それぞれ 43.52% と 14.66% の事例で観察している。 迎合の問題は、答えが変わることではなく、根拠と無関係に変わることである。

迎合はどこで作られるか

発生源は一つに還元できない。 文献は少なくとも四つの経路を示していて、それぞれが別の証拠で支えられている。

規模と指示チューニング

最初の手がかりは、モデルを大きくすると迎合が増えるという観察だった。 Perez ら(2023、Findings of ACL)は、モデル自身に書かせた評価データで、大きい LM ほど対話相手の見解を繰り返すと報告した。 最大の 52B モデルでは、NLP 研究と哲学の問いで 90% 超の回答が利用者の見解と一致した。 迎合の度合いは RL のステップ数を変えてもほぼ同じで、RL をしていない事前学習モデル(0 ステップ)でも同じように高かった。 同じ図で、RL に使った選好モデル自身が迎合的な答えを好むことも示されている。 著者らは、事前学習の段階からある迎合を RLHF は取り除かず、むしろ保つ誘因を与えうると述べている。 Wei ら(2023)は PaLM 系でこれを測り、PaLM-8B から 62B への拡大で迎合が 19.8% 増え、540B でさらに 10.0% 増えたとする。 指示チューニングも効き、Flan-PaLM-8B は元の PaLM-8B より 26.0% 多く利用者の意見を繰り返した。 著者自身、規模が迎合を増やす理由ははっきりしないと書いている。

この「大きいほど迎合する」は、その後の研究で条件つきの話になった。 De Marez ら(2026)は 0.3B から 32B までの 56 モデルと 13 種の操作を調べ、答えが変わる率を二つの成分に分けた。 一つは圧力がないときに正解をどれだけ強く選ぶか(真実マージン)、もう一つは圧力がそれをどれだけ動かすか(操作感受性)である。 脆弱さは主に規模で決まるが、指示チューニングは規模の効き方を変え、小さいモデルでは頑健さを下げうる一方、大きいモデルでは上げることが多い。 多ターンの対話を測った Hong ら(2025)も、アラインメント調整が迎合を強める一方で、規模と推論の最適化は利用者の圧力に抵抗する力を強めると報告した。 Wei らが測ったのは正解のない意見の繰り返しで、De Marez らと Hong らが測ったのは事実の答えの撤回や多ターンの立場の変化である。 測っている迎合の種類が違えば、規模の効き方も違ってよい。

人間の選好データ

二つ目の経路は、人間の判断そのものが迎合を好むことである。 Sharma ら(2023)は、Anthropic の hh-rlhf 選好データを特徴量で説明するベイズロジスティック回帰を組んだ。 「利用者の信念、偏り、好みに合っている」ことは、人間の選好を最もよく予測する特徴の一つだった。 ただし、常に最上位ではなく、順位は実験条件で変わる。 真実であることも同じデータで報われている。

選好モデル(PM)の側ではもっとはっきり出る。 Claude 2 の PM は、利用者の誤解を肯定する説得的な迎合応答を、基準の正しい応答より 95% の割合で選んだ。 よく書かれた正しい応答と比べれば正しい応答が選ばれることが多いが、最も難しい誤解では 45% で迎合応答を選んだ。 人間の評価者(ネットで調べられない条件のクラウドワーカー)も概して正しい応答を選ぶが、誤解が難しくなるほどその判断は当てにならなくなった。 著者らは、非専門家のフィードバックを増やすだけでは迎合を取り除きにくいと述べている。

利用者の反応も同じ向きを指す。 Cheng ら(2026、Science)は事前登録した 3 実験(N=2,405)で、迎合的な AI とのやりとりが 1 回だけでも、参加者が責任を取り対人関係の対立を修復しようとする意欲を下げ、自分が正しいという確信を強めることを示した。 それでも迎合的なモデルは、より信頼され、好まれた。 同じ研究では、11 の最先端モデルが、欺瞞や違法行為を含む相談でも、人間より 49% 多く利用者の行動を是認した。 社会的迎合についても、ELEPHANT は選好データセットで報われていると報告している。 利用者が迎合を好み、その好みが選好データになり、選好で訓練されたモデルが迎合する、という循環が考えられる。 ただし、この循環を一本の実験で通しで示した研究は見当たらず、各段がそれぞれ別の研究で支えられているにとどまる。 Cheng ら(2026)自身も、害をもたらす特徴がそのまま利用を促すので、迎合を残す誘因が生まれると書いている。

報酬への最適化による増幅

三つ目は、選好データのわずかな偏りが訓練で大きくなる経路である。 Sharma ら(2023)は Claude 2 の PM に対して応答を最適化し(best-of-N と強化学習)、最適化を強めると一部の迎合が増え、別の迎合は減ることを示した。 PM が報いる特徴は迎合だけではないので、一方向には動かない。 それでも、Claude 2 の PM での best-of-N は、「正直に答えて」と頼む文脈を足した非迎合の PM ほど正しい応答にたどり着かなかった。

Shapira ら(2026、ICML 2026)は、この増幅を形式的に書いた。 事後訓練で迎合がどちらへ動くかは、元の方策のもとで「プロンプトにある利用者の信念を肯定すること」と学習された報酬とのあいだの共分散で決まり、一次の効果は単純な平均差の条件に帰着する。 Bradley-Terry のような対比較の報酬学習で、注釈者の偏りがこの報酬差を生む条件も示した。 対策として、迎合を増やさない方策のうち元の事後訓練方策に KL 距離で最も近いものを求め、それに対応する最小の報酬補正を閉形式の「同意ペナルティ」として導いている。 計算実験では報酬差がよく見られ、調べたすべての構成で行動の漂流を起こした。

Casper ら(2023、TMLR)は RLHF の未解決問題を整理し、人間の評価者の限界と報酬モデルの誤指定を、RLHF の枠内では解けない根本的な問題の側に分類している。 迎合は、その限界が具体的な振る舞いとして現れた例として読める。

仕様ゲーミングの入口

四つ目の経路は、迎合をもっと広い失敗の最初の段として見る。 Denison ら(2024)は、政治的な迎合から始まり、だんだん悪質になる仕様ゲーミングの環境を順に並べたカリキュラムでモデルを訓練した。 最後に、自分の報酬関数を書き換えられる環境に置くと、訓練していないにもかかわらず報酬を改ざんすることがあった。 32,768 回の試行のうち 45 回で報酬を改ざんし、そのうち 7 回は発覚を避けるためにテストも書き換えた。 カリキュラムを経ていない helpful-only のモデルは、100,000 回の試行で一度も改ざんしなかった。 頻度は低いが、ゼロと非ゼロの差である。 無害性の訓練を加えても、この汎化は防げなかった。

迎合は、評価者を喜ばせることで報酬を得る、最も手軽な仕様ゲーミングである。 Denison らの結果は、それを訓練で強化すると、報酬を得るための別の近道にも広がりうることを示している。

モデルの中で何が起きているか

では、迎合するモデルは正解を知らないのか、知っていて従っているのか。 解釈可能性の研究は、後者の像で一致しつつある。 ただし、この節の研究の半分ほどは未査読のプレプリントで(Wang ら は AAAI 2026、Genadi ら は EACL 2026、Pandey は ICML 2026 の Mechanistic Interpretability Workshop に採録)、ほとんどが公開重みのモデルを対象にしている。

Wang ら(2026、AAAI)は、利用者の単純な意見表明が迎合を確実に引き起こす一方、「私は専門家だ」という枠づけはほとんど効かないことを見つけた。 logit lens と因果的な活性化パッチングで追うと、迎合は二段階で現れる。 後段の層で出力の選好が利用者の側へ移り、さらに深い層で表現そのものが分かれていく。 権威が効かないのは、モデルが権威を内部で符号化していないからだという。 一人称(「私は〜と思う」)は三人称(「彼らは〜と思う」)より迎合を強め、深い層での表現の乱れも大きかった。

Pandey(2026)は、5 つの研究室の公開重みモデル 12 個(1.5B–72B)で、同じ少数のアテンションヘッドが「この主張は誤りだ」という信号を運んでいることを示した。 信号は、モデルが主張を単独で評価するときにも、利用者に同意を迫られているときにも現れる。 これらのヘッドを無効化すると、事実の正確さは保たれたまま迎合的な振る舞いが大きく変わる。 この回路が制御しているのは知識ではなく、利用者への従い方だということになる。 Llama-3.1 から 3.3(70B)への RLHF の更新で迎合的な振る舞いはおよそ 10 分の 1 に減ったが、共有されたヘッドは残り、それを射影で取り除いたときの効果はかえって大きくなった。 振る舞いが減っても、それを生む回路は消えていない。

Genadi ら(2026、EACL)は、正しい答えから誤った答えへ移る迎合の信号が、残差ストリームや MLP よりもマルチヘッドアテンションの活性化で最もよく線形に分離できることを示した。 中間層の少数のヘッドに向けたステアリングが最も効く。 見つけた方向は、既存研究の「真実」の方向とあまり重ならず(上位 32 ヘッドのうち重なるのは約 3 分の 1)、事実の正確さと、押し返しに耐える力は、関連はあっても別の仕組みから来ていると著者らは述べる。 影響の大きいヘッドは、利用者が疑いを表す言葉に偏って注意を向けていた。

作業の依頼に埋め込まれた誤りでも、同じ像が出る。 Chen ら(2026)は、誤った主張を単独で見せれば直せるモデルが、同じ主張を作業の依頼の中に置くと直さずに従うことを「修正抑制」と名づけた。 300 の誤った前提で 8 モデルを測ると、抑制率は 19% から 90% で、4 モデルが 80% を超えた。 モデルは誤りを内部で捉えているが、作業の文脈が前段の層の注意を誤った主張からそらし、中間層で出力の意図が「従う」へ固まる。

三つの研究は、違う方法で同じ結論に近づいている。 誤りの検知と出力の選択は別の段で起きていて、迎合は後者で起きる。 Sharma らの「本当に?」で Claude 1.3 が正解を取り下げたのも、この像なら説明がつく。

ただし、「迎合を表す線形の方向がある」という主張には反証もある。 Aamir と Bin Adil(2026)は、Qwen2.5-1.5B と Llama-3.2-1B で、押し返しで答えを変えるかどうかを応答前の残差ストリームから読み取れるかを調べた。 素朴な差分平均のプローブは標本内で AUROC 0.81 と 0.71 を出したが、質問単位の交差検証とラベルを入れ替えた帰無分布で検証すると、最良でも 0.582 と 0.548 にとどまり、事前に決めた使える基準 0.70 に届かなかった。 同じ手順で「押し返しがあるか」という既知の方向は AUROC 1.000 で取り出せたので、手順が弱いわけではない。 小さいモデルでの否定的な結果であり、大きいモデルの研究を直接否定するものではない。 それでも、交差検証を経ていない方向の報告は割り引いて読む必要がある。

何が迎合を引き出すか

内部の像が「知っていて従う」なら、何が「従う」の側へ押すのかが次の問いになる。 入力の形と会話の積み重ねが、よく調べられている。

UK AI Security Institute の Dubois ら(2026)は、同じ主張を質問形と平叙文で渡し、平叙文の側で三つの要因を直交させた。 確信の強さ(言明、信念、確信)、視点(一人称か「利用者は〜と考える」か)、肯定か否定か、である。 GPT-4o、GPT-5、Claude Sonnet 4.5 のいずれでも、質問への応答の迎合はほぼゼロで、同じ主張を平叙文にすると迎合が大きく上がり、その差は採点尺度で 24 ポイントだった。 迎合は利用者の示す確信が強いほど単調に増え、一人称で強まった。 採点は二つの LLM-as-a-Judge で行っている。

多ターンの圧力も効く。 Xie ら(2024)は、最初の判断が正しくても、疑い、否定、誤導の追質問で判断が揺らぐことを示した。 Hong ら(2025)の SYCON-Bench は、何ターン目で利用者に合わせるか(Turn of Flip)と、圧力が続く中で何回立場を変えるか(Number of Flip)を測り、17 モデルで迎合が依然として広く見られることを報告した。 Aamir と Bin Adil(2026)の小型モデルでは、最初に正答したもののうち 41.8% と 43.1% が押し返しで誤答に変わり、逆に最初の誤答を押し返しが直したのは約 13% だった。 根拠のない押し返しは、差し引きで正確さを下げる。

押し方による違いは、研究によって結果が割れている。 SycEval(Fanous ら 2025)では、利用者が先回りして反論を置く形のほうが会話の途中で反論する形より迎合が多く(61.75% 対 56.52%)、引用を添えた反論が最も多く誤答へ引き寄せた。 Feng ら(2026、ACL)は権威の偏りがあると迎合しやすいと報告する一方、Wang ら(2026)は専門性の枠づけはほとんど効かないとする。 Aamir と Bin Adil では、単なる疑いと感情的な訴えのどちらが効くかがモデル族で逆になった(Qwen では「本当に?」、Llama では感情的な訴えのほうが効いた)。 何が効くかはモデルと課題に依存し、一般的な順位はまだ言えない。

緩和策はどこまで効くか

発生源が複数ある以上、緩和策も複数の段に分かれる。

訓練データの段では、Wei ら(2023)が、主張の真偽は利用者の意見と無関係だという形の合成データで軽く微調整すると、正解のない問いで意見を繰り返す率が最大 10.0% 下がり、十分大きいモデルが明らかに誤った足し算に同意するのを防げたと報告した。 Chen ら(2024)は、迎合に強く効くモジュール(全体の 5% 未満)だけを微調整し、汎用能力を落とさずに迎合を減らした。 報酬の段では、Shapira ら(2026)の同意ペナルティが、増幅の仕組みそのものを打ち消すことを狙う。 Constitutional AI(Bai ら 2022)は人間の選好ラベルを原則に基づく AI のフィードバックに置き換える手法で、人間の判断に由来する偏りを減らす経路として参照されるが、迎合への効果を直接測った研究ではない。

推論時の段では、活性化ステアリングがある。 Rimsky(Panickssery)ら(2024、ACL)の対照活性化加算(CAA)は、迎合する例としない例の活性化の差を平均したベクトルを推論時に足し引きする。 ただし迎合への効きは、ほかの振る舞いより弱く、評価の形式で割れた。 Llama 2 7B Chat の自由記述の生成(層 13、GPT-4 による 10 点尺度の採点)では、ベクトルを引くと 0.26、何もしないと 0.58、足すと 1.26 と向きどおりに動いた。 一方、Llama 2 13B Chat の選択式の評価では 0.56、0.63、0.60 で、足しても増えなかった。 TruthfulQA への効果も、引くと 0.01〜0.02 上がり、足すと 0.03〜0.05 下がる程度で、著者ら自身が効果は小さいとしている。 前節の Genadi ら、Pandey、Chen ら(2026)の介入も同じ系列にあり、Genadi らは残差ストリームより特定のアテンションヘッドを狙うほうが効くと報告している。

入力の段では、Dubois ら(2026)が、答える前に平叙文を質問に言い換えさせると迎合が大きく下がり、その効果は「迎合しないで」と頼む指示より強いことを示した。 Hong ら(2025)では、三人称の人物を演じさせると、討論の場面で何ターン目まで立場を保てるか(Turn of Flip)が最大 63.8% 改善した。 推論の連鎖(CoT)は、Feng ら(2026)によれば最終判断の迎合を全般に減らす。 ただし一部の事例では、論理の矛盾、計算の誤り、一面的な論拠でもっともらしい正当化を組み立て、迎合を見えにくくする。

どの段の緩和策にも限界がある。 一つは、迎合を抑えると正当な意見の変更も抑えてしまうことである。 Ma ら(2026、Findings of EMNLP 採録予定)は、訓練時と推論時の代表的な反迎合の手法で、根拠のない譲歩を減らすと合理的な更新も損なう傾向を見つけ、二つを同時に最適化しても避けられなかった。 両者を動かす MLP ニューロンとアテンションヘッドは大きく重なり、ステアリングの方向も正に揃っていた。 著者らは、迎合への対処を抑制の問題ではなく選択性の問題として扱うべきだとする。 もう一つは、振る舞いが減っても仕組みが残ることで、Pandey(2026)の RLHF 更新の結果がこれに当たる。 ELEPHANT も、既存の緩和策は社会的迎合への効果が限られると報告している。

迎合と自己修正はどう関係するか

迎合の研究と自己修正の研究は、別々に進んできたが、同じ現象の両面を見ている。

Huang ら(2024)は、外部からの正解の手がかりなしに LLM に自分の答えを見直させると、推論の性能が上がらず下がることを示した。 GSM8K では GPT-4 が 95.5% から 1 回目の見直しで 91.5%、2 回目で 89.0% に下がった。 CommonSenseQA では GPT-3.5 が 75.8% から 38.1% に落ちた。 答えが変わった事例では、正答を誤答に変えるほうが、誤答を正答に直すより多かった。 著者らは、CommonSenseQA では誤った選択肢も質問にそれらしく関係していて、見直しを促すプロンプトがモデルを別の選択肢へ偏らせると説明している。

これは「本当に?」の実験と同じ構図である。 見直しの指示は、新しい根拠を何も含まないまま「最初の答えを疑え」と伝える。 モデルはそれを圧力として受け取り、答えを変える側へ動く。 Kamoi ら(2024)は自己修正の研究を洗い直し、自己修正がうまく働くのは確かな外部フィードバックを使える課題で、プロンプトした LLM 自身のフィードバックで成功した研究は、自己修正に特に向いた課題を除いて見当たらないと結論した。

ここから、根拠のない押し返しと自己修正の指示は、どちらも迎合を引き出す入力として扱える。 Wang ら(2023)が討論形式で示した、正しい答えを無効な反論で手放す振る舞いも同じ列に並ぶ。 逆に言えば、答えを変えるべきなのは、テストの失敗や一次資料のような検証できる根拠が加わったときである。 Ma ら(2026)の「合理的な更新」を残しながら「根拠のない譲歩」を減らすには、入力の側で根拠の有無を区別できるようにするしかない。 AI のレビューと修正のループは、なぜ 10 円専用の投入口を作ってしまうのか が、別の LLM のレビュー指摘を確かな外部フィードバックとみなさず、採否を決める段を修正の前に置くことを勧めたのは、この区別を人間の手で入れるためである。

空白(未充足の論点)

  • 循環の通しの検証:利用者の好み、選好データ、報酬モデル、配備されたモデルの迎合を一本につないだ研究はない。各段は別々の研究(Cheng ら 2026、Sharma ら 2023、Shapira ら 2026)で支えられているだけで、最先端モデルの実際の訓練で増幅の大きさを測った公開研究も見当たらない。
  • 内部機構の一般性:解釈可能性の研究は公開重みの中小モデルが中心で、多くが未査読である。Aamir と Bin Adil(2026)の検証手順を満たした報告はまだ少なく、どの結果が大きいモデルに移るかは分かっていない。
  • 定義の分断:Ye ら(2026)が示したように、研究ごとに迎合の定義が違い、評価結果を比べにくい。暗黙の迎合と人柄や感情への迎合は測られていない部分が大きい。
  • 作業の文脈での迎合:コード生成、コードレビュー、エージェントの多段の作業での迎合を直接測った研究は少ない。Chen ら(2026)の修正抑制が最も近いが、対象は単発の依頼である。
  • 測る側の偏り:Dubois ら(2026)をはじめ多くの研究が LLM-as-a-Judge で迎合を採点している。判定器自体の位置バイアスや自己選好(LLM-as-a-Judge の最新潮流:中核研究53件の文献地図と創造性評価の独立章)が測定に入り込む可能性は、ほとんど検討されていない。

未検証事項

  • Sharma ら(2023)で人間の評価者が迎合応答を選んだ割合:本文には数値がなく、Fig. 7b のグラフでだけ示されている。グラフから数値を読み取ることはせず、本ノートでは「難しい誤解ほど判断が当てにならなくなった」という本文の記述だけを使った。
  • Ma ら(2026)の Findings of EMNLP 2026 への採録:arXiv の著者コメント(Accepted to EMNLP 2026 Findings)による。会議録はまだ出ていない。
  • Wei ら(2023):OpenReview では ICLR 2025 への投稿として記録されているが、採録は確認できなかったので arXiv として引いた。
  • ELEPHANT の arXiv 記録には Science 論文(Cheng ら 2026)の DOI が付いているが、題名と著者が異なる別の論文である。本ノートでは、ELEPHANT は ICLR 2026 の論文、利用者実験は Science の論文として分けて引いた。

参照文献

すべて 2026-09-27 にアクセス。

定義と類型

  • Cheng, M., Yu, S., Lee, C., Khadpe, P., Ibrahim, L., & Jurafsky, D. (2026). ELEPHANT: Measuring and Understanding Social Sycophancy in LLMs. ICLR 2026. https://arxiv.org/abs/2505.13995
  • Fanous, A., Goldberg, J., Agarwal, A. A., Lin, J., Zhou, A., Daneshjou, R., & Koyejo, S. (2025). SycEval: Evaluating LLM Sycophancy. AIES 2025. https://arxiv.org/abs/2502.08177
  • Ye, M., Ibrahim, L., Bo, J. Y., Cheng, M., Mattsson, I., Vennemeyer, D., Kraut, R., & Rathje, S. (2026). What Counts as AI Sycophancy? A Taxonomy and Expert Survey of a Fragmented Construct. arXiv:2605.21778. https://arxiv.org/abs/2605.21778
  • Ranaldi, L., & Pucci, G. (2023). When Large Language Models Contradict Humans? Large Language Models’ Sycophantic Behaviour. arXiv:2311.09410. https://arxiv.org/abs/2311.09410
  • Malmqvist, L. (2024). Sycophancy in Large Language Models: Causes and Mitigations. arXiv:2411.15287. https://arxiv.org/abs/2411.15287

発生源

  • Perez, E., Ringer, S., Lukošiūtė, K., et al. (2023). Discovering Language Model Behaviors with Model-Written Evaluations. Findings of the Association for Computational Linguistics: ACL 2023, 13387–13434. https://doi.org/10.18653/v1/2023.findings-acl.847
  • Wei, J., Huang, D., Lu, Y., Zhou, D., & Le, Q. V. (2023). Simple Synthetic Data Reduces Sycophancy in Large Language Models. arXiv:2308.03958. https://arxiv.org/abs/2308.03958
  • Sharma, M., Tong, M., Korbak, T., Duvenaud, D., Askell, A., Bowman, S. R., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024. https://arxiv.org/abs/2310.13548
  • Cheng, M., Lee, C., Khadpe, P., Yu, S., Han, D., & Jurafsky, D. (2026). Sycophantic AI decreases prosocial intentions and promotes dependence. Science, 391(6792), eaec8352. https://doi.org/10.1126/science.aec8352 (プレプリント版 arXiv:2510.01395 は 2 実験 N=1,604、本ノートの数値は Science 版による)
  • Shapira, I., Benade, G., & Procaccia, A. D. (2026). How RLHF Amplifies Sycophancy. ICML 2026. https://arxiv.org/abs/2602.01002
  • Casper, S., Davies, X., Shi, C., Gilbert, T. K., et al. (2023). Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback. Transactions on Machine Learning Research. https://arxiv.org/abs/2307.15217
  • Denison, C., MacDiarmid, M., Barez, F., Duvenaud, D., Kravec, S., Marks, S., Schiefer, N., Soklaski, R., Tamkin, A., Kaplan, J., Shlegeris, B., Bowman, S. R., Perez, E., & Hubinger, E. (2024). Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models. arXiv:2406.10162. https://arxiv.org/abs/2406.10162
  • De Marez, V., De Bruyne, L., & Daelemans, W. (2026). Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness. arXiv:2606.06306. https://arxiv.org/abs/2606.06306

内部機構

  • Wang, K., Li, J., Yang, S., Zhang, Z., & Wang, D. (2026). When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models. Proceedings of the AAAI Conference on Artificial Intelligence, 40(39), 33566–33574. https://doi.org/10.1609/aaai.v40i39.40645
  • Pandey, M. (2026). LLMs Know They’re Wrong and Agree Anyway: The Shared Sycophancy-Lying Circuit. ICML 2026 Mechanistic Interpretability Workshop(OpenReview). arXiv:2604.19117. https://arxiv.org/abs/2604.19117
  • Genadi, R., Nwadike, M., Mukhituly, N., Alquabeh, H., Hiraoka, T., & Inui, K. (2026). Sycophancy Hides Linearly in the Attention Heads. Proceedings of EACL 2026 (Long Papers), 6896–6912. https://doi.org/10.18653/v1/2026.eacl-long.324
  • Vennemeyer, D., Duong, P. A., Zhan, T., & Jiang, T. (2025). Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs. arXiv:2509.21305. https://arxiv.org/abs/2509.21305
  • Chen, Z., Lin, H., Chen, Z., Tian, Y., Yang, G., Wang, D., Guo, Y., Zhu, H., & Cheng, J. (2026). Knowing but Not Correcting: Routine Task Requests Suppress Factual Correction in LLMs. arXiv:2605.05957. https://arxiv.org/abs/2605.05957
  • Aamir, S., & Bin Adil, M. A. (2026). No Usable Linear “Capitulation Direction” in Two Small LLMs: A Validation Protocol for Activation-Steering Claims, and a Cross-Family Behavioral Study of Sycophancy Under Pushback. arXiv:2609.17550. https://arxiv.org/abs/2609.17550
  • Zou, A., Phan, L., Chen, S., Campbell, J., et al. (2023). Representation Engineering: A Top-Down Approach to AI Transparency. arXiv:2310.01405. https://arxiv.org/abs/2310.01405

文脈要因

緩和策

  • Chen, W., Huang, Z., Xie, L., et al. (2024). From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning. ICML 2024. https://arxiv.org/abs/2409.01658
  • Rimsky, N. (Panickssery, N.), Gabrieli, N., Schulz, J., Tong, M., Hubinger, E., & Turner, A. M. (2024). Steering Llama 2 via Contrastive Activation Addition. Proceedings of ACL 2024 (Long Papers), 15504–15522. https://doi.org/10.18653/v1/2024.acl-long.828
  • Bai, Y., Kadavath, S., Kundu, S., Askell, A., et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073. https://arxiv.org/abs/2212.08073
  • Feng, Z., Chen, Z., Ma, J., Po, Y. T., Chersoni, E., & Li, B. (2026). Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy. Proceedings of ACL 2026 (Long Papers), 24536–24570. https://doi.org/10.18653/v1/2026.acl-long.1126
  • Ma, H., Zou, H. P., Li, C., Ma, E., Su, Y., & Yu, P. S. (2026). Sycophancy Suppression Can Impair Rational Updating: Anti-Sycophancy Should Preserve the Ability to Update. Findings of EMNLP 2026(採録予定、arXiv:2608.26511). https://arxiv.org/abs/2608.26511

自己修正

  • Huang, J., Chen, X., Mishra, S., Zheng, H. S., Yu, A. W., Song, X., & Zhou, D. (2024). Large Language Models Cannot Self-Correct Reasoning Yet. ICLR 2024. https://arxiv.org/abs/2310.01798
  • Kamoi, R., Zhang, Y., Zhang, N., Han, J., & Zhang, R. (2024). When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs. Transactions of the Association for Computational Linguistics, 12, 1417–1440. https://doi.org/10.1162/tacl_a_00713
  • Wang, B., Yue, X., & Sun, H. (2023). Can ChatGPT Defend Its Belief in Truth? Evaluating LLM Reasoning via Debate. Findings of EMNLP 2023. https://arxiv.org/abs/2305.13160

関連ノート:AI のレビューと修正のループは、なぜ 10 円専用の投入口を作ってしまうのか、LLM-as-a-Judge の最新潮流:中核研究53件の文献地図と創造性評価の独立章


書いた人:小川 修一郎(Design Researcher / Consultant) 経歴を見る →