Shuichiro Ogawa
English

Notes ・ updated 2026-07-29

LLM-as-a-Judge の発生史:三つの系譜の合流と四つの要請

スコープと方法

本ノートは、LLM-as-a-Judge(LLM を他の生成物の評価者として使う手法)という概念がどのような系譜から生まれ、どのような要請に押し出されて定着したのかを整理した発生史の文献ノートである。 概念成立後の研究潮流(judge の三世代、バイアス研究、創造性評価)は llm-as-a-judge-literature が扱っており、本ノートはその前段に当たる。

コーパスは既存の source/review/llm-as-a-judge/ を拡張した。 今回の拡張は学術文献 38 件(C1〜C38。探索 38、重複 0、除外 0)と、ベンダーとプロジェクトの一次資料 10 件(P1〜P10)で、成立期の中核文献(MT-Bench、G-Eval、Chatbot Arena 等)は既存コーパスの ID(A 系)で参照する。 対象期間は前史のアンカーが 2002 年、主対象が 2016〜2024 年である。 クリエイティブ領域に限定せず、機械翻訳、要約、対話、アラインメントを含む NLG 評価の全域を対象とした。

前史:NLG 評価の二重の危機

LLM-as-a-Judge の前史は、自動評価と人間評価の両方が信頼を失っていく過程として読める。

表層指標への不信

機械翻訳の BLEU(Papineni et al. 2002)と要約の ROUGE(Lin 2004)は、参照テキストとの n-gram 一致で品質を測る自動評価を確立し、20 年にわたり生成システム研究の標準であり続けた。 不信は早くから積み上がっていた。 Callison-Burch et al.(2006)は BLEU の改善が実際の翻訳品質の向上を意味しないことを示し、Liu et al.(2016)は対話応答生成で表層指標が人間判断とほぼ無相関であることを大規模に実証した。 Novikova et al.(2017)はエンドツーエンド NLG での弱相関を指標横断で確認して新指標の必要性を明言し、Reiter(2018)は 284 の相関のメタ分析で BLEU の妥当性を「MT システムの診断まで」と限定した。 Mathur et al.(2020)に至っては、指標を評価するメタ評価のプロトコル自体に欠陥(外れ値による相関の歪み)があると指摘している。 表層指標への不信は、個別の反例から方法論全体の批判へと段階的に深まっていた。

人間評価も逃げ場にならなかった

では人間評価に戻ればよい、という話にはならなかった。 Howcroft et al.(2020)は 20 年分 165 論文のメタ分析で、人間評価に 200 種を超える品質用語が乱立し方法が標準化されていないことを示した。 ReproGen 共有タスク(Belz et al. 2021)は人間評価の再現性そのものを測定対象にし、再現の困難を定量化した。 クラウドソーシングにも問題が出た。 Karpinska et al.(2021)は Mechanical Turk 評価の品質と再現性の問題を実証し、Clark et al.(2021)は非専門家が GPT-3 生成テキストを人間の文章とほぼ区別できないことを示した。 生成モデルの流暢さが評価者の識別力を超え始めたことで、「人間評価は金標準である」という前提自体が揺らいだ。

learned metrics という中間段階

自動評価の側では、指標を学習するという中間段階が挟まる。 BERTScore(Zhang et al. 2020)は文脈埋め込みの類似度で表層一致を置き換え、BLEURT(Sellam et al. 2020)は人間評価データによる微調整で、COMET(Rei et al. 2020)は多言語の品質予測で、それぞれ「人間判断を近似するよう学習された指標」を実用化した。 生成確率そのものをスコアに使う BARTScore(Yuan et al. 2021)と Boolean QA 形式の UniEval(Zhong et al. 2022)が、評価器としての生成モデルへさらに近づく。 GPTScore(Fu et al. 2023)はこの線の到達点で、自然言語の指示だけで評価観点を指定するという、prompted judge の直接の前駆になった。 learned metrics は「評価は学習できる」ことを確立したが、参照テキストと評価用訓練データへの依存が残った。 その依存を捨てる一歩手前まで来ていた。

隣接前駆:訓練ループの中の判定器

評価研究とは別の水脈が、選好学習とアラインメント研究にある。

RLHF と reward model

reward model(人間の選好比較から学習され、モデル出力の良さをスカラーで返す判定器)は、Christiano et al.(2017)が RL エージェントの訓練のために定式化した。 Ziegler et al.(2019)と Stiennon et al.(2020)がこれを言語モデルの生成品質に適用し、InstructGPT(Ouyang et al. 2022)が SFT、reward model、PPO の三段階として実用化した。 この時点で、「モデルの出力を別のモデルが採点する」構造は訓練ループの内部にすでに存在していた。 LLM-as-a-Judge は、この判定器を訓練ループの外に取り出し、評価一般に転用したものと位置づけられる。 両者の連続性は、後に reward model のメタ評価(RewardBench)と judge のメタ評価が同じ枠組みで論じられることにも現れている。

AI フィードバック

reward model の訓練データを人間から AI に置き換える一歩は、Constitutional AI(Bai et al. 2022)が踏んだ。 モデルが原則集(constitution)に基づいて自己出力を批評、修正し、AI の選好ラベルから preference model を訓練する。 Anthropic は原則集自体も公開し(2023-05)、AI の判断基準を外部から検証可能にする方向を示した。 Lee et al.(2023)の RLAIF は、AI フィードバックが人間フィードバックと同等の性能に達しうることを規模比較で実証し、「評価者は AI でよい」という主張に実証的根拠を与えた。

scalable oversight

規範の側の系譜が scalable oversight(AI の能力が人間の評価能力を超えても監督を維持できるか、という問題設定)である。 Amodei et al.(2016)が「スケーラブルな監督」を AI 安全の具体的問題として定式化し、Irving et al.(2018)は AI 同士の討論を人間が審判する構造を、Leike et al.(2018)は再帰的報酬モデリングを提案した。 実証も始まっていた。 Saunders et al.(2022)はモデルの自己批評が人間評価者の欠陥発見を助けることを示し、Bowman et al.(2022)は非専門家が LLM の支援で専門的タスクを評価できるかを実験した。 OpenAI は 2022 年 8 月の研究方針で「RLHF には、人間がタスクを正確に評価できるという前提に根本的な限界がある」と明記し、AI-assisted evaluation を公式の研究課題に据えた。 つまり「AI が AI を評価する」ことは、2023 年の流行に先立ち、アラインメント研究の内部では規範的に要請された研究方向だった。

概念の成立(2023 年)

実践が語に先行した

2023 年前半、評価研究の系譜と選好学習の系譜が、ChatGPT 後の状況で合流する。 学術の側では、GPTScore(arXiv 2302.04166)が指示による評価設計を示し、GEMBA(Kocmi & Federmann 2023)が機械翻訳評価で learned metrics を上回り、Wang et al.(2023)が ChatGPT の NLG 評価者としての適性を 5 データセットで系統測定し、Chiang & Lee(2023)が「LLM は人間評価の代替になりうるか」を表題で問うた。 G-Eval(Liu et al. 2023)は CoT とフォーム記入で人間相関を引き上げた。

並行して、実践が学術より先に走った。 2023 年 3 月 30 日の Vicuna ブログは、80 問への回答を GPT-4 に採点させてモデル品質を主張した、GPT-4 を評価者に使う実践として最初に広く知られた例である。 著者ら自身が「まだ厳密でも成熟してもいない手法」と限界を明記していたにもかかわらず、「ChatGPT の 90%」という数字が独り歩きした(コーパスでは marketing-claim として分離した)。 同じ月、OpenAI は GPT-4 と同時に評価フレームワーク Evals を公開し、モデルが出力を採点する model-graded eval を最初期から組み込んだ。 5 月頃には AlpacaFarm(Dubois et al. 2023)が GPT-4 系 API による選好シミュレーションでクラウドワーカーより 50 倍安い評価を実装し、AlpacaEval がその評価器をリーダーボードとして運用し始めた。 同時期の Chatbot Arena(2023-05-03 告知)は逆に人間投票を基軸に置き、自動 judge の照合先となる人間選好データの収集基盤を整えた。

語の定着

「LLM-as-a-judge」という語を表題に掲げ、概念として定着させたのは Zheng et al.(2023)である。 2023 年 6 月に公開された同論文は、MT-Bench と Chatbot Arena を使って GPT-4 judge が人間選好と 80% 超一致することを示すと同時に、位置バイアス、冗長性バイアス、自己強化バイアスという限界を最初から列挙した。 本コーパスの範囲では、これ以前の文献は同じ実践を「evaluator」「automatic evaluation」等の語で呼んでおり、語の厳密な初出は特定できないが、後続のサーベイ群(Gu et al. 2024 ほか)がパラダイムの確立をこの論文に帰していることは確認できる。 実践(3 月の Vicuna)が語(6 月の MT-Bench 論文)に先行したという順序は、この概念が理論の産物ではなく、評価の必要に迫られた現場の実践を後から命名したものであることを示している。

概念を押し出した四つの要請

概念の成立を、個別文献の連なりではなく要請の側から見ると、四つに整理できる。

  • オープンエンド生成の正解不在:参照ベースの自動指標は参照テキストの存在を前提にするが、指示追従型チャットモデル(InstructGPT 以降)の出力は正解を一つに定められない。表層指標が対話でほぼ無相関だったという実証(Liu et al. 2016)は、この構造的問題の早い現れである。参照なしで品質を判定できる評価者が必要になり、その候補は人間か、人間を近似するモデルしかなかった。
  • ベンチマークの飽和と汚染:Dynabench(Kiela et al. 2021)は静的ベンチマークの急速な飽和と実世界性能との乖離を問題化した。LLM の訓練データ規模が拡大すると、評価データが訓練に混入する汚染が加わる。Sainz et al.(2023)は汚染測定の標準化を要請し、Zhou et al.(2023)は意図的な汚染実験でスコアの歪みを定量化し、Golchin & Surdeanu(2023)は検出ツールを整備した。固定の正解つき評価が信頼を失うほど、動的に生成される出力をその場で判定する方式の相対的価値が上がった。
  • 評価の需給ギャップ:人間評価は高コストなだけでなく、標準化も再現もされていなかった(Howcroft et al. 2020、Belz et al. 2021)。HELM(Liang et al. 2022)の 30 モデル 42 シナリオという規模は、体系的評価に必要な工数が人手の範囲を超えつつあったことを示す。AlpacaFarm の「50 倍安い」は、この需給ギャップを埋める価格提示だった。
  • アラインメント評価の需要:RLHF の実用化は「有用で無害か」という、正解のない次元の評価を定常的に要求する。scalable oversight の系譜はこれを人間の評価能力の限界問題として定式化し、Constitutional AI と RLAIF は AI フィードバックという解を先に実装していた。アラインメント研究の側から見れば、LLM-as-a-Judge は外から借りた道具ではなく、自らの問題設定が要請した装置だった。

制度化

概念の定着後、2023 年後半から 2026 年にかけて制度化が進んだ。

サーベイの側では、LLM 評価全体を体系化した Chang et al.(2024、ACM TIST)が LLM-as-a-Judge を評価手法の一類型として位置づけ、judge 専門のサーベイ 3 本(Gu et al. 2024、Li et al. 2024 From Generation to Judgment、Li et al. 2024 LLMs-as-Judges)が分類体系を整えた。

メタ評価の側では、judge 自体を検証する装置が整備された。 JUDGE-BENCH(Bavaresco et al. 2024)は 20 データセットで人間判断との一致を大規模検証し、RewardBench と JudgeBench が判定器のベンチマークを、Length-Controlled AlpacaEval(Dubois et al. 2024)がバイアスの統計的統制を提供した。

プラットフォームの側では、Chatbot Arena が人間選好の参照基盤として学術化し(Chiang et al. 2024)、AlpacaEval と OpenAI Evals が評価インフラとして運用された。 静的ベンチの Open LLM Leaderboard は「再現可能だが飽和と汚染に弱い」という対比軸を保ち続けた。

標準化の側では、発生から 3 年を待たず公的機関が概念を取り込んだ。 NIST の AI 800-2 初期草案(2026-01)は LLM-as-a-judge を自動ベンチマーク評価の一手法として定義し、UK AISI は評価フレームワーク Inspect に model-graded scorer を実装した。 制度側の現状は llm-as-a-judge-literature の産業節が詳しい。

なぜ 2023 年だったのか

発生史を通すと、概念の成立は三つの流れの合流として説明できる。

  • 評価研究の内部事情:表層指標は 2016〜2020 年に妥当性を失い、人間評価は標準化も再現もできず、learned metrics が「評価は学習できる」ことを確立していた。評価者の席が空いていた。
  • 技術基盤:選好学習が「モデル出力を採点するモデル」を訓練ループ内で日常化し、専門家評価を近似しうる汎用モデル(GPT-4)が 2023 年 3 月に登場した。
  • 規範的要請:scalable oversight の系譜が「AI が AI を評価する」ことを研究方向として先に正当化していた。

この三つが揃っても、引き金は ChatGPT 以降のオープンエンド出力の爆発である。 評価対象(正解のない大量の出力)が供給され、評価器(GPT-4)が供給され、正当化(scalable oversight)が供給されたとき、残っていたのは命名だけだった。 Vicuna の実践(3 月)から MT-Bench 論文の命名(6 月)までの 3 ヶ月が、概念発生の中心にある。

ただし、この合流は前史の問題を解決したのではなく移動させた。 表層指標の妥当性問題は judge のバイアス問題として、人間評価の再現性問題は judge のメタ評価問題として、形を変えて存続している。 成立後の研究がバイアスの定量化とメタ評価ベンチに集中したこと(llm-as-a-judge-literature のクラスタ2)は、この連続性の帰結である。

未検証事項

  • C17(Ziegler 2019)、C23(Irving 2018)、C24(Leike 2018)、C26(Bowman 2022)、C34(Golchin & Surdeanu 2023)、C35(Zhou et al. 2023)の採択 venue(現状 preprint として記録)[要一次検証]
  • AlpacaEval リポジトリの初回公開日(bibtex と Internet Archive から 2023-05 頃と推定)[要一次検証]
  • OpenAI Evals の公開日 2023-03-14(二次報道による。リポジトリに日付明示なし)[要一次検証]
  • OpenAI ブログ 3 件(InstructGPT、Learning to Summarize、Our Approach to Alignment Research)の発表月日と本文(openai.com が 403 で本文未取得)[要一次検証]
  • Open LLM Leaderboard v1 の正確な初公開日 [要一次検証]
  • 「LLM-as-a-judge」という語の arXiv 2306.05685 以前の使用例の有無(本コーパスの範囲では未特定)

参照文献

すべて 2026-07-29 アクセス。

前史(NLG 評価の危機)

  1. Papineni, K., Roukos, S., Ward, T., Zhu, W.-J. (2002). BLEU: a Method for Automatic Evaluation of Machine Translation. ACL 2002. https://doi.org/10.3115/1073083.1073135
  2. Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarization Branches Out (ACL Workshop). https://aclanthology.org/W04-1013/
  3. Callison-Burch, C., Osborne, M., Koehn, P. (2006). Re-evaluating the Role of Bleu in Machine Translation Research. EACL 2006. https://aclanthology.org/E06-1032/
  4. Liu, C.-W. et al. (2016). How NOT To Evaluate Your Dialogue System: An Empirical Study of Unsupervised Evaluation Metrics for Dialogue Response Generation. EMNLP 2016. https://doi.org/10.18653/v1/D16-1230
  5. Novikova, J., Dušek, O., Curry, A. C., Rieser, V. (2017). Why We Need New Evaluation Metrics for NLG. EMNLP 2017. https://doi.org/10.18653/v1/D17-1238
  6. Reiter, E. (2018). A Structured Review of the Validity of BLEU. Computational Linguistics, 44(3). https://doi.org/10.1162/coli_a_00322
  7. Mathur, N., Baldwin, T., Cohn, T. (2020). Tangled up in BLEU: Reevaluating the Evaluation of Automatic Machine Translation Evaluation Metrics. ACL 2020. https://doi.org/10.18653/v1/2020.acl-main.448
  8. Howcroft, D. M. et al. (2020). Twenty Years of Confusion in Human Evaluation: NLG Needs Evaluation Sheets and Standardised Definitions. INLG 2020. https://doi.org/10.18653/v1/2020.inlg-1.23
  9. Karpinska, M., Akoury, N., Iyyer, M. (2021). The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation. EMNLP 2021. https://doi.org/10.18653/v1/2021.emnlp-main.97
  10. Clark, E. et al. (2021). All That’s ‘Human’ Is Not Gold: Evaluating Human Evaluation of Generated Text. ACL 2021. https://doi.org/10.18653/v1/2021.acl-long.565
  11. Belz, A., Shimorina, A., Agarwal, S., Reiter, E. (2021). The ReproGen Shared Task on Reproducibility of Human Evaluations in NLG. INLG 2021. https://doi.org/10.18653/v1/2021.inlg-1.24
  12. Zhang, T., Kishore, V., Wu, F., Weinberger, K. Q., Artzi, Y. (2020). BERTScore: Evaluating Text Generation with BERT. ICLR 2020. https://arxiv.org/abs/1904.09675
  13. Sellam, T., Das, D., Parikh, A. P. (2020). BLEURT: Learning Robust Metrics for Text Generation. ACL 2020. https://doi.org/10.18653/v1/2020.acl-main.704
  14. Rei, R., Stewart, C., Farinha, A. C., Lavie, A. (2020). COMET: A Neural Framework for MT Evaluation. EMNLP 2020. https://doi.org/10.18653/v1/2020.emnlp-main.213
  15. Fu, J., Ng, S.-K., Jiang, Z., Liu, P. (2023). GPTScore: Evaluate as You Desire. arXiv:2302.04166. https://arxiv.org/abs/2302.04166

隣接前駆(選好学習と scalable oversight)

  1. Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. NeurIPS 2017. https://proceedings.neurips.cc/paper_files/paper/2017/hash/d5e2c0adad503c91f91df240d0cd4e49-Abstract.html
  2. Ziegler, D. M. et al. (2019). Fine-Tuning Language Models from Human Preferences. arXiv:1909.08593. https://arxiv.org/abs/1909.08593
  3. Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. NeurIPS 2020. https://arxiv.org/abs/2009.01325
  4. Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. NeurIPS 2022. https://arxiv.org/abs/2203.02155
  5. Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073. https://arxiv.org/abs/2212.08073
  6. Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. ICML 2024. https://arxiv.org/abs/2309.00267
  7. Amodei, D. et al. (2016). Concrete Problems in AI Safety. arXiv:1606.06565. https://arxiv.org/abs/1606.06565
  8. Irving, G., Christiano, P., Amodei, D. (2018). AI Safety via Debate. arXiv:1805.00899. https://arxiv.org/abs/1805.00899
  9. Leike, J. et al. (2018). Scalable Agent Alignment via Reward Modeling: A Research Direction. arXiv:1811.07871. https://arxiv.org/abs/1811.07871
  10. Saunders, W. et al. (2022). Self-Critiquing Models for Assisting Human Evaluators. arXiv:2206.05802. https://arxiv.org/abs/2206.05802
  11. Bowman, S. R. et al. (2022). Measuring Progress on Scalable Oversight for Large Language Models. arXiv:2211.03540. https://arxiv.org/abs/2211.03540

概念の成立(2023 年前後)

  1. Chiang, C.-H., Lee, H.-y. (2023). Can Large Language Models Be an Alternative to Human Evaluations? ACL 2023. https://doi.org/10.18653/v1/2023.acl-long.870
  2. Wang, J. et al. (2023). Is ChatGPT a Good NLG Evaluator? A Preliminary Study. NewSum Workshop @ EMNLP 2023. https://doi.org/10.18653/v1/2023.newsum-1.1
  3. Kocmi, T., Federmann, C. (2023). Large Language Models Are State-of-the-Art Evaluators of Translation Quality (GEMBA). EAMT 2023. https://aclanthology.org/2023.eamt-1.19/
  4. Dubois, Y. et al. (2023). AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback. NeurIPS 2023. https://arxiv.org/abs/2305.14387
  5. tatsu-lab (2023). AlpacaEval: An Automatic Evaluator of Instruction-Following Language Models. GitHub. https://github.com/tatsu-lab/alpaca_eval
  6. Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks. https://arxiv.org/abs/2306.05685
  7. Liu, Y. et al. (2023). G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment. EMNLP 2023. https://aclanthology.org/2023.emnlp-main.153/

概念を押し出した要請

  1. Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. NAACL 2021. https://doi.org/10.18653/v1/2021.naacl-main.324
  2. Sainz, O. et al. (2023). NLP Evaluation in Trouble: On the Need to Measure LLM Data Contamination for Each Benchmark. Findings of EMNLP 2023. https://doi.org/10.18653/v1/2023.findings-emnlp.722
  3. Golchin, S., Surdeanu, M. (2023). Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models. arXiv:2311.06233. https://arxiv.org/abs/2311.06233
  4. Zhou, K. et al. (2023). Don’t Make Your LLM an Evaluation Benchmark Cheater. arXiv:2311.01964. https://arxiv.org/abs/2311.01964
  5. Liang, P. et al. (2023). Holistic Evaluation of Language Models (HELM). TMLR. https://arxiv.org/abs/2211.09110

制度化

  1. Chang, Y. et al. (2024). A Survey on Evaluation of Large Language Models. ACM Transactions on Intelligent Systems and Technology, 15(3). https://doi.org/10.1145/3641289
  2. Bavaresco, A. et al. (2024). LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks. ACL 2025. https://arxiv.org/abs/2406.18403

一次資料(ベンダーとプロジェクト)

  1. LMSYS Org (2023-03-30). Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90%* ChatGPT Quality. https://lmsys.org/blog/2023-03-30-vicuna/
  2. LMSYS Org (2023-05-03). Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings. https://lmsys.org/blog/2023-05-03-arena/
  3. OpenAI (2023). OpenAI Evals (GitHub). https://github.com/openai/evals
  4. OpenAI (2022). Aligning Language Models to Follow Instructions (InstructGPT). https://openai.com/index/instruction-following/
  5. OpenAI (2020). Learning to Summarize with Human Feedback. https://openai.com/index/learning-to-summarize-with-human-feedback/
  6. Anthropic (2022-12-15). Constitutional AI: Harmlessness from AI Feedback. https://www.anthropic.com/research/constitutional-ai-harmlessness-from-ai-feedback
  7. Anthropic (2023-05-09). Claude’s Constitution. https://www.anthropic.com/news/claudes-constitution
  8. OpenAI (2022). Our Approach to Alignment Research. https://openai.com/index/our-approach-to-alignment-research/
  9. Hugging Face (2023–2024). Open LLM Leaderboard v1 (archive). https://huggingface.co/docs/leaderboards/en/open_llm_leaderboard/archive

既存コーパスからの参照(詳細は llm-as-a-judge-literature

  1. Yuan, W., Neubig, G., Liu, P. (2021). BARTScore: Evaluating Generated Text as Text Generation. NeurIPS 2021. https://proceedings.neurips.cc/paper/2021/hash/e4d2b6e6fdeca3e60e0f1a62fee3d9dd-Abstract.html
  2. Zhong, M. et al. (2022). Towards a Unified Multi-Dimensional Evaluator for Text Generation (UniEval). EMNLP 2022. https://aclanthology.org/2022.emnlp-main.131/
  3. Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. ICML 2024. https://arxiv.org/abs/2403.04132
  4. Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. COLM 2024. https://arxiv.org/abs/2404.04475
  5. Lambert, N. et al. (2024). RewardBench: Evaluating Reward Models for Language Modeling. Findings of NAACL 2025. https://arxiv.org/abs/2403.13787
  6. Tan, S. et al. (2024). JudgeBench: A Benchmark for Evaluating LLM-based Judges. ICLR 2025. https://arxiv.org/abs/2410.12784
  7. Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594. https://arxiv.org/abs/2411.15594
  8. Li, D. et al. (2024). From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge. EMNLP 2025. https://arxiv.org/abs/2411.16594
  9. Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579. https://arxiv.org/abs/2412.05579
  10. NIST (2026). AI 800-2 (Initial Public Draft): Practices for Automated Benchmark Evaluations of Language Models. https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.800-2.ipd.pdf
  11. UK AI Security Institute. Inspect. https://inspect.aisi.org.uk/

← Notes 一覧ホーム