Shuichiro Ogawa
English

Notes ・ updated 2026-07-29

LLM-as-a-Judge の最新潮流:中核研究53件の文献地図と創造性評価の独立章

スコープと方法

本ノートは、LLM-as-a-Judge(LLM を他の生成物の評価者として使う手法)の研究状況を、学術と産業の2系統のコーパスから整理した文献地図である。

  • 学術(主軸、mode: academic):探索 58 件から重複統合 5 件を経た 53 件。コーパスは source/review/llm-as-a-judge/papers.md
  • 産業(補完、mode: ai-frontier):ベンダー一次資料 T1v 18 件、公的機関 T2 9 件、実務家私見 T3 12 件。コーパスは source/review/llm-as-a-judge/ai-frontier.md。ユーザー指定により「ベンダー一次資料と評価ツール実務」に範囲を限定し、analyst 系統(調査会社レポート)は収集していない。

対象期間は学術が 2023-01〜2026-07(2021–2022 の先行アンカーを少数含む)、産業が 2024-07〜2026-07 である。 依頼に基づき、「クリエイティブ(創造的成果物)の評価に LLM-as-a-Judge を使う研究」を独立した章として立てた。 概念の成立以前、つまり LLM-as-a-Judge がどのような系譜と要請から生まれたのかは llm-as-a-judge-history が扱う。

学術クラスタ1:judge の三世代(prompted → fine-tuned → reasoning)

LLM-as-a-Judge の系譜は三つの世代に分けて読める。

第一世代はプロンプトで汎用 LLM を評価者にする prompted judge である。 前史として、生成確率でテキストを評価する BARTScore(Yuan et al. 2021)と Boolean QA 形式の UniEval(Zhong et al. 2022)がモデルベース評価の下地を作った。 パラダイムを確立したのは Zheng et al.(2023)の MT-Bench と Chatbot Arena で、GPT-4 judge が人間評価と 80% 超一致することを示すと同時に、位置バイアス、冗長性バイアス、自己強化バイアスという後続研究の主題を先に列挙した。 G-Eval(Liu et al. 2023)は CoT とフォーム記入で人間相関を引き上げ、同時に LLM 生成テキストへの偏向を指摘した。

第二世代は評価専用に微調整した fine-tuned judge である。 PandaLM(7B)、Prometheus(13B、ルーブリック評価)、Auto-J(58 シナリオ)、JudgeLM(swap augmentation によるバイアス低減)、Prometheus 2(直接評価と pairwise の両対応)が代表で、GPT-4 依存を脱したオープンな評価器を目指した。 ただし Huang et al.(2024)は、fine-tuned judge が in-domain では強い一方、タスク特化型分類器として振る舞い GPT-4 の汎用代替にならないことを実証しており、この世代の射程には既知の限界がある。

第三世代は推論を強化した reasoning judge と評価対象の拡張である。 JudgeLRM(Chen et al. 2025)と J1(Whitehouse et al. 2025)は検証可能報酬の RL で judge の推論を訓練し、SFT 単独の限界を主張する。 MCTS-Judge(Wang et al. 2025)は評価時計算のスケーリング(test-time scaling)をコード評価に持ち込んだ。 評価対象の側でも、エージェントの中間プロセスを評価する Agent-as-a-Judge(Zhuge et al. 2024)と、視覚言語タスクへ広げる MLLM-as-a-Judge(Chen et al. 2024)が並行して現れた。

学術クラスタ2:信頼性、バイアス、メタ評価

バイアス研究は、確立論文が列挙した懸念を個別に定量化してきた。

  • 位置バイアス:Wang et al.(ACL 2024)が回答順序の入れ替えだけで判定が逆転しうることを示し、Shi et al.(2024)が 15 モデル × 約 15 万件で系統測定した。
  • 長さバイアス:Dubois et al.(2024)が回帰による Length-Controlled AlpacaEval で統計的に統制した。
  • 自己選好バイアス:Panickssery et al.(2024)が judge の自己認識能力とバイアス強度の線形相関を示し、Wataoka et al.(2024)が perplexity ベースの親近性という機構仮説を与えた。
  • 総覧:CALM(Ye et al. 2024)が 12 種のバイアスを自動定量化し、3 本のサーベイ(Gu et al. 2024、Li et al. 2024 From Generation to Judgment、Li et al. 2024 LLMs-as-Judges)が信頼性、分類、方法論の観点から整理した。

judge 自体を測るメタ評価ベンチも整った。 JudgeBench(Tan et al. 2024)は客観的正解付きの難問ペアで、GPT-4o 級の judge でも成績がほぼランダムに落ちることを示した。 RewardBench(Lambert et al. 2024)は報酬モデル評価の基盤として、judge と報酬モデルのメタ評価を接続した。 人間選好の照合先としては Chatbot Arena(Chiang et al. 2024)が事実上の標準だが、その信頼性への異論は産業側の T3(後述の Karpathy の evaluation crisis 論)から出ている。

独立章:創造的成果物の評価に LLM-as-a-Judge を使う研究

創造的成果物の評価は、正解のある推論タスクとは異なる困難(評価次元の主観性、専門家間の不一致、独創性の測定)を持つ。 この章では 28 件(B 系固有)を4領域に分けて整理する。

テキスト創作(物語、創作文、ユーモア)

Gómez-Rodríguez & Williams(2023)は詳細ルーブリックの人間評価で、商用 LLM が創作文の大半の次元で人間と同等以上である一方、独創性では人間が優位と示した。 Ismayilzada et al.(2024)は短編創作で LLM の自己評価と専門家評価の乖離を確認しており、創作分野では「生成が強くても評価が信頼できる」とは言えない。 評価基盤の側では、LitBench(Fein et al. 2025)が創作評価初の標準ベンチとして、既製 judge の人間一致 73%(Claude)に対し訓練済み報酬モデルで 78% を報告した。 TTCW を参照に使う参照型評価(Li et al. 2025)、個人の判断基準に適応する personalized judge(Kumar et al. 2025)、少量の人間選好データの微調整で専門家級のユーモアランキング(82.4%)に到達した Zhou et al.(2025)が、創作評価の改善アプローチを示す。

創造性テストの自動採点(心理測定系)

心理学の創造性測定では、LLM 採点が意味距離ベースの旧手法を大きく上回る。 Organisciak et al.(2023)は AUT(代替用途課題)採点で人間評定と r=.81(意味距離は r=.12–.26)、DiStefano et al.(2025)はメタファー創造性で r=.72 を報告した。 MuseScorer(Bangash et al. 2025)は人間アノテーションなしの頻度ベース独創性採点で参加者レベル相関 r=.89 に達した。 Rabeyah et al.(2024)は複数 LLM の創造性評価が相互に一致し(Spearman > 0.7)、自己生成物の優遇が見られなかったと報告しており、自己選好バイアスの一般論(Panickssery et al.)とは結果が割れている。

視覚的成果物(画像生成、美的評価、視覚創造性)

MLLM を judge に使う系統は、一致の質がタスク形式に依存することを繰り返し確認している。 MLLM-as-a-Judge(Chen et al. 2024)は pairwise では人間に近いが、スコアリングとランキングで乖離が残ると示した。 VIEScore(Ku et al. 2023)は条件付き画像生成で GPT-4o 版の人間相関 0.4(人間間 0.45)を報告し、オープン MLLM との差も示した。 MJ-Bench(Chen et al. 2024)はテキスト画像生成の judge を整合、安全、品質、バイアスの4次元で検査するデータセットを整えた。 美的評価では Jiang & Chen(2025)が証拠なしの解釈を並べる美的推論ハルシネーションを特定し、証拠ベース推論(ArtCoT)で抑制した。 視覚創造性のゼロショット採点(Orwig & Beaty 2026)は人間評価と r=.29–.68 で、推論の可視化が解釈性を与えても精度を上げないことを報告した。

デザインと教育評価(UI 批評、デザイン創造性、採点)

デザイン領域は HCI 系と工学デザイン系の2本立てで進んでいる。 HCI 系では、GPT-4 による UI モックアップへの自動フィードバック(Duan et al., CHI 2024)を起点に、デザイナー批評 3,059 件のデータセット UICrit(UIST 2024)が few-shot で LLM フィードバックを 55% 改善し、それでも専門家品質には未到達と明記した。 反復ビジュアルプロンプト(Duan et al. 2024)は専門家との差を一部指標で約 50% 縮めた。 工学デザイン系では、Zhang, Han & Ahmed-Kristensen(ICED25 ほか)がデザインコンセプトの新規性と有用性を構造化評価とマルチエージェント CoT で採点し、専門家一致の改善を報告した。 教育評価では、デザイン課題採点(Huang et al. 2024、人間との信頼性 0.65–0.78)とエッセイ採点(Kim 2025 のプロンプト戦略比較、Li & Liu 2024 の 18 モデル比較)が、ルーブリック詳細化と反復調整を前提に「教育者が受け入れうる水準」に達しつつある。

章の帰結:どこまで信頼できるか

4領域を通すと、収束している知見は次の三つである。

  1. 定型化できる次元は人間相関が高い。ルーブリックが明確な次元(流暢さ、整合性、AUT 独創性の頻度的側面)では r=.7 以上が繰り返し出ている。
  2. 少量の人間データによる整合が効く。ユーモア(82.4%)、UICrit few-shot(+55%)、LitBench 報酬モデル(78%)のいずれも、ゼロショット judge より人間データで整合した judge が上回る。
  3. 独創性と専門家品質は未到達のままである。創作文の独創性次元(B1)、専門家デザイン批評の品質(B23)、novelty の判定(B17)では、LLM judge と人間専門家の乖離が残る。

一方、自己選好バイアスが創造性評価でどこまで効くかは、一般タスクの実証(Panickssery et al.)と AUT での不検出報告(Rabeyah et al.)が割れており、未決である。

空白(未充足の論点)

  • 創造性評価の妥当性理論との接続。教育測定や心理測定の妥当性枠組み(構成概念妥当性)から LLM judge を検討した研究は、本コーパスでは確認できなかった。
  • UI 以外の視覚デザイン批評。グラフィック、プロダクト、ブランドデザインへの judge 適用は、UI 批評(Duan et al. の系列)に比べて希薄である。
  • AI 生成物への選好バイアスの創造性文脈での検証。自己選好の機構研究(perplexity 親近性)を創造的成果物で追試した研究は未確認。
  • 非英語の創造性評価。日本語 AES(Li & Liu 2024)を除き、非英語の創造的成果物を対象にした judge 研究はコーパス内にほぼない。
  • reasoning judge の創造性評価への適用。RL 訓練 judge(J1、JudgeLRM)と test-time scaling(MCTS-Judge)は正解のあるタスクで検証されており、主観的品質への転用結果は未確認。

産業実装の現在地(ai-frontier 補完)

以下は mode: ai-frontier のコーパス(source/review/llm-as-a-judge/ai-frontier.md)に基づく補完で、学術と混同しないよう T1v / T2 / T3 のティアで分ける。

T1v:ベンダー一次資料が示す製品化の二型

製品化は二つの型に分かれる。

  • 汎用モデル judge のマネージドサービス:OpenAI(Evals platform の score model grader。ただし 2026-10-31 に read-only 化、2026-11-30 シャットダウン予定)、Google Vertex AI(Gen AI Evaluation Service、pointwise/pairwise、レスポンス反転によるバイアス低減)、AWS Bedrock(Model Evaluation GA 2025-03、エージェント向け AgentCore Evaluations GA 2026-03)、Azure AI Foundry(重み付きルーブリック evaluator)、LangSmith(offline/online 評価)。
  • 専業 fine-tuned judge の提供:Atla(Selene / Selene Mini 8B)、Patronus AI(GLIDER 3.8B、RAG 特化の Lynx)。学術第二世代(Prometheus 系)の製品版に相当する。

公式文書の注意書きは学術のバイアス知見と収束している。 OpenAI は position bias と verbosity bias を明記して pairwise か pass/fail を推奨し、Anthropic は「人間専門家との乖離が少ないと確認するまで信頼しない」というキャリブレーション前提と generator/evaluator の分離を明記する。 Azure は短文(約 20 トークン未満)での信頼性低下と英語限定を、Ragas は judge の非決定性と false positive 優勢の失敗パターンを、Hugging Face は echo-chamber 効果(LLM で LLM を評価する循環性)を公式に記載する。 自社優位の断定(ベンチマーク優位や工数削減の主張)5 件は marketing-claim としてコーパス側で分離した。

T2:公的機関は「条件付き利用」で一致

公的機関の位置づけは、推奨でも禁止でもなく条件付き利用である。

  • NIST(AI 800-2 初期草案、2026-01)は LLM-as-a-judge を自動ベンチマーク評価の一手法として定義しつつ、egocentric bias と length bias への懸念を記載する。
  • UK AISI は最も蓄積が厚い。評価フレームワーク Inspect に model-graded scorer を実装する一方、自律システム評価標準(2024-10)では「known accuracy and bias issues」を理由に数値評定への使用を非推奨とし、autograder と人間の一致(Cohen’s Kappa 0.52、人間間 0.8)の公開、Bayesian GLM による judge 信頼性の統計評価フレームワーク(2025-07)まで進めた。
  • J-AISI(評価観点ガイド 1.10 版、2025-03)はモデルベース評価を評価手法の一つとしつつ、ツールのみでの全自動評価は困難と注意喚起する。
  • Stanford HAI AI Index 2026 はベンチマーク全般の信頼性低下(エラー率最大 42% の外部分析の引用)を指摘するが、LLM-as-a-Judge への直接言及はない。

T3:実務家私見の収束点

権威確認済みの実務家(Hamel Husain、Eugene Yan、Simon Willison、Shreya Shankar、Clémentine Fourrier、Andrej Karpathy)の見解は、私見として扱った上で次の点に収束している。

  • 二値判定の推奨。1〜5 の Likert より Pass/Fail が一貫し、専門家の批評(critique)を judge の few-shot に再利用する(Husain の Critique Shadowing)。
  • criteria drift。評価基準は出力を見る前に確定できず、逐次更新される(Husain / Shankar)。
  • evaluator の評価。人間判断との突合なしに judge を信頼しない(Fourrier、Yan の「人間同士の相関に相当すべき」基準)。
  • evals への悲観と擁護の両論。Karpathy は Chatbot Arena のオーバーフィットを含む evaluation crisis を指摘し、Shankar は anti-eval 感情への反論を展開する。
  • 創造的成果物の評価についての直接の実務知見は薄く、Yan の「主観的タスクには pairwise を推奨」が最も近い言及である。

直近の主要アップデート(時系列)

時期出来事ティア
2024-05UK AISI が Inspect を公開T2
2024-10AISI が数値評定へのモデルグレーディング非推奨を勧告T2
2024-12AWS Bedrock LLM-as-a-Judge preview、Patronus GLIDER 発表T1v
2025-03Bedrock Model Evaluation GA、J-AISI ガイド 1.10 版T1v/T2
2025-07AISI が Bayesian GLM の judge 信頼性フレームワークを公開T2
2026-01NIST AI 800-2 初期草案(LLM-as-a-judge を定義)T2
2026-03AWS AgentCore Evaluations GAT1v
2026-06OpenAI が Evals platform の deprecation を発表(2026-11 シャットダウン予定)T1v

信頼度の読み方

T1v は「何ができるか、制約、価格」の一次権威だが、自社優位の主張は分離済みの marketing-claim を参照する。 T2 は中立だが、草案(NIST 800-2)と確定文書を区別する。 T3 は私見であり、数値(工数配分 60〜80% 等)は [要一次検証] のまま扱う。

学術と産業の突合

学術のバイアス実証(位置、長さ、自己選好)は、2024〜2026 年のあいだにベンダー公式文書(OpenAI、Anthropic、Ragas)と公的ガイダンス(NIST、AISI)の注意書きへほぼそのまま流れ込んだ。 この流れの帰結として、実務の共通前提は「judge は人間評価で校正して初めて使える計測器」になっている。 一方、本ノートの独立章で見た創造性評価の研究蓄積(専門家一致、独創性の乖離、少量整合の有効性)は、産業側ではまだ汎用ルーブリック evaluator の一機能に吸収されており、創造的成果物専用の judge 製品は確認できていない。 デザイン教育やクリエイティブ制作の評価に judge を導入する場合、参照すべき知見は産業ドキュメントではなく本章の学術系列(UICrit、ICED25 系、AES 系)にある。

未検証事項

学術コーパス由来:

  • A25(Self-Preference Bias)の著者所属機関 [要一次検証]
  • B10(MJ-Bench)の NeurIPS 2025 採択 [要一次検証]
  • B22(CHI 2024 UI フィードバック)の本文(ACM DL 403。書誌は複数経路で確認済み) [要一次検証]
  • B29(HCII 2025 マルチエージェント)の本文(Springer 認証ウォール) [要一次検証]
  • A7(Auto-J)と A24(JudgeLRM)の最終 venue(現状 preprint 扱い)

産業コーパス由来:

  • OpenAI 評価ガイドのドキュメント更新日、Anthropic demystifying-evals の公開日 [要一次検証]
  • Vertex AI のデフォルト judge(Gemini 2.0 Flash)の公式ページ本文での直接確認 [要一次検証]
  • Atla Selene Mini のリリース日と価格($3/1,000 calls)の一次ページ確認、Patronus の価格 [要一次検証]
  • AWS AgentCore Evaluations の judge モデルリストと価格 [要一次検証]
  • LangSmith と Arize Phoenix の judge モデルリスト [要一次検証]
  • NIST AI 800-2 最終版の公開有無、NIST AI 600-1 本文での言及有無、J-AISI ガイド本文の該当節詳細 [要一次検証]
  • Stanford HAI AI Index 2026 の公表月と章全体での言及有無 [要一次検証]
  • Karpathy の X 投稿 2 件の直接確認(発話日含む)、実務家の引用数値(工数 60〜80%、hallucination recall 30〜60%、Tesla 時代の工数 1/3) [要一次検証]

参照文献

すべて 2026-07-29 アクセス。

学術(中核研究)

  1. Yuan, W., Neubig, G., Liu, P. (2021). BARTScore: Evaluating Generated Text as Text Generation. NeurIPS 2021. https://proceedings.neurips.cc/paper/2021/hash/e4d2b6e6fdeca3e60e0f1a62fee3d9dd-Abstract.html
  2. Zhong, M. et al. (2022). Towards a Unified Multi-Dimensional Evaluator for Text Generation. EMNLP 2022. https://aclanthology.org/2022.emnlp-main.131/
  3. Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks. https://arxiv.org/abs/2306.05685
  4. Liu, Y. et al. (2023). G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment. EMNLP 2023. https://aclanthology.org/2023.emnlp-main.153/
  5. Wang, Y. et al. (2023). PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization. ICLR 2024. https://arxiv.org/abs/2306.05087
  6. Kim, S. et al. (2023). Prometheus: Inducing Fine-grained Evaluation Capability in Language Models. ICLR 2024. https://arxiv.org/abs/2310.08491
  7. Li, J. et al. (2023). Generative Judge for Evaluating Alignment (Auto-J). arXiv:2310.05470. https://arxiv.org/abs/2310.05470
  8. Zhu, L., Wang, X., Wang, X. (2023). JudgeLM: Fine-tuned Large Language Models are Scalable Judges. ICLR 2025. https://arxiv.org/abs/2310.17631
  9. Wang, P. et al. (2023). Large Language Models are not Fair Evaluators. ACL 2024. https://aclanthology.org/2024.acl-long.511/
  10. Kim, S. et al. (2024). Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models. EMNLP 2024. https://arxiv.org/abs/2405.01535
  11. Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. ICML 2024. https://arxiv.org/abs/2403.04132
  12. Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. COLM 2024. https://arxiv.org/abs/2404.04475
  13. Panickssery, A., Bowman, S. R., Feng, S. (2024). LLM Evaluators Recognize and Favor Their Own Generations. NeurIPS 2024. https://arxiv.org/abs/2404.13076
  14. Lambert, N. et al. (2024). RewardBench: Evaluating Reward Models for Language Modeling. Findings of NAACL 2025. https://arxiv.org/abs/2403.13787
  15. Tan, S. et al. (2024). JudgeBench: A Benchmark for Evaluating LLM-based Judges. ICLR 2025. https://arxiv.org/abs/2410.12784
  16. Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594. https://arxiv.org/abs/2411.15594
  17. Li, D. et al. (2024). From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge. EMNLP 2025. https://arxiv.org/abs/2411.16594
  18. Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579. https://arxiv.org/abs/2412.05579
  19. Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge: Fine-tuned Judge Model is not a General Substitute for GPT-4. Findings of ACL 2025. https://arxiv.org/abs/2403.02839
  20. Wang, Y. et al. (2025). MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation. arXiv:2502.12468. https://arxiv.org/abs/2502.12468
  21. Chen, D. et al. (2024). MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark. ICML 2024. https://arxiv.org/abs/2402.04788
  22. Zhuge, M. et al. (2024). Agent-as-a-Judge: Evaluate Agents with Agents. arXiv:2410.10934. https://arxiv.org/abs/2410.10934
  23. Whitehouse, C. et al. (2025). J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning. arXiv:2505.10320. https://arxiv.org/abs/2505.10320
  24. Chen, N. et al. (2025). JudgeLRM: Large Reasoning Models as a Judge. arXiv:2504.00050. https://arxiv.org/abs/2504.00050
  25. Wataoka, K., Takahashi, T., Ri, R. (2024). Self-Preference Bias in LLM-as-a-Judge. arXiv:2410.21819. https://arxiv.org/abs/2410.21819
  26. Shi, L. et al. (2024). Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge. AACL-IJCNLP 2025. https://arxiv.org/abs/2406.07791
  27. Ye, J. et al. (2024). Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge. arXiv:2410.02736. https://arxiv.org/abs/2410.02736

学術(創造的成果物の評価)

  1. Gómez-Rodríguez, C., Williams, P. (2023). A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing. Findings of EMNLP 2023. https://doi.org/10.18653/v1/2023.findings-emnlp.966
  2. Organisciak, P. et al. (2023). Beyond Semantic Distance: Automated Scoring of Divergent Thinking Greatly Improves with Large Language Models. Thinking Skills and Creativity, 49. https://doi.org/10.1016/j.tsc.2023.101356
  3. Chen, Z. et al. (2024). MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation? arXiv:2407.04842. https://arxiv.org/abs/2407.04842
  4. Ku, M. et al. (2023). VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation. ACL 2024. https://arxiv.org/abs/2312.14867
  5. Zhang, X. et al. (2023). GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks. arXiv:2311.01361. https://arxiv.org/abs/2311.01361
  6. Jiang, R., Chen, C. (2025). Multimodal LLMs Can Reason about Aesthetics in Zero-Shot. ACM MM 2025. https://arxiv.org/abs/2501.09012
  7. Orwig, W., Beaty, R. E. (2026). How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning. arXiv:2606.29672. https://arxiv.org/abs/2606.29672
  8. Fang, X. et al. (2025). Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLMs. ICCV 2025. https://arxiv.org/abs/2503.14478
  9. DiStefano, P. V., Patterson, J. D., Beaty, R. E. (2025). Automatic Scoring of Metaphor Creativity with Large Language Models. Creativity Research Journal, 37(4). https://doi.org/10.1080/10400419.2024.2326343
  10. Ismayilzada, M., Stevenson, C., van der Plas, L. (2024). Evaluating Creative Short Story Generation in Humans and Large Language Models. ICCC 2025. https://arxiv.org/abs/2411.02316
  11. Kumar, H. et al. (2024). Human Creativity in the Age of LLMs: Randomized Experiments on Divergent and Convergent Thinking. CHI 2025. https://arxiv.org/abs/2410.03703
  12. Rabeyah, A. A. et al. (2024). Do LLMs Agree on the Creativity Evaluation of Alternative Uses? arXiv:2411.15560. https://arxiv.org/abs/2411.15560
  13. Li, R. et al. (2025). Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach. arXiv:2504.15784. https://arxiv.org/abs/2504.15784
  14. Franceschelli, G., Musolesi, M. (2024). Creative Beam Search: LLM-as-a-Judge For Improving Response Generation. ICCC 2024. https://arxiv.org/abs/2405.00099
  15. Duan, P. et al. (2024). Generating Automatic Feedback on UI Mockups with Large Language Models. CHI 2024. https://dl.acm.org/doi/10.1145/3613904.3642782
  16. Duan, P. et al. (2024). UICrit: Enhancing Automated Design Evaluation with a UI Critique Dataset. UIST 2024. https://arxiv.org/abs/2407.08850
  17. Duan, P. et al. (2024). Visual Prompting with Iterative Refinement for Design Critique Generation. arXiv:2412.16829. https://arxiv.org/abs/2412.16829
  18. Huang, Q., Willems, T., Poon, K. W. (2024). The Application of GPT-4 in Grading Design University Students’ Assignment and Providing Feedback. arXiv:2409.17698. https://arxiv.org/abs/2409.17698
  19. Li, W., Liu, H. (2024). Applying Large Language Models for Automated Essay Scoring for Non-Native Japanese. Humanities and Social Sciences Communications, 11. https://doi.org/10.1057/s41599-024-03209-9
  20. Kim, Y. (2025). Automated Essay Scoring With GPT-4 for a Local Placement Test. TESOL Quarterly, 59(S1). https://doi.org/10.1002/tesq.3405
  21. Zhou, K. L. et al. (2025). Bridging the Creativity Understanding Gap: Small-Scale Human Alignment Enables Expert-Level Humor Ranking in LLMs. arXiv:2502.20356. https://arxiv.org/abs/2502.20356
  22. Zhang, J., Han, J., Ahmed-Kristensen, S. (2025). Multi-agent LLM with the Chain-of-Thought for Design Creativity Evaluation. HCI International 2025, LNCS 16332. https://doi.org/10.1007/978-3-032-12385-5_21
  23. Zhang, J., Han, J., Ahmed-Kristensen, S. (2025). Exploring the Use of LLMs to Evaluate Design Creativity. Proceedings of the Design Society, 5 (ICED25). https://doi.org/10.1017/pds.2025.10191
  24. Fein, D. et al. (2025). LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing. arXiv:2507.00769. https://arxiv.org/abs/2507.00769
  25. Bangash, A. S. et al. (2025). MuseScorer: Idea Originality Scoring At Scale. EMNLP 2025. https://arxiv.org/abs/2505.16232
  26. Kumar, B. V. et al. (2025). Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment. arXiv:2510.05135. https://arxiv.org/abs/2510.05135

産業 T1v(ベンダー一次資料)

  1. OpenAI. Graders. https://developers.openai.com/api/docs/guides/graders
  2. OpenAI. Evaluation best practices. https://developers.openai.com/api/docs/guides/evaluation-best-practices
  3. OpenAI. Deprecations. https://developers.openai.com/api/docs/deprecations
  4. Anthropic. Define success criteria and build evaluations. https://platform.claude.com/docs/en/test-and-evaluate/develop-tests
  5. Anthropic. Demystifying evals for AI agents. https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
  6. Google Cloud. Configure a judge model (Vertex AI). https://cloud.google.com/vertex-ai/generative-ai/docs/models/configure-judge-model
  7. AWS. Evaluate model performance using another LLM as a judge (Amazon Bedrock). https://docs.aws.amazon.com/bedrock/latest/userguide/evaluation-judge.html
  8. AWS. Amazon Bedrock Model Evaluation LLM-as-a-judge is now generally available. https://aws.amazon.com/about-aws/whats-new/2025/03/amazon-bedrock-model-evaluation-llm-as-a-judge/
  9. AWS. Amazon Bedrock AgentCore Evaluations is now generally available. https://aws.amazon.com/about-aws/whats-new/2026/03/agentcore-evaluations-generally-available
  10. Microsoft. Rubric evaluators (Azure AI Foundry). https://learn.microsoft.com/en-us/azure/foundry/concepts/evaluation-evaluators/rubric-evaluators
  11. Microsoft. General Purpose Evaluators (Azure AI Foundry). https://learn.microsoft.com/en-us/azure/foundry/concepts/evaluation-evaluators/general-purpose-evaluators
  12. LangChain. Set up online evaluators (LangSmith). https://docs.langchain.com/langsmith/online-evaluations
  13. Atla. Selene models. https://atla-ai.com/selene-models
  14. Patronus AI. GLIDER. https://docs.patronus.ai/docs/evaluators/advanced_concepts/glider
  15. Patronus AI. Lynx. https://docs.patronus.ai/docs/research_and_differentiators/Lynx/base
  16. Arize. LLM as a Judge (Phoenix). https://arize.com/docs/phoenix/evaluation/concepts-evals/llm-as-a-judge
  17. Ragas. Align an LLM as a Judge. https://docs.ragas.io/en/stable/howtos/applications/align-llm-as-judge/
  18. Hugging Face. Evaluation Guidebook: Model as a judge. https://github.com/huggingface/evaluation-guidebook/blob/main/contents/model-as-a-judge/basics.md

産業 T2(公的機関と標準)

  1. NIST. AI 800-2 (Initial Public Draft): Practices for Automated Benchmark Evaluations of Language Models. https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.800-2.ipd.pdf
  2. NIST. Towards Best Practices for Automated Benchmark Evaluations. https://www.nist.gov/news-events/news/2026/01/towards-best-practices-automated-benchmark-evaluations
  3. UK AI Security Institute. Inspect. https://inspect.aisi.org.uk/
  4. UK AISI. Autonomous Systems Evaluation Standard. https://ukgovernmentbeis.github.io/as-evaluation-standard/
  5. UK AISI. Early Lessons from Evaluating Frontier AI Systems. https://www.aisi.gov.uk/blog/early-lessons-from-evaluating-frontier-ai-systems
  6. UK AISI. Early Insights from Developing Question-Answer Evaluations for Frontier AI. https://www.aisi.gov.uk/blog/early-insights-from-developing-question-answer-evaluations-for-frontier-ai
  7. UK AISI. LLM Judges on Trial: A New Statistical Framework to Assess Autograders. https://www.aisi.gov.uk/blog/llm-judges-on-trial-a-new-statistical-framework-to-assess-autograders
  8. J-AISI. AIセーフティに関する評価観点ガイド 第1.10版. https://aisi.go.jp/assets/pdf/ai_safety_eval_v1.10_ja.pdf
  9. Stanford HAI. The 2026 AI Index Report: Technical Performance. https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
  10. NIST. 2024 NIST GenAI Pilot Study: Text-to-Text Evaluation Overview and Results. https://www.nist.gov/publications/2024-nist-genai-pilot-study-text-text-evaluation-overview-and-results

産業 T3(実務家私見)

  1. Husain, H. (2024). Creating a LLM-as-a-Judge that drives business results. https://hamel.dev/blog/posts/llm-judge/
  2. Husain, H., Shankar, S. (2025). LLM Evals FAQ. https://hamel.dev/blog/posts/evals-faq/
  3. Yan, E. (2024). Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge). https://eugeneyan.com/writing/llm-evaluators/
  4. Yan, E. (2025). An LLM-as-Judge Won’t Save The Product—Fixing Your Process Will. https://eugeneyan.com/writing/eval-process/
  5. Yan, E. (2025). Product Evals in Three Simple Steps. https://eugeneyan.com/writing/product-evals/
  6. Karpathy, A. (2024). X 投稿(Tesla 時代の evals 工数). https://x.com/karpathy/status/1795873666481402010
  7. Karpathy, A. (2025). X 投稿(evaluation crisis). https://x.com/karpathy/status/1896266683301659068
  8. Fourrier, C. (2024). Let’s talk about LLM evaluation. https://huggingface.co/blog/clefourrier/llm-evaluation
  9. Fourrier, C. et al. (2024). LLM Evaluation Guidebook. https://github.com/huggingface/evaluation-guidebook
  10. Willison, S. (2024). Creating a LLM-as-a-Judge that drives business results(紹介記事). https://simonwillison.net/2024/Oct/30/llm-as-a-judge/
  11. Willison, S. (2025). FAQs about AI Evals(紹介記事). https://simonwillison.net/2025/Jul/3/faqs-about-ai-evals/
  12. Shankar, S. (2025). In Defense of AI Evals, for Everyone. https://www.sh-reya.com/blog/in-defense-ai-evals/

← Notes 一覧ホーム