Shuichiro Ogawa
English

Notes ・ updated 2026-07-21

欠陥として消される出力に、発想の芽が混じっている

ハルシネーションは、消すべき不良品として扱われてきた。 モデルが事実にない文を自信ありげに述べる。 その率を下げることが、検出と緩和の研究が積み上げてきた目標である。

だが、事実から外れた出力と、まだ誰も書いていない発想とを、モデルは区別していない。 どちらも訓練分布のなかで確率的にありえた継続であり、片方だけを狙って消す手立ては原理的に難しい。 ここに、抑制一辺倒への疑いが生まれる。 非現実的な出力を根こそぎ削れば、そこに紛れていた新しい結合も一緒に落ちるのではないか。

この地図が集めるのは、その疑いを実証と理論で受け止めた研究群である。 四つの問いで束ねられる。 ハルシネーションを発想の資源と呼べる根拠はどこにあるのか。 LLMの創造性と出力多様性は、どう測られ、どこで痩せるのか。 逸脱的な出力を発想の触媒にする実装は、何を明らかにしたのか。 そして、性能を上げるほど多様性が痩せるなら、旧世代や高temperatureの出力にはどんな余地が残るのか。

四つめが、この収集の起点である依頼の核にあたる。 ただし先に断っておくと、その問いに正面から答えた研究は薄い。 「旧世代・低精度モデルの逸脱こそ発想に効く」と主張する査読研究は、収集の範囲では見つからなかった。 代わりに束ねられるのは、性能向上の工程(RLHFやSFT)が多様性を削るという実証と、多様性を測る指標の系譜である。 旧世代活用という視点は、それらの含意として組み立てるしかない。 その組み立てが妥当かどうかは、最後の節と末尾の留保で扱う。

ハルシネーションを資源と呼ぶ根拠

まず必要なのは、名前である。 Sui らは、LLMの事実逸脱をconfabulationと呼び直した1。 confabulation は臨床心理の語で、記憶の空白を無自覚に埋め合わせる作話を指す。 彼らは、この作話がベンチマーク上で narrativity(物語性)と意味的一貫性を高めることを示し、人間が断片から筋を立てる sense-making との並行を論じた。 逸脱が一貫性を下げるという素朴な予測は、ここで一度裏切られる。

名前がつくと、何が有益かを切り分けられる。 Chen と Wang は、valuable hallucinationを「現実ではないが実現可能な命題」として形式的に定義した2。 ReAct によるプロンプティングで全体のハルシネーションを抑えつつ、有益な側の比率を上げられたと報告する(数値は出典元の主張)。 Yang らはさらに二分し、知的ハルシネーションと欠陥的ハルシネーションを分けて測るベンチマークを組んだ3。 独自性・実現可能性・価値という創造性テストの指標を、事実逸脱の評価に持ち込んでいる。

この再定義を最も広く展開したのが、Jiang らのサーベイである4。 彼らは Guilford の発散思考と収束思考の枠を借り、ハルシネーションを創造性の源泉として類型化した。 枠組みとしては魅力的だが、未査読のサーベイであり、実証というより整理である点は割り引く必要がある。

理論だけでなく、機構の側からも接近がある。 He らは、トランスフォーマーのデコーディング層を一枚ずつ見て、ハルシネーションと創造性を同じ層で同時に定量化した5。 両者のトレードオフは層の深さ・モデルの種類・サイズを問わず一貫して現れ、最適な層は大規模モデルほど前段にあった。 逸脱と発想が別々の場所で起きるのではなく、同じ計算の裏表だという示唆である。

応用の側では、逸脱がそのまま精度を押し上げた例がある。 Yuan らは、分子特性の予測タスクで、LLMのハルシネーションが予測を改善することを複数モデルで観察した6。 科学的発見という、正確さが最も要求されそうな場面で、逸脱が資源に転じている。 So らのグループはこの路線をさらに社会的な用途へ延ばし、歴史的空白を制御された作話で補うcritical confabulationを提案した7。 ただしこの二本はいずれもプレプリント段階で、査読を経ていない。

創造性はどう測られ、どこで痩せるのか

資源と呼ぶには、測れなければならない。 LLMの創造性評価は、心理学の発散思考テストを移植することから始まった。 Stevenson らは GPT-3 を Alternative Uses Test にかけ、意味的距離で独自性を測る先駆的な試みを行った8。 当時は人間が優位だったが、逆転を予測している。 Bellemare-Pepin らは、10万人規模のヒトデータと最新LLMを Divergent Association Task で比べ、LLMが平均的な人間を超える一方、上位の高創造性の人間には及ばないことを示した9

平均を超えるのに、なぜ上位に届かないのか。 一つの答えは、多様性の欠落にある。 Wenger と Kenett は、複数のLLMの創造的出力が互いに著しく似ており、人間どうしの多様性を大きく下回ることを定量化した10。 どのモデルを選んでも似た答えが返る。 創造をLLMに外注すると、集団としての発想が痩せるという警告である。

では、その多様性はどの工程で失われるのか。 Kirk らは、RLHFが汎化性能を高める一方で出力多様性を有意に下げることを示し、報酬最適化の mode-seeking な性質を主因に挙げた11。 Karouzos らはさらに細かく、ポストトレーニングのどの段階で多様性が崩れるかを追い、意味的多様性の大部分が SFT の段階で失われることを OLMo3 の複数系列で突き止めた12。 性能を上げる工程そのものが、多様性を削っている。

ここに、この地図の起点である問いが接続する。 性能向上の工程が多様性を削るなら、その工程を経ていない、あるいは浅くしか経ていない出力には、多様性が残っているはずである。 旧世代・低精度モデルの逸脱を資源とみなす視点は、この含意として立つ。 ただし、収集した研究はモデルの新旧そのものを軸に多様性を比べてはいない。 Wright らは、新しいモデルほど認識論的多様性が高い(ただし基本的なウェブ検索より低い)と報告しており13、旧世代が一律に多様とは言えない。 「旧世代ほど発想に効く」は、まだ実証で裏づいた命題ではなく、トレードオフ研究からの推論にとどまる。

多様性は工程だけでなく、生成時のサンプリングでも動く。 Nguyen らの min-p サンプリングは、高いtemperatureで多様性を上げつつ品質の崩壊を防ぐ手法で、ICLR にオーラル採択され主要OSSにも採り入れられた14。 temperature を上げれば逸脱は増えるが、従来は品質と引き換えだった。 その交換条件を緩める工学が、創造性支援の側から出ている。

逸脱を発想の触媒にする実装は何を示したか

測定と工学の次は、人がどう使うかである。 Shaer らは、LLMをブレインライティングの発散と収束の両フェーズに組み込み、発想のプロセスと成果の両方が向上することを小規模なグループ実験で示した15。 LLMによる発想の評価が、専門家と初心者の評価と一致した点も報告している。

だが、支援が逆に発想を狭める報告も同じ年に出ている。 Wadinambiarachchi らは、生成AIの画像がデザインの固着を強め、アイデアの数・多様性・独自性を下げることを参加者間実験で観察した16。 最初に見せられた例に思考が引きずられる。 逸脱的な出力が発想を広げるという期待は、使い方を誤れば反転する。

短期の効果だけでなく、支援の後にも影響が残る。 Kumar らは1,100人規模の事前登録RCTで、LLM支援が短期的には創造性を高めるが、支援を外した後の自律的な発散思考をむしろ下げる「ハングオーバー効果」を示した17。 資源として使えるかどうかは、その場の出力の質だけでは決まらない。

こうした実証の下敷きにあるのが、創造性支援ツール(CST)の系譜である。 Shneiderman は、人間の創造性を支えるツールの設計原則を早くに定式化し、探索と変奏と精錬の協働を軸に据えた18。 Li らはこの系譜を引き継ぎ、61件のLLM発想支援研究をレビューして、発散から収束へ絞り込む枠組みを導いた19

科学の側では、仮説生成そのものを支援する研究が立ち上がっている。 Shahhosseini らは、LLMによる科学的発想を五つの類型に整理し、Boden の創造性分類と Rhodes の 4P で手法を評価する包括的なサーベイをまとめた20。 逸脱を発想の触媒にするという発想は、デザインとブレストだけでなく、科学的仮説生成にも及んでいる。

均質化を、プロンプトで押し返せるか

多様性が痩せるという診断には、処方も添えられている。 Girotra らは、GPT-4 が人間の学生より平均品質と速度で優位に立つ一方、アイデアが上位10%に集中する均質化を同時に観察した21。 優位と均質化が同じ実験で共存している。

処方は、モデルを変えることではなく、問い方を変えることに向かう。 Meincke らは、Chain-of-Thought とペルソナの付与がアイデアの分散を大きく広げ、人間グループに近い多様性に届くことを示した22。 均質化はモデルの固定的な性質ではなく、引き出し方で動く変数だという主張である。 Azad と Baten は、AI利用による集団レベルの多様性崩壊を、人間を基準に事前評価する枠組みを提案し、最新のLLMが人間のパリティを下回る課題を特定した23

これらを支える認知科学の基盤は、創造性を連想の問題として捉える系譜にある。 Mednick は創造を「遠隔連想の結合」と定義し24、Guilford は発散思考を提唱して現代の創造性研究を開いた2526。 Beaty と Kenett は、高創造性の人間が意味空間をより広く動き、より遠い概念を橋渡しすることを統合レビューで示した27。 ハルシネーションを「遠隔概念の非制約的な結合」と読み替える研究群は、この連想理論を暗黙の下敷きにしている。

空白と留保

集めた研究がそろって照らすのは、性能と多様性のトレードオフである。 検出・緩和がハルシネーションを削り、RLHFとSFTが多様性を削る。 その削られた側に、confabulation の物語性や valuable hallucination の実現可能な逸脱が含まれていた、という筋がここまでの地図である。

だが、依頼の核にあった「旧世代・低精度モデルの逸脱こそ発想に効く」という命題は、この地図では直接には支えられていない。 理由を切り分けておく。 第一に、多様性崩壊の研究(Kirk, Karouzos)はモデルの新旧ではなく訓練工程を軸に測っており、旧世代モデルそのものの発想上の優位を比較した研究は収集の範囲になかった。 第二に、Wright らの認識論的多様性はむしろ新しいモデルで高く、旧世代が一律に多様という前提は成り立たない。 第三に、逸脱の有益性を示す研究(Sui, Chen, Yuan)は、旧世代ではなく現行モデルの出力を対象にしている。

したがって旧世代活用は、既存研究の演繹的な帰結ではなく、トレードオフ研究の含意を新しい問いへ延ばすフレームの飛躍として立てるしかない。 その飛躍を検証するには、同一課題で世代・スケール・temperature を揃えて振り、発想の多様性と有益な逸脱の率を測る比較が要る。 この地図は、その比較がまだ書かれていないことを空白として残す。

参照文献は本文の脚注に完全な書誌(DOI/URL)を載せた。 書誌の到達は確認済みだが、査読前のプレプリントが多くを占め、正式採択が未確認の項目がある。 それらは末尾に集約する。


References

未検証事項

  • Yang et al. 2025(KDD 2026): 会議への正式採択がプレプリント段階では未確認([要一次検証])。
  • Sui et al. 2025(Critical Confabulation, ICLR 2026): 正式採択が未確認([要一次検証])。
  • Girotra et al. 2023: SSRN ワーキングペーパーの査読誌掲載 DOI が未確認([要一次検証])。
  • Guilford 1967(書籍): DOI/URL 到達が未確認、ISBN のみ([要一次検証])。
  • 本文で参照した多くのプレプリント(Chen & Wang, He et al., Yuan et al., Kirk et al., Karouzos et al., Wright et al., Chen 系, Jiang et al., Li et al., Shahhosseini et al., Meincke et al., Azad & Baten)は査読前であり、数値・結論は出典元の主張として扱っている。
  • 上記 References のうち 28293031 はコーパスに収録した関連文献だが本文の論証には直接用いていない(地図の周辺に位置づく参考)。

Footnotes

  1. Sui, P., Duede, E., Wu, S., & So, R. J. (2024). Confabulation: The Surprising Value of Large Language Model Hallucinations. Proceedings of ACL 2024. https://arxiv.org/abs/2406.04175 (2026-07-21 到達確認)

  2. Chen, Q., & Wang, B. (2025). Valuable Hallucinations: Realizable Non-realistic Propositions. arXiv:2502.11113. https://arxiv.org/abs/2502.11113 (2026-07-21 到達確認、未査読)

  3. Yang, C., Yuan, J., Cai, S., Jiang, J., & Hu, C. (2025). Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations. arXiv:2512.21635. https://arxiv.org/abs/2512.21635 (2026-07-21 到達確認、KDD 2026 正式採択は[要一次検証])

  4. Jiang, X., Tian, Y., Hua, F., Xu, C., Wang, Y., & Guo, J. (2024). A Survey on Large Language Model Hallucination via a Creativity Perspective. arXiv:2402.06647. https://arxiv.org/abs/2402.06647 (2026-07-21 到達確認、未査読)

  5. He, Z., Zhang, B., & Cheng, L. (2025). Shakespearean Sparks: The Dance of Hallucination and Creativity in LLMs’ Decoding Layers. arXiv:2503.02851. https://arxiv.org/abs/2503.02851 (2026-07-21 到達確認、未査読)

  6. Yuan, S., Qu, Z., Kangen, A. Y., & Färber, M. (2025). Can Hallucinations Help? Boosting LLMs for Drug Discovery. arXiv:2501.13824. https://arxiv.org/abs/2501.13824 (2026-07-21 到達確認、未査読)

  7. Sui, P., Duede, E., Long, H., & So, R. J. (2025). Critical Confabulation: Can LLMs Hallucinate for Social Good? arXiv:2511.07722. https://arxiv.org/abs/2511.07722 (2026-07-21 到達確認、ICLR 2026 正式採択は[要一次検証])

  8. Stevenson, C., Smal, I., Baas, M., Grasman, R., & van der Maas, H. (2022). Putting GPT-3’s Creativity to the (Alternative Uses) Test. Proceedings of ICCC 2022. https://arxiv.org/abs/2206.08932 (2026-07-21 到達確認)

  9. Bellemare-Pepin, A., Lespinasse, F., Thölke, P., Harel, Y., Mathewson, K., Olson, J. A., Bengio, Y., & Jerbi, K. (2026). Divergent creativity in humans and large language models. Scientific Reports, 16(1), Article 1279. https://doi.org/10.1038/s41598-025-25157-3 (2026-07-21 DOI 解決確認)

  10. Wenger, E., & Kenett, Y. N. (2026). Large language models are homogeneously creative. PNAS Nexus, 5(3), pgag042. https://doi.org/10.1093/pnasnexus/pgag042 (2026-07-21 DOI 解決確認。プレプリント版: arXiv:2501.19361 “We’re Different, We’re the Same: Creative Homogeneity Across LLMs”)

  11. Kirk, R., Mediratta, I., Nalmpantis, C., Luketina, J., Hambro, E., Grefenstette, E., & Raileanu, R. (2023). Understanding the Effects of RLHF on LLM Generalisation and Diversity. arXiv:2310.06452. https://arxiv.org/abs/2310.06452 (2026-07-21 到達確認、未査読)

  12. Karouzos, C., Tan, X., & Aletras, N. (2026). Where does output diversity collapse in post-training? arXiv:2604.16027. https://arxiv.org/abs/2604.16027 (2026-07-21 到達確認、未査読)

  13. Wright, D., Masud, S., Moore, J., Yadav, S., Antoniak, M., Christensen, P. E., Park, C. Y., & Augenstein, I. (2025). Epistemic Diversity and Knowledge Collapse in Large Language Models. arXiv:2510.04226. https://arxiv.org/abs/2510.04226 (2026-07-21 到達確認、未査読)

  14. Nguyen, M. N., Baker, A., Neo, C., Roush, A., Kirsch, A., & Shwartz-Ziv, R. (2025). Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs. ICLR 2025 (Oral). https://arxiv.org/abs/2407.01082 (2026-07-21 到達確認)

  15. Shaer, O., Cooper, A., Mokryn, O., Kun, A. L., & Ben Shoshan, H. (2024). AI-Augmented Brainwriting: Investigating the use of LLMs in group ideation. Proceedings of CHI 2024. https://doi.org/10.1145/3613904.3642414 (2026-07-21 DOI 到達確認)

  16. Wadinambiarachchi, S., Kelly, R. M., Pareek, S., Zhou, Q., & Velloso, E. (2024). The Effects of Generative AI on Design Fixation and Divergent Thinking. Proceedings of CHI 2024. https://doi.org/10.1145/3613904.3642919 (2026-07-21 DOI 到達確認)

  17. Kumar, H., Vincentius, J., Jordan, E., & Anderson, A. (2024). Human Creativity in the Age of LLMs: Randomized Experiments on Divergent and Convergent Thinking. Proceedings of CHI 2025. https://arxiv.org/abs/2410.03703 (2026-07-21 到達確認)

  18. Shneiderman, B. (2007). Creativity Support Tools: Accelerating Discovery and Innovation. Communications of the ACM, 50(12), 20–32. https://doi.org/10.1145/1323688.1323689 (2026-07-21 DOI 到達確認)

  19. Li, S., Padilla, S., Le Bras, P., Dong, J., & Chantler, M. (2025). A Review of LLM-Assisted Ideation. arXiv:2503.00946. https://arxiv.org/abs/2503.00946 (2026-07-21 到達確認、未査読)

  20. Shahhosseini, F., Marioriyad, A., Momen, A., Baghshah, M. S., Rohban, M. H., & Javanmard, S. H. (2025). Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey. arXiv:2511.07448. https://arxiv.org/abs/2511.07448 (2026-07-21 到達確認、未査読)

  21. Girotra, K., Meincke, L., Nave, G., Terwiesch, C., & Ulrich, K. T. (2023). Ideas are Dimes a Dozen: Large Language Models for Idea Generation in Innovation. SSRN Working Paper 4526071. https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4526071 (2026-07-21 到達確認、査読誌掲載 DOI は[要一次検証])

  22. Meincke, L., Mollick, E. R., & Terwiesch, C. (2024). Prompting Diverse Ideas: Increasing AI Idea Variance. arXiv:2402.01727. https://arxiv.org/abs/2402.01727 (2026-07-21 到達確認、未査読)

  23. Azad, N. S., & Baten, R. A. (2026). Ex Ante Evaluation of AI-Induced Idea Diversity Collapse. arXiv:2605.06540. https://arxiv.org/abs/2605.06540 (2026-07-21 到達確認、未査読)

  24. Mednick, S. A. (1962). The Associative Basis of the Creative Process. Psychological Review, 69(3), 220–232. https://doi.org/10.1037/h0048850 (2026-07-21 DOI 解決確認)

  25. Guilford, J. P. (1950). Creativity. American Psychologist, 5(9), 444–454. https://doi.org/10.1037/h0063487 (2026-07-21 DOI 解決確認)

  26. Guilford, J. P. (1967). The Nature of Human Intelligence. McGraw-Hill. ISBN 0070251355(DOI/URL 到達は[要一次検証])

  27. Beaty, R. E., & Kenett, Y. N. (2023). Associative Thinking at the Core of Creativity. Trends in Cognitive Sciences, 27(7), 671–683. https://doi.org/10.1016/j.tics.2023.04.004 (2026-07-21 DOI 到達確認)

  28. Zhao, Y., et al. (2024). Assessing and Understanding Creativity in Large Language Models. Machine Intelligence Research (2025). https://arxiv.org/abs/2401.12491 (2026-07-21 到達確認)

  29. Banerjee, M., Wangsajaya, N. Y., Alsagoff, S. A. R., Tan, M. S., Chun, Z. C. K., & Wei, A. C. G. (2025). Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs. AAAI 2026 Workshop (AI4Research). https://arxiv.org/abs/2512.11509 (2026-07-21 到達確認、ワークショップ論文)

  30. Shen, H., Shen, L., Wu, W., & Zhang, K. (2025). IdeationWeb: Tracking the Evolution of Design Ideas in Human-AI Co-Creation. Proceedings of CHI 2025. https://doi.org/10.1145/3706598.3713375 (2026-07-21 DOI 到達確認)

  31. Guo, S., Shariatmadari, A. H., Xiong, G., Huang, A., Xie, E., Bekiranov, S., & Zhang, A. (2024). IdeaBench: Benchmarking Large Language Models for Research Idea Generation. arXiv:2411.02429. https://arxiv.org/abs/2411.02429 (2026-07-21 到達確認、未査読)


← Notes 一覧ホーム