Shuichiro Ogawa
English

ノート · updated 2026-09-25

LLM にデザインを頼む:ありがちな UI に収束させないブリーフ、スキル、工程

LLM にコードではなくデザインを頼むときの実践を、国内企業の事例、ベンダーの一次資料 16 件、調査会社の資料 7 件、学術文献 26 件から整理した。起点のカナリーの事例では、デザイン哲学を skill にした LLM はトンマナを合わせたが、どの画面もありがちな UI に収束した。

目次(11)
  1. トンマナを合わせた後に残った問題
  2. LLM の出力はなぜ平均に寄るのか
  3. 既定の型を禁じるとどうなるか
  4. 依頼に何を書くか
  5. デザインシステムはどこで効かせるか
  6. 発散はどこに置き、どう書くか
  7. 生成した案をどう確かめ、誰が選ぶか
  8. デザイナーの考え方をどうスキルに書くか
  9. 依頼から選択までの型
  10. この整理が当てはまらないところ
  11. Footnotes

トンマナを合わせた後に残った問題

カナリーのデザイン組織は、PRD を読んで UI を生成するまでのフローを Claude Code で運用している(カナリー 2026)。 フロー構築の初期にまずぶつかったのは、生成された画面が既存プロダクトのトンマナに合わないことだった。 そこでデザイン哲学とデザインガイドラインを skill として読ませると、「カナリーっぽい UI」はある程度出るようになった。 次に出てきたのは、どの画面も同じようなありきたりの UI になるという問題である。

退会手続きの確認モーダルを頼むと、デザインシステムだけを通した LLM は、仕様を満たす最小限の要素を並べた画面を返した。 カナリーのデザイナーなら、退会で失う内容の説明や、最終請求と退会後のスケジュールといった、安心につながる一工夫を足す。 機能として正しい画面と、そのプロダクトらしい画面のあいだに、この差が残った。

評価の側にも似た観察がある。 Nielsen Norman Group は同じ再設計課題を 3 系統の AI ツールに与え、生成された画面を “flat and interchangeable” と評した(NN/g 2025)。 ツールが shadcn や Tailwind CSS といった既定の部品と枠組みに寄るため、サンセリフで装飾の少ない似た見た目になるという。

文脈を足せば凡庸さが減る、という期待はここで外れている。 ブランドのガイドラインを渡すと、出力はブランドに寄った。 それでも平均からは離れなかった。

LLM の出力はなぜ平均に寄るのか

ベンダー自身がこの傾向を認め、原因を訓練データの頻度で説明している。 Anthropic は、サンプリングでモデルは訓練データの統計的なパターンに沿ってトークンを予測し、Web の訓練データでは「誰にでも通用し、誰の気にも障らない安全なデザインの選択」が支配的だと書く(Anthropic 2025a)。 OpenAI も、プロンプトの指定が足りないとき、モデルは訓練データの高頻度のパターンに戻りやすいと書く(OpenAI n.d.-a)。

学術側は、この説明に事後学習の段階を足す。 Zhang らは、人手の選好データで注釈者が見慣れた文を体系的に好む典型性バイアス(typicality bias)を理論化し、選好データで実際に確かめた(Zhang et al. 2025)。 選好で調整されたモデルは、最も典型的な応答に確率を集める(mode collapse)。 この機構が正しければ、「創造的にして」と頼んでも、頼まれた側の分布そのものが典型に向けて尖っている。 Zhang らは、応答をいくつか挙げさせて各応答の確率も言わせるプロンプトで、創作文の多様性が直接の指示の 1.6〜2.1 倍になると報告している(同上。プレプリントで、UI では測っていない)。

カナリーの事例は、この機構と整合する読み方ができる。 デザインガイドラインは出力の範囲を狭めるが、狭めた範囲の中で最も典型的な案を選ぶ性質はそのまま残る。 「カナリーっぽい」ことと「どの画面も同じ」であることが両立したのは、そのためだと考えられる。

平均への収束は、一つの出力の中だけでなく、利用者の集団でも起きる。 Doshi と Hauser の実験(書き手 293 名)では、AI の案を 1 つ見た書き手の物語は新規性が 5.4%、5 つ見た書き手は 8.1% 上がった。 一方で、物語が同じ条件の他の物語の平均に似る度合いは、評価尺度の全幅の 10.7% と 8.9% だけ上がった(Doshi & Hauser 2024)。 Anderson らも、ChatGPT を使った利用者どうしのアイデアが、別の発想支援を使った場合より意味的に似ることを示した(Anderson et al. 2024)。 同じモデルを同じ既定で使う組織が増えれば、個々の画面は整っても、プロダクトどうしの差は縮む。 カナリーが「差分のないありがちなプロダクトになってしまう」と書いた懸念は、この集団レベルの均質化にあたる。

既定の型を禁じるとどうなるか

では、ありがちな選択を名指しで禁じればよいのだろうか。 Anthropic のプロンプトの手引きには、その試みの痕跡が残っている。 フロントエンドのデザイン向けに示された system prompt は、Inter、Roboto、Arial といった書体や、白地に紫のグラデーションを避けよと並べたうえで、最後にこう書く。 “You still tend to converge on common choices (Space Grotesk, for example) across generations.”(Anthropic n.d.-a) よく使われる書体を禁じると、生成を重ねるうちに別の書体に集まる、とベンダー自身が認めている。

同社の frontend-design スキルの版の変化も同じ方向を示す(Anthropic 2025b; 2026)。 2025 年 12 月の版は、トーンを極端に振れと指示し、Inter などを “NEVER” で禁じ、Space Grotesk への収束も “NEVER” で禁じていた。 2026 年 9 月の現行版は、AI が生成するデザインがいま集まる型を 5 つ挙げる。 クリーム地に高コントラストのセリフ体とテラコッタのアクセント、黒地に酸性の緑か朱のアクセント、罫線と密な段組の新聞風レイアウト、同じ角丸と同じ影を付けたカードの並び、主題にかかわらず現れる飾り(字間を開いた大文字の小見出し、中黒でつないだメタ情報、ダッシュでつないだラベルなど)である1。 一つめのアクセント色について、スキルは Anthropic 自身の Claude のアクセント色に近いので、利用者の依頼では生成の痕跡として読まれる、と注記している。 2025 年版が名指しした既定と、2026 年版が名指しした既定は、ほとんど重ならない。 一つの既定を禁じると次に典型的な選択が既定になる、という読みは、前節の機構とも整合する。

現行版にも避けるべき書体の扱いの列挙は残るが、重心は次の三つに移っている。 一つめは、題材への接地である。 ブリーフが製品や題材を特定していなければ、題材、対象者、デザインの主な役割を自分で特定して提案し、依頼者に確認させる。 独自の視覚的な選択は、その題材の業界、素材、言葉づかいから来るとスキルは書く。 二つめは、既定の較正である。 5 つの型はどれも依頼によっては正当だが、「選択ではなく既定」だとし、ブリーフが方向を指定したときはその言葉に必ず従い、ブリーフが空けた軸を既定で埋めるな、と書く。 三つめは、計画を先に見直す 2 パスである。 色を名前付きの 4〜6 色の hex 値で、書体とその役割、レイアウトの構想、固有の原則を短い計画にまとめ、実装の前にブリーフに照らして見直す。 似たプロンプトで同じところに着くなら、その部分は既定なので直す。

依頼に何を書くか

LLM への依頼は、デザインの世界でいうブリーフにあたる。 Paton と Dorst は、経験のあるデザイナー 15 名への聞き取りから、ブリーフィングを、依頼者の枠組みを引き出して組み替える状況的な実践として記述した(Paton & Dorst 2011)。 人間のデザイナーは、足りないブリーフを問い返し、枠組みを組み替える。 LLM は、指示されなければ多くの場合そのまま生成に進む。 手描きスケッチから Web UI を作る研究でも、UI/UX の専門家は、受け身のフィードバックよりモデルの側から質問してくる形を好んだ(Li et al. 2024)。 先の frontend-design スキルが、題材と対象者と主な役割を特定して確認させるのは、この問い返しを手順に書き込んだものと読める。

ベンダーの手引きが挙げるブリーフの要素は、次のように重なっている。

要素手引きでの言い方出典
題材と、その世界の素材や言葉づかいsubject matter, materials, vernacularAnthropic 2026
誰のためかaudience、context of useAnthropic 2026; Anthropic n.d.-c; Vercel 2025
画面の主な役割the design’s primary job、各節に一つの役割Anthropic 2026; OpenAI n.d.-a
実際の内容real content、narrative or content strategy、product surfaceAnthropic 2026; OpenAI n.d.-a; Vercel 2025
制約デザインシステム、書体、配色、レイアウトを先に定義、constraints and tasteOpenAI n.d.-a; Anthropic n.d.-c; Vercel 2025
良さの判断何が良く何が正しいかという意見Lu 2025
視覚参照スクリーンショット、ムードボードOpenAI n.d.-a

このうち最後の二つは、書き方で結果が分かれる。 Cursor のデザイン責任者の Ryo Lu は、何が良く何が正しいかを人が指定する必要があり、その意見を入れなければ AI スロップになる、と述べる(Lu 2025)。 視覚参照は曖昧さを減らす。 NN/g の比較では、スケッチやモックアップや Figma のリンクを添えたプロンプトが最も正確な画面を生んだ。 ただし NN/g は同時に、参照を用意した時点でデザインの作業の多くはもう人が済ませている、と書く(NN/g 2025)。 参照は、それに似せる力として働く。 Wadinambiarachchi らの実験では、AI の画像生成器を使った参加者は最初の例に強く固着し、出した案が少なく、多様性と独創性も低かった(Wadinambiarachchi et al. 2024)。 設計者が例示の特徴を自案に持ち込むデザイン固着(design fixation)は、Jansson と Smith が 1991 年に実験で示した現象である(Jansson & Smith 1991)。

そうであれば、ブリーフには、固定する軸と空けておく軸を分けて書くのがよい。 ブランドの色やコンポーネントのように揃えるべき軸は、参照や名前で固定する。 発想を広げたい軸は、参照を添えずに空けておき、空けたことを明示する。 frontend-design スキルの「ブリーフが空けた軸を既定で埋めるな」は、この書き分けを受け取る側の規則にあたる。

デザインシステムはどこで効かせるか

主要なツールは、デザインシステムを生成の文脈として渡す仕組みを備えつつある。 v0 はデザインシステムを skill として保存し、それを文書の写しではなく、ソースの在りかと、安全に使えるコンポーネント、props、トークンと、新しいアプリへのつなぎ方を教える「アダプタ」だと説明する(Vercel n.d.)。 OpenAI は、色を JSX や CSS に直書きせず、トークン経由で使わせる指示を示す(OpenAI n.d.-b)。 Figma Make は AI に従わせたい規則を書く Guidelines.md を持ち、Google の Stitch は DESIGN.md をプロジェクト間で書き出し、取り込める形式として公開した(Figma n.d.; Google 2026)。 Claude Design は、コードのリポジトリや /design-sync からデザインシステムを取り込み、コンポーネントを名前で指定させる(Anthropic n.d.-c)。 デザインシステムがエージェントの精度の上限を決めるという整理は デザインシステム=AIの基盤レイヤー — 構造化されたデザイン知識がエージェント精度を決める にある。

ただし、渡し方には量の問題がある。 Figma は、文脈は多いほどよいわけではなく LLM を混乱させうるので、最も大事な規則に絞れ、と書く(Figma n.d.)。 準拠そのものもまだ解けていない。 Progress の調査では、回答者 225 名のうち 36% が、AI の結果が自社のデザインシステムの基準に合わないと答えた(Progress 2025。デザインと開発の連携ツールを売る企業の調査)。

デザインシステムは、構造上、出力を既知の型へ寄せる装置である。 カナリーが問題にしたのは、この装置をどの位置に置くかだった。 変更前のフローは、PRD から情報設計を経て、デザインシステムを通して UI に収束させていた。 変更後は、情報設計の後にデザイナー人格による発散を挟み、そのあとでデザインシステムに通す。 デザインシステムを最初から効かせると、探索は既知の型のすぐ近くから始まりやすい。 後述の Detour のスキルが書くとおり、近くを探して得られる案は既知の型へ収束しやすい。

発散はどこに置き、どう書くか

カナリーは、リードデザイナーと LLM が同じ工程をたどるようにフローを設計している。 人の工程は、要件の理解、データモデルの整理と情報設計、UI パターンの発散、デザインシステムとの差分調整、パターンからの意思決定と進む。 当時の LLM の生成に抜けていたのは、三つめの「意図的に違うパターンを発散させる」工程だった。

変更後のフローでは、要件と PRD を読んだ振り分け役が発散のモードを推薦し、選ばれた複数のモードがそれぞれ 1 案ずつ草案を並列に作る。 草案はデザインシステムのトークン、コンポーネント、レイアウトを通って収束し、あまりに突飛な案は落とされる。 出力は、案ごとの UI とレポートである。 ベンダーの手引きも、最終案の前に複数案を出させる点では一致している。 OpenAI は最終的なアセットを選ぶ前にムードボードか複数の視覚案を先に作らせるよう勧め、Claude Design の手引きは方向を探るときに 2〜3 案を出させるよう書く(OpenAI n.d.-a; Anthropic n.d.-c)。 デザインエンジニアの Emil Kowalski の prototype スキルは、同じ UI 部品の複数の版を作り、切り替えて見比べられるようにする(Kowalski 2026)。

問題は、発散をどう指示するかである。 「あなたは独創的なデザイナーだ」と役割を与える方法が、まず思いつく。 これには実験上の留保がある。 Zheng らは 162 の役割を 4 系統の LLM で試し、system prompt に役割を足しても事実問題の正答率は上がらず、役割ごとの効果はほぼ偶然だと報告した(Zheng et al. 2024)。 発想の多様性についても、役割名の効果は一定しない。 Meincke らは GPT-4 で 35 のプロンプトを比べ、人間の集団が出したアイデアのコサイン類似度 0.243 に対し、GPT-4 は 0.255〜0.432 だった(Meincke et al. 2024。値が小さいほど多様)。 役割を与えた条件では、最もよかった「きわめて創造的な起業家」が 0.348、Steve Jobs として考えさせると 0.368 で、基準の 0.377 より多様になったが、同じ系統の変種には 0.411 まで悪化するものもあった。 最も多様だったのは、100 案の短いリストを出させ、それを大胆で互いに違うものに直させ、最後に説明を書かせる、段階に分けた CoT のプロンプトで、0.255 と人間の集団に近かった。

Deng らは、LLM の案が人間の案ほど多様にならない理由を、二つの障壁に分けた(Deng et al. 2026)。 一つは、最初の出力が後の出力を縛る個人レベルの固着で、CoT はこれを減らす。 もう一つは、人間の集団なら人ごとに知識が分かれているのに、LLM は知識を一つの分布にまとめてしまうという集団レベルの問題である。 これには、ありふれた人物像のペルソナを多様な標本化の手がかりとして与える方法が効き、二つを併せると人間を上回る多様性になったという(同上。プレプリント)。 Suh らの Luminate も、応答の設計空間を構造的に生成させ、その中で多数の応答を探索させることで、少数の案への早い収束を避けようとした(Suh et al. 2024)。 いずれもアイデアや文章で測った結果で、UI の見た目で測ったものではない。 それでも、効いているのが役割名ではなく、探索の出発点を動かす手順と、分かれた視点の手がかりである、という点は共通している。

カナリーの「デザイナー人格」は、この観点から読むと手順である。 Detour のスキルは、「1. 位置づけ」「2. 設計の意図」「3. 成立条件」「4. 運用上の注意」の 4 節で書かれている。 位置づけは、発想の出発点を対象の近くに置かないモードで、近くを探して得られる案は既知の型へ収束しやすいので、その収束を意図的に遅らせる、というものである。 設計の意図では、離れることは目的ではなく手段だとし、離れる過程と元の文脈へ戻る過程を別々に扱い、戻る過程を欠いた案は完成とみなさない。 成立条件は、既存の設計規約の内側に着地できることで、戻れない案は発想として面白くても採らない。 Persona のスキルは、ペルソナごとにエージェントを並列に起動し、それぞれのペルソナにとって何が大事かを評価し直して UI の構造を組み直す。 Deng らの言う、分かれた視点の手がかりに近い使い方である。 このスキルは、差異を観点の側に置き、出力の形式は揃えるとする。 形式が揺れると、案どうしの比較が形式の差にすり替わるからである。 さらに、材料が揃わないまま生成に進むことを認めず、曖昧さを抱えたまま完成形に見える出力を作ることを、案が出ないことより重い失敗として扱う。 Thriller のスキルは、あえて揃えない箇所とそれが揃う瞬間を対にして設計し、置いた緊張の解放の位置が決まらない案は不成立とする。

三つとも、何を出すかではなく、どこから探し始め、何を満たさない案を捨てるかを書いている。 カナリーがモードを複数用意する理由も、毎回同じ思考をさせると、それはそれで平均的な UI になるからだという。 一つのモードにも、そのモードなりの典型があるということである。

生成した案をどう確かめ、誰が選ぶか

見た目の確認は、かなりの部分を LLM に任せられる。 Claude Code の手引きは、UI の変更をスクリーンショットで確かめる型として、元のデザインを貼り、結果のスクリーンショットを撮って比べ、違いを挙げて直させる指示を例示する(Anthropic n.d.-b)。 frontend-design スキルは、作りながらスクリーンショットで自分の作品を批評させ、OpenAI は Playwright で描画を検査し、複数のビューポートを試し、参照 UI との一致を確かめさせる(Anthropic 2026; OpenAI n.d.-a)。 こうした確認が働くのは、比べる相手がはっきりしているときである。 参照画像との差、レスポンシブやキーボードフォーカスやアクセシビリティといった品質の床、OpenAI のフロントエンドスキルの確認項目(最初の画面でブランドが紛れないか、見出しだけで理解できるか、カードは本当に必要か)などがそれにあたる。 Emil Kowalski のレビュー用スキルも、本人が言語化したルールに照らして問題を挙げさせる(Kowalski 2026)。

どの案がユーザーにとって最もよいかの判断は、まだ LLM に任せきれない。 UICrit を作った Duan らは、LLM による UI 評価は人間の評価者の水準に届いていないと述べ、デザイナー 7 名による 3,059 件の批評を例として与え、視覚的なプロンプトを工夫することで、LLM の批評を 55% 改善した(Duan et al. 2024b)。 GPT-4 で UI モックアップにフィードバックを返すシステムの評価では、細かな誤りの検出には役立つが、反復を重ねると有用性が落ちた(Duan et al. 2024a)。 マルチモーダル LLM を UI の審査役にする研究も、人間の知覚に近い次元と離れる次元があると報告している(Luera et al. 2025)。 LLM に審査をさせる一般的な問題は LLM-as-a-Judge の最新潮流:中核研究53件の文献地図と創造性評価の独立章 にまとめてある。

カナリーも、何がユーザーにとってベストかは別の観点が要るとして、そこは人の目を通している。 Persona のスキルは、案の統合と優劣の判定をモードの責務とせず、どれを採るかを決める行為を人の側に残すと明記している。

選ぶ人にも偏りはある。 前節までの実験が示すとおり、AI の案を見た人は最初の例に固着しやすく、同じモデルの案を見た人どうしは似た結論に寄る(Wadinambiarachchi et al. 2024; Anderson et al. 2024)。 カナリーのフローが、形式を揃えた複数の案を並べて出すのは、この偏りへの対処としても働きうる。 ただし、案を並べる数や見せ方が UI の選択での固着をどれだけ減らすかは、今回集めた範囲では測られていない。

デザイナーの考え方をどうスキルに書くか

デザインの知識をスキルとして持たせるのは、読み込みを必要なときに限るためである。 Anthropic は、フロントエンドのデザインの指針を system prompt に入れると、Python のデバッグやメールの作成といった無関係な依頼にまでその文脈が付いて回るので、実行時に必要な分だけ読み込むスキルにした、と説明している(Anthropic 2025a)。

中身は、書き起こすのに手間がかかる。 カナリーでは、AI ワークフローの構築を担う担当者がリードデザイナーに「このUIはどう考えてつくっていたか?」と問いかけ、一緒に棚卸しする時間を何度か取った。 デザインの過程はデザイナーの頭の中にあって言語化されきっていないことが多いので、意図や思考法をリバースエンジニアリング的に汲み取る必要があったという。 棚卸しの結果は、まず組織で共有する資料として 3 つの思考法にまとめられた。 その資料のままでは LLM が読み込みきれないので、もう少し具体的なプロンプトに書き直して skill にした。 Emil Kowalski も、スキルは領域の専門性の副産物であり、判断を積み重ねた後にそれを言語化できるようになったものだと書く(Kowalski 2026)。

集めたスキルは、担う工程で三つに分けられる。

種類担う工程書く内容例
収束のスキルデザインシステムへの準拠トークン、コンポーネント、ガイドライン、既定の較正v0 のデザインシステム skill、Figma Make の Guidelines.md、Stitch の DESIGN.md、OpenAI のトークン優先の指示
発散のスキルパターンの発散出発点の置き方、戻り方、不成立の条件カナリーの Detour、Persona、Thriller
検査のスキル確認とレビュー誤りの一覧と直し方、確認項目Emil Kowalski のレビュー用スキル、OpenAI のフロントエンドスキルの確認項目

Anthropic の frontend-design スキルは、この三つを一つのファイルに持つ。 題材への接地と 2 パスの計画は発散と収束のあいだを、既定の較正は収束の側を、スクリーンショットでの自己批評と品質の床は検査を受け持つ。 カナリーは発散のスキルをモードごとのファイルに分け、デザインシステムの側を別に持っている。 どちらの形でも、スキルを書く前に、それがどの工程を担うのかを決めておく必要がある。 発散のスキルに収束の規則を混ぜると、発散させたい軸まで既知の型に戻りやすくなる。

依頼から選択までの型

ここまでの材料を工程順に並べると、次のようになる。

工程すること主な根拠
ブリーフ題材、対象者、画面の主な役割、実際の内容、良さの判断を書く。固定する軸と空ける軸を分ける。足りなければ LLM に提案させて確認するAnthropic 2026; Anthropic n.d.-c; OpenAI n.d.-a; Lu 2025; Paton & Dorst 2011
既定の較正既知の既定の型を「選択ではなく既定」として示し、ブリーフが指定したときだけ使わせる。禁止を並べて済ませないAnthropic n.d.-a; Anthropic 2026
発散情報設計の後、デザインシステムの前に、手順の違う複数のモードで 1 案ずつ並列に作る。役割名より、出発点と戻り方と不成立の条件を書く。出力の形式は揃えるカナリー 2026; Meincke et al. 2024; Deng et al. 2026
収束デザインシステムのトークンとコンポーネントに通し、突飛すぎる案を落とす。ガイドラインは要点に絞るカナリー 2026; OpenAI n.d.-b; Vercel n.d.; Figma n.d.
確認スクリーンショットで参照や確認項目と照合させ、違いを挙げて直させる。修正の依頼は 1 回に 1〜2 か所に絞るAnthropic n.d.-b; Anthropic 2026; OpenAI n.d.-a; Google 2025
選択案を並べて人が選ぶ。最初に見た案に引きずられやすいことを前提にするカナリー 2026; Wadinambiarachchi et al. 2024; Duan et al. 2024b

この整理が当てはまらないところ

発散の指示法を支える実験は、どれも UI 以外で測られている。 Meincke らは製品アイデア、Deng らはアイデア生成、Zhang らは創作文、Doshi と Hauser は短編小説である。 画面の構造や見た目の多様性に同じ効果があるかは、確かめられていない。

カナリーの報告する効果は、一工夫のある UI が生成される確率が高まった、という定性的な記述である。 モードの手順が効いたのか、案の数が増えたことが効いたのかは、報告からは切り分けられない。

ベンダーの手引きは、特定のモデルの版に向けて書かれ、変わるのも速い。 frontend-design スキルは 2025 年 12 月から 2026 年 9 月のあいだに少なくとも 2 回大きく書き換えられ、名指しされる既定の型も入れ替わった。 ここに挙げた既定の型は、2026 年 9 月時点のものである。

発散させるほど、選ぶ負担は人に移る。 案が 3 つなら 3 つを、並列のモードが 5 つなら 5 つを、誰かが見比べなければならない。 生成から評価へのデザイナーの仕事の移動は 制作者から編集者へ — AI時代のデザイナー役割移行の構造分析 で扱っている。

最後に、カナリーの「デザイナー人格」のような発散のモードが広く共有されたとき、それ自体が次の既定になるかどうかは、まだわからない。 Anthropic のスキルが、Claude 自身のアクセント色に近い色を、利用者の依頼では生成の痕跡として読まれる既定の一つに数えていることは、ある作り手に固有だった選択が既定の型に変わりうることを示す例と読める。 リードデザイナーの考え方を写したモードは、使われるほど、そのデザイナーらしさを保つのか、それとも誰の画面にも現れる型になっていくのか。

関連ノート

未検証事項

主要主張に未検証のものはない。 周辺記述と台帳に残る未確定は次のとおりで、詳細は source/review/llm-design-direction/ の各台帳にある。

  • Paton & Dorst (2011) の要旨は、探索段階では確認したが、執筆時の再取得はできなかった。[要一次検証: 取得不能 ScienceDirect 403、Crossref と OpenAlex に要旨なし]
  • OpenAI の “Designing delightful frontends with GPT-5.4” と各手引き(OpenAI n.d.-a, n.d.-b)、Anthropic のプロンプトの手引きと Claude Code の手引き、v0 と Figma のヘルプには、公開日や改訂日の表示がない。[要確認: 記載なし 各ページ本文]
  • Emil Kowalski の “Agents with Taste” の公開日。[要確認: 記載なし emilkowal.ski 本文]
  • Zhang et al. (2025) の会議採録。[要確認: 記載なし arXiv abs ページ]

参照文献

学術文献

  • Anderson, B. R., Shah, J. H., & Kreminski, M. (2024). Homogenization Effects of Large Language Models on Human Creative Ideation. Creativity and Cognition (C&C ‘24). https://doi.org/10.1145/3635636.3656204
  • Deng, Y., Brucks, M., & Toubia, O. (2026). Examining and Addressing Barriers to Diversity in LLM-Generated Ideas. arXiv preprint. https://arxiv.org/abs/2602.20408
  • Doshi, A. R., & Hauser, O. P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 10(28), eadn5290. https://doi.org/10.1126/sciadv.adn5290
  • Duan, P., Warner, J., Li, Y., & Hartmann, B. (2024a). Generating Automatic Feedback on UI Mockups with Large Language Models. CHI 2024. https://doi.org/10.1145/3613904.3642782
  • Duan, P., Cheng, C.-Y., Li, G., Hartmann, B., & Li, Y. (2024b). UICrit: Enhancing Automated Design Evaluation with a UI Critique Dataset. UIST 2024. https://doi.org/10.1145/3654777.3676381
  • Jansson, D. G., & Smith, S. M. (1991). Design fixation. Design Studies, 12(1), 3–11. https://doi.org/10.1016/0142-694X(91)90003-F
  • Li, R., Zhang, Y., & Yang, D. (2024). Sketch2Code: Evaluating Vision-Language Models for Interactive Web Design Prototyping. arXiv preprint. https://arxiv.org/abs/2410.16232
  • Luera, R., Rossi, R., Dernoncourt, F., et al. (2025). MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces. arXiv preprint. https://arxiv.org/abs/2510.08783
  • Meincke, L., Mollick, E. R., & Terwiesch, C. (2024). Prompting Diverse Ideas: Increasing AI Idea Variance. SSRN / arXiv preprint. https://arxiv.org/abs/2402.01727
  • Paton, B., & Dorst, K. (2011). Briefing and reframing: A situated practice. Design Studies, 32(6), 573–587. https://doi.org/10.1016/j.destud.2011.07.002
  • Suh, S., Chen, M., Min, B., Li, T. J.-J., & Xia, H. (2024). Luminate: Structured Generation and Exploration of Design Space with Large Language Models for Human-AI Co-Creation. CHI 2024. https://doi.org/10.1145/3613904.3642400
  • Wadinambiarachchi, S., Kelly, R. M., Pareek, S., Zhou, Q., & Velloso, E. (2024). The Effects of Generative AI on Design Fixation and Divergent Thinking. CHI 2024. https://doi.org/10.1145/3613904.3642919
  • Zhang, J., Yu, S., Chong, D., Sicilia, A., Tomz, M. R., Manning, C. D., & Shi, W. (2025). Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity. arXiv preprint. https://arxiv.org/abs/2510.01171
  • Zheng, M., Pei, J., Logeswaran, L., Lee, M., & Jurgens, D. (2024). When “A Helpful Assistant” Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models. Findings of EMNLP 2024. https://doi.org/10.18653/v1/2024.findings-emnlp.888

ベンダー一次情報

調査会社と調査

事例と実務家

アクセス日はすべて 2026-09-25。

Footnotes

  1. 中黒でつないだ文字列とダッシュでつないだラベルは、このプロジェクトの日本語文章規範が地の文で禁じている型でもある(.claude/rules/japanese-writing-style.md)。文章の LLM 臭については LLM の文章から LLM 臭を抜く手法と、humanizer をこのプロジェクトに入れる方法 を参照。 ↩


書いた人:小川 修一郎(Design Researcher / Consultant) 経歴を見る →