Notes ・ updated 2026-06-30
生成AI活用エンジニアリングの系譜とデザイン評価
2022年に LLM の商用利用が始まってから4年で、生成AIを活用するエンジニアリング実践を記述する語彙が急速に分化した。 prompt engineering、context engineering、harness engineering、loop engineering はそれぞれ異なる設計対象と異なる責任範囲を指す。 本ノートは各概念を一次ソースから定義し、デザインが関与すべき領域を3つの軸で評価する。
UI 生成エージェントの個別ツールについては vibe-coding-design-production を参照。 AX(Agentic Experience)の産業と学術の対照は agentic-experience-design-synthesis を参照。 デザインエージェントツールの動向は design-agent-tools-landscape-2026、MCP とデザインシステムの統合は mcp-design-agent-integration を参照。
系譜: プロンプトからループへ
4つの段階は入れ子の関係にある。 後者が前者を完全に置き換えるのではなく、設計対象のスコープが段階的に拡大する。 prompt engineering は指示文の設計、context engineering はコンテキストウィンドウ全体の情報環境の設計、harness engineering はモデルの周囲に構築する実行基盤全体の設計、loop engineering はその実行基盤内の自律実行ループの設計を対象とする。
Prompt Engineering: 指示文の設計(2022年以降)
LLM への入力テキスト(プロンプト)を最適化する技術である。 Chain-of-Thought(Wei et al. 2022)、Tree-of-Thought(Yao et al. 2023)など、推論を誘導する手法が2022年から2024年にかけて体系化された。
2025年以降、推論誘導はモデル自体に内蔵された。 GPT-5 の reasoning tokens、Claude Opus の extended thinking、DeepSeek R1 のネイティブ CoT により、設計の焦点は「推論の仕方を教える」から「推論トークンをいつ使うか設計する」へ移った1。
「prompt engineering」という語は死んでいない。 OpenAI は2026年時点でも公式ドキュメントでこの語を維持している2。 ただし実態としては、単発の指示文最適化から、動的にコンテキストを組み立てるシステム設計へ重心が移っており、その移行先に名前を与えたのが次の「context engineering」である。
Context Engineering: 情報環境の設計(2025年)
Lutke(Shopify CEO)が2025年6月にこの語を提唱した3。
“I really like the term ‘context engineering’ over prompt engineering. It describes the core skill better: the art of providing all the context for the task to be plausibly solvable by the LLM.”
Karpathy は即座にこの語を支持した4。
“context engineering is the delicate art and science of filling the context window with just the right information for the next step.”
Anthropic は2025年9月に技術定義を公式化した5。 「推論呼び出しごとに最適なトークンの集合をキュレーションし維持する戦略の総体」であり、構成要素として system prompts、ユーザーメッセージ、ツール定義と結果、会話履歴、取得した知識(RAG)、構造化された出力ガイドラインを挙げた。
Chase(LangChain CEO)はこの概念を端的に要約した6。 「ほとんどの場合、エージェントが安定して動かないのは、適切なコンテキスト、指示、ツールがモデルに渡されていないことが原因だ」。
Anthropic はさらに context rot の概念を提示した。 コンテキストは時間とともに腐敗し、古い情報がエージェントの判断を歪める。 鮮度管理は情報アーキテクチャの問題であり、デザインの関与が構造的に求められる領域になる。
学術的な体系化も進んだ。 Mei et al.(2025)は166頁のサーベイ論文で、context retrieval / generation、processing、management の基礎構成要素を分類した7。
Willison は prompt engineering を擁護する立場から、context engineering の方が実態に近い語であることを認めた8。 Gartner は「context engineering is in, prompt engineering is out」と宣言し、2028年までに80%の AI ツールに出現すると予測した。
Harness Engineering: 実行基盤の設計(2025末から2026年)
Anthropic が2025年11月に体系化し9、OpenAI が2026年2月に自社版を公開した10概念である。 「モデルの周囲に構築するすべてのもの」をエンジニアリング対象とし、「context engineering」を包含するより広い枠組みになる。
Trivedy(LangChain)が2026年3月にこの概念を定式化した11。 Agent = Model + Harness。 ハーネスだけを変更してコーディングエージェントを Top 30 から Top 5 に改善した事例がある。 ハーネスの構成は5層に分かれる。 ツールオーケストレーション、検証ループ、コンテキストとメモリ、ガードレール、可観測性である。
Anthropic の設計原則は次の一文に集約される12。
“Every component of an agentic harness encodes an assumption about what the model can’t do on its own.”
ハーネスの各部品は「モデルが自力でできないこと」についての仮定を体現している。 モデルの能力が向上すれば、その仮定は古くなり、該当する部品は外せる13。
Osmani はこの構造を端的に述べた14。 「そこそこのモデルに優れたハーネスを組み合わせた方が、優れたモデルに粗末なハーネスを組み合わせるより勝つ」。
OpenAI は Codex エージェントのみで約100万行のコードを5ヶ月で構築した事例(約1,500 PR、手書きコード0行)を示した10。 AGENTS.md は「百科事典ではなく目次」として扱うべきだとした。 巨大な指示ファイルはタスクやコードに使えるコンテキストを圧迫するためである。
Claude Code は「harness engineering」の実装例そのものでもある。 2026年6月の公式記事で7つの instruction delivery method を体系化した15。 CLAUDE.md(プロジェクト規約)、Rules(制約、パススコープ対応)、Skills(手順型ワークフロー、progressive disclosure でトークン節約)、Hooks(決定的制御、linter 実行、破壊的コマンドのブロック)、Subagents(別コンテキストでのタスク分離)、Settings(ツール許可と禁止)、MCP servers(外部ツール統合)である。
コストは高い。 Anthropic の実測では、マルチエージェント構成はトークン消費が15倍、ハーネスのオーケストレーションはコスト全体が20倍になる16。
Loop Engineering: 自律実行ループの設計(2026年6月)
4段階のなかで最も新しい。 Osmani が2026年6月7日にブログ記事 “Loop Engineering” でこの語に名前を与えた17。 翌日、Steinberger(OpenClaw / OpenAI)の X 投稿が650万表示を記録し、概念が急速に広まった18。
“You shouldn’t be prompting coding agents anymore. You should be designing loops that prompt your agents.”
Cherny(Anthropic、Claude Code 責任者)は2026年6月21日の講演で裏付けた19。
“I don’t prompt Claude anymore… My job is to write loops.”
Loop engineering は、エージェントに直接プロンプトを書くのではなく、エージェントにプロンプトを与えるループ(実行、評価、再実行のサイクル)そのものを設計する実践を指す。
先行する概念との関係は次のとおりである。
ReAct-style reasoning loops(2022)から AutoGPT(2023)、bash の one-liner ループ(2025)を経て、Claude Code の /loop や /goal コマンドに至る productized loops が技術的基盤になった。
「loop engineering」は「harness engineering」の上位概念ではなく、ハーネスの中の「実行ループ設計」に焦点を絞った概念である。
同時に批判も広まった。 「loopmaxxing」(無限にループさせれば解決するという誤解)への警告が複数のソースから出ている20。 コスト膨張、mode collapse(出力の均質化)、可観測性の低下がリスクとして指摘されている。
横断する実践
Vibe Coding、Agentic Engineering
Karpathy が2025年2月に投げた「vibe coding」は、AI の提案をレビューせずに受け入れる制作スタイルを指す21。 Willison が2025年10月に提案した「vibe engineering」は、品質と信頼性を維持しつつ AI で加速する実践で、vibe coding の対義にあたる22。 Karpathy が2026年4月に定義した agentic engineering は、taste、engineering、design の責任は人間にあり、エージェントは誤りうる存在だという構造を明示した23。 詳細は vibe-coding-design-production を参照。
Eval Engineering: 評価パイプラインの設計
LLM アプリケーション(特にエージェント)の評価パイプラインを設計し運用する実践である。 特定の造語者はいないが、2025年から2026年にかけて「AI eval engineer」というロールが定着しつつある24。 Husain と Shankar が2,000人以上(OpenAI や Anthropic のチームを含む)を訓練し、Evaluation-Driven Development(EDD)という開発手法も2026年に登場した。
NNg の Elman はデザイナーの中核スキルが「厳密な評価基準の定義」へ移行すると論じた25。 Judge-Evaluate-Iterate ループ を提案し、(1) ユーザーリサーチに基づく判定基準の定義、(2) 実際の出力への適用(LLM-as-a-judge でスケール。LLM-as-a-Judge の文献地図)、(3) 結果に基づくイテレーションの3ステップで、デザイン critique を AI 時代に再定義した。 「eval engineering」とデザインの接点はここにある。
対照表
| 段階 | 命名者(年) | 設計対象 | ボトルネック | デザインの関与 |
|---|---|---|---|---|
| Prompt engineering | 複数(2022以降) | 指示文 | どう言えば動くか | 限定的 |
| Context engineering | Lutke(2025-06) | 情報環境全体 | 何を見せるか | 構造的(デザインシステムのコンテキスト化、意図モデリング、context rot) |
| Harness engineering | Anthropic(2025-11)/ OpenAI(2026-02) | 実行基盤全体 | 何で囲むか | 新領域(監視 UX、委任インターフェース、コスト制約下の設計) |
| Loop engineering | Osmani(2026-06-07) | 自律実行ループ | どう回すか | 評価ループの設計、loopmaxxing の抑制 |
| 横断する実践 | 命名者(年) | 位置づけ | デザインとの関係 |
|---|---|---|---|
| Vibe coding | Karpathy(2025-02) | 責任なき制作 | 品質判断の不在 |
| Agentic engineering | Karpathy(2026-04) | エージェント操縦の専門職 | taste と design が名指し |
| Eval engineering | 複数(2025以降) | 評価パイプラインの設計 | 評価基準の定義がデザインの中核 |
デザインからの評価: 3つの軸
2026年中盤時点で、デザインと AI エンジニアリングの交差領域に3つの構造的な軸が見える。
軸1: Context Architecture(デザインの知をエージェントに渡す)
NNg の Perez は2026年6月に context architecture を提案した26。 情報アーキテクチャ(IA)の原則を AI システムに適用する概念であり、「prompt engineering」「context engineering」のさらに上位に位置づけた。 7つのコンテキスト層(system instructions、RAG、skills、tools / MCP、長期メモリ、会話メモリ、ユーザープロンプト)を定義し、4つの IA 原則(構造化、発見可能性、メンタルモデル整合、メモリ設計)で統治する。 「量より構造」であり、命名、関係性、制約は中立な選択ではないとした。
この概念の具体的な実装が DESIGN.md である。 Google Labs が2026年4月に公開した仕様で27、YAML front matter(machine-readable なデザイントークン)と Markdown(human-readable なデザイン意図)を組み合わせる。 Claude Code、Cursor、Copilot 等がデザイン判断をコンテキストとして消費する仕組みであり、v0.3.0(2026-06-15)時点で11,000以上の GitHub stars を獲得した。
Atlassian はこの仕様を検証し、MCP サーバー経由のオンデマンド配信が「DESIGN.md」の全量ロードより精度4.9%向上、エラー11%減、速度34%向上、トークン16%節約という結果を報告した28。 デザインシステムの規模が大きい場合、静的なファイルよりも動的な配信が有効である。
Figma は Config 2026 で MCP 統合を発表し、サードパーティエージェントが Figma ファイルのトークン、コンポーネント、変数を構造化データとして読み書きできるようにした29。 スクリーンショットを推論するのではなく、デザインシステムの構造そのものをコンテキストに供給する方向になる。
デザインシステムの成熟度がエージェント出力品質の上限を決める(学術文献とベンダー5社による裏づけ)。 この知見は mcp-design-agent-integration で整理した Vercel の実験(15ツールから1ツールへ削減して成功率80%から100%、速度3.5倍)と整合する。
軸2: Evaluation as Design(評価基準の定義への移行)
Maeda は2026年3月の SXSW で「UX から AX(Agentic Experience)へ」の移行を論じた30。 Norman の「実行の淵」(gulf of execution) から「評価の淵」(gulf of evaluation) への転換であり、エージェントがタスクを代行する世界では、デザインの問題は「どう実行を助けるか」から「実行結果の良し悪しをどう判断させるか」に変わる。
Karpathy が「agentic engineering」で名指しした taste は、デザインの美的感覚というよりシステム設計の判断力に近い31。 Sequoia AI Ascent 2026 での具体例がそれを示す。 エージェントが Stripe 購入を Google アカウントと email で紐付けるコードを書く。 技術的に動作するが、persistent user ID を使うべきだと判断できる能力が taste だとした。
Zhu et al.(2026)は TASTE データセットを発表し、プロのデザイナーが9次元(タイポグラフィ、美的感性、空間設計、トーン等)で AI 生成グラフィックを評価するベンチマークを構築した32。 現行の VLM ジャッジはデザイナーの判断を下回るが、小規模の学習済みモデルで差を縮められることを実証した。
NNg の Elman が提案した Judge-Evaluate-Iterate ループは、デザイン critique をエンジニアリングプロセスに接続する方法を示す25。 「eval engineering」の「何を測るか」を定義する行為が、デザインの中核的職能になりつつある。
軸3: 職能境界の緊張
NNg の Gibbons は2026年6月に「AI が生んだ4つのデザインの仕事」を分類した33。 (1) AI をツールとして使うデザイン、(2) AI 製品のインターフェース設計、(3) エージェントが解釈できるデータ構造と指示の設計(IA に近い)、(4) モデルの振る舞い、評価基準、原則の定義(エンジニアリングとの協働)。 (3) と (4) はデザインとエンジニアリングの境界にある。
Smashing Magazine は2026年4月に「production-ready がデザインの成果物になりつつある」と報告した34。 事業がアウトプット速度を体験品質より重視する傾向が強まり、デザインとエンジニアリングの統合圧力が増している。
NNg の “State of UX 2026” はこれに反論する35。 AI が代替しているのは「もともとデザインではなかった部分」であり、curated taste、リサーチに裏付けられた文脈理解、批判的思考は自動化が困難だとした。
Figma は Config 2026 で Code Layers を発表し、リポジトリをクローンしてフローを編集可能なデザインレイヤーに変換する機能を示した29。 デザインとコードの境界を技術的に融合させる方向であり、この緊張は今後さらに強まる。
Zhuo は「AI が量産した世界で真の品質は narrative depth、deliberate craft、cultural resonance にある」と論じた36。 量産可能な成果物の品質は AI で底上げされるが、デザイナーの価値はその上にある判断と選択に移る。
参照文献
- Tobi Lutke. “context engineering” 命名. 2025-06-19. https://x.com/tobi/status/1935533422589399127
- Andrej Karpathy. “vibe coding” 投稿. 2025-02-02. https://x.com/karpathy/status/1886192184808149383
- Andrej Karpathy. context engineering への支持. 2025-06-25. https://x.com/karpathy/status/1937902205765607626
- Andrej Karpathy. Sequoia AI Ascent 2026 での taste 論. https://karpathy.bearblog.dev/sequoia-ascent-2026/
- Andrej Karpathy. “agentic engineering” 定義. 2025-12 / 2026-04. [要一次検証: X 投稿の具体 URL]
- Anthropic Applied AI. “Effective context engineering for AI agents.” 2025-09-29. https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
- Anthropic. “Building effective agents.” 2024-12. https://anthropic.com/research/building-effective-agents
- Anthropic. “Effective harnesses for long-running agents.” 2025-11-26. https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents
- Anthropic. “Harness design for long-running apps.” 2026-03-24. https://www.anthropic.com/engineering/harness-design-long-running-apps
- Anthropic. “Scaling Managed Agents.” 2026-04-08. https://www.anthropic.com/engineering/managed-agents
- Anthropic. “Steering Claude Code.” 2026-06-18. https://claude.com/blog/steering-claude-code-skills-hooks-rules-subagents-and-more
- OpenAI. “Harness engineering.” 2026-02-11. https://openai.com/index/harness-engineering/ [要一次検証: 403 で直接取得不可、InfoQ 経由の二次情報に依拠]
- Addy Osmani. “Loop Engineering.” 2026-06-07. https://addyosmani.com/blog/loop-engineering/
- Addy Osmani. “Agent Harness Engineering.” 2026-04-19. https://addyosmani.com/blog/agent-harness-engineering/
- Addy Osmani. “Vibe Coding Is Not the Same as AI-Assisted Engineering.” 2025-11-30. https://medium.com/@addyosmani/vibe-coding-is-not-the-same-as-ai-assisted-engineering-3f81088d5b98
- Simon Willison. “Context engineering.” 2025-06-27. https://simonwillison.net/2025/jun/27/context-engineering/
- Simon Willison. “Vibe engineering.” 2025-10-07. https://simonwillison.net/2025/Oct/7/vibe-engineering/
- Harrison Chase (LangChain). “The rise of context engineering.” 2025-06-23. https://www.langchain.com/blog/the-rise-of-context-engineering
- Viv Trivedy (LangChain). “The Anatomy of an Agent Harness.” 2026-03. https://www.langchain.com/blog/the-anatomy-of-an-agent-harness
- Google Labs. DESIGN.md specification. v0.3.0 2026-06-15. https://github.com/google-labs-code/design.md
- Atlassian. “DESIGN.md: What We Learned.” 2026. https://www.atlassian.com/blog/ai-at-work/atlassians-design-md-is-here-what-we-learned-testing-portable-design-context-in-practice
- Figma. Config 2026 recap. 2026-06-25. https://www.figma.com/blog/config-2026-recap/
- Paz Perez (NNg). “Context Architecture.” 2026-06-12. https://www.nngroup.com/articles/context-architecture/
- Sarah Gibbons (NNg). “The Four Design Jobs AI Created (So Far).” 2026-06-05. https://www.nngroup.com/articles/design-jobs-ai-created/
- Adam Elman (NNg). “The Core Skill of Design in the AI Era: Critique.” 2026-06-12. https://www.nngroup.com/articles/ai-era-critique/
- NNg. “State of UX 2026.” https://www.nngroup.com/articles/state-of-ux-2026/
- John Maeda. “Design in Tech Report 2026: From UX to AX.” 2026-03. https://johnmaeda.medium.com/design-in-tech-report-2026-from-ux-to-ax-f9d83164f4d2
- Julie Zhuo. “The AI Quality Coup.” 2025-04. https://lg.substack.com/p/the-ai-quality-coup
- Smashing Magazine. “production-ready becomes design deliverable.” 2026-04. https://www.smashingmagazine.com/2026/04/production-ready-becomes-design-deliverable-ux/
- Zhu et al. “TASTE dataset.” 2026-05. https://arxiv.org/abs/2605.20731
- Mei et al. “A Survey of Context Engineering for Large Language Models.” 2025-07-17. https://arxiv.org/abs/2507.13334
- BDTechTalks. “Demystifying loop engineering.” 2026-06-22. https://bdtechtalks.com/2026/06/22/ai-loop-engineering/
- SiliconANGLE. “Eval engineering.” 2026-05-17. https://siliconangle.com/2026/05/17/eval-engineering-missing-piece-agentic-ai-governance/
- IBM. “Prompt Engineering Guide 2026.” https://www.ibm.com/think/prompt-engineering
- OpenAI. “Prompt Engineering Guide.” https://developers.openai.com/api/docs/guides/prompt-engineering
Footnotes
-
ibm.com/think/prompt-engineering ↩
-
developers.openai.com prompt engineering guide ↩
-
x.com/tobi/status/1935533422589399127 (2025-06-19) ↩
-
x.com/karpathy/status/1937902205765607626 (2025-06-25) ↩
-
anthropic.com/engineering/effective-context-engineering-for-ai-agents (2025-09-29) ↩
-
langchain.com/blog/the-rise-of-context-engineering (2025-06-23) ↩
-
arxiv.org/abs/2507.13334 (2025-07-17, 166頁) ↩
-
simonwillison.net/2025/jun/27/context-engineering/ ↩
-
anthropic.com/engineering/effective-harnesses-for-long-running-agents (2025-11-26) ↩
-
openai.com/index/harness-engineering/ (2026-02-11) [要一次検証] ↩ ↩2
-
langchain.com/blog/the-anatomy-of-an-agent-harness (2026-03) ↩
-
anthropic.com/engineering/harness-design-long-running-apps (2026-03-24) ↩
-
anthropic.com/engineering/managed-agents (2026-04-08) ↩
-
addyosmani.com/blog/agent-harness-engineering/ (2026-04-19) ↩
-
claude.com/blog/steering-claude-code-skills-hooks-rules-subagents-and-more (2026-06-18) ↩
-
Anthropic 実測。マルチエージェント 15× トークン、harness 20× コスト ↩
-
addyosmani.com/blog/loop-engineering/ (2026-06-07) ↩
-
Peter Steinberger X 投稿 (2026-06-08)。650万表示 [要一次検証: 具体 URL] ↩
-
Boris Cherny (Anthropic) Meta 講演 (2026-06-21) [要一次検証: 録画/transcript] ↩
-
bdtechtalks.com/2026/06/22/ai-loop-engineering/ (2026-06-22) ↩
-
x.com/karpathy/status/1886192184808149383 (2025-02-02) ↩
-
simonwillison.net/2025/Oct/7/vibe-engineering/ ↩
-
Karpathy X (2025-12 / 2026-04) [要一次検証: 具体 URL] ↩
-
siliconangle.com eval engineering (2026-05-17) ↩
-
nngroup.com/articles/context-architecture/ (2026-06-12) ↩
-
github.com/google-labs-code/design.md (2026-04-21, v0.3.0 2026-06-15) ↩
-
atlassian.com DESIGN.md テスト結果 (2026) ↩
-
johnmaeda.medium.com/design-in-tech-report-2026-from-ux-to-ax-f9d83164f4d2 (2026-03) ↩
-
karpathy.bearblog.dev/sequoia-ascent-2026/ ↩
-
arxiv.org/abs/2605.20731 (2026-05) ↩
-
nngroup.com/articles/design-jobs-ai-created/ (2026-06-05) ↩
-
smashingmagazine.com/2026/04/production-ready-becomes-design-deliverable-ux/ (2026-04) ↩
-
nngroup.com/articles/state-of-ux-2026/ ↩
-
lg.substack.com/p/the-ai-quality-coup (2025-04) ↩