ノート
AI とデザインの調査、実験、考察を、つくる過程もあわせて公開しています。
公開ノート 154 件。LLM Wiki 方式で作っています。 仕組みを見る → ノートに聞く → 引用ネットワーク(ノートと文献のつながり)を見る →
2026年9月
-
know-who はどう蓄積されるのか:誰が何を知っているかの知識ができる経路と失われ方
2026-09-28
know-who(誰が何を知っていて、誰に聞けばよいかの知識)がどう蓄積されるかを、学術文献 17 件から整理した。OECD(1996)は Lundvall と Johnson(1994)の分類を引き、know-who を社会的な実践の中で学ばれ、正式な経路では移しにくい知識とした。蓄積の経路は五つに分けられる。一つめは一緒に働いた経験で、交際中の二人は即席の二人より多く覚え(31.40 語対 27.64 語、Wegner ら 1991)、一緒に訓練された集団は別々に訓練された集団より良い無線機を組んだ(Liang ら 1995)。Wegner らは「誰が何を知っているか」の目録の更新元を、性別などの既定値、引き受けの交渉、自己開示から推す相対的な得意、情報に最初か最も長くか最も最近触れたか、の四つに分けた。二つめは会話と探索で、人は候補を絞り込んでから選び、足りなければ上へ回す(McDonald & Ackerman 1998)。三つめは仲介で、組織の顔つなぎ役が紹介を担い、集団のあいだの構造的空隙にいる管理職ほど良いアイデアを出していた(Burt 2004、673 人)。四つめは人工物で、変更履歴は手がかりになるが小さな変更と大きな変更を見分けにくい。五つめは他人の会話が見えることで、社内 SNS を 6 か月使った部署だけ「誰が何を知っているか」の正確さが 31%、「誰が誰を知っているか」が 88% 上がった(Leonardi 2015)。失われ方にも型があり、メンバーが抜けても know-who の発達したチームは持ちこたえるが、要のメンバーが抜けるとその利点が減る(Christian ら 2014、78 チーム)。AI については、AI から情報を得ることが高成績のチームでだけ新しい仮説や発言と結びつき(Bienefeld ら 2023)、研究室のチャットボットでは学生の 95 の質問のうち共有されたのは 11 にとどまり、誰が何に困っているかが指導者に見えにくくなった(Lee ら 2026)。
-
AI とデザイン 週次ウォッチ(2026-09-21〜09-28)
2026-09-28
直近7日間の「AIとデザイン」動向をT1vベンダー一次、T2公的機関と標準、T3専門家私見の3ティアで収集した統合要約。Framerはデザインシステムや文体の指示をエージェントに保存させるSkillsを出し、FigmaのVP of Productも同じ週に、繰り返す作業をスキルやプラグインにしてチームで使い回す道筋を書いた。WebflowはMCP経由でエージェントがインタラクションを組めるようにした。モデル側ではClaude Opus 5.5が出て同日にLovableへ入り、OpenAIはSora 2のAPIを後継の指定なしで止めた。T2は窓内の新規公表を確認できず、前回持ち越したNISTの09-28開始は一次ページでは「TBD」だった。T3ではJakob Nielsenが視覚障害者向けエージェントと合成ユーザーの研究を紹介し、Luke Wroblewskiはツールを作らず成果を直接届ける設計を提案した。
-
LLM の迎合はなぜ起きるのか:選好学習、内部回路、入力の形から見る発生の仕組み
2026-09-27
LLM の迎合(sycophancy)がなぜ起きるのかを、2022–2026 年の学術文献 37 件から整理した。発生源は一つではない。規模と指示チューニングは利用者の意見を繰り返す傾向を強め(PaLM-8B→62B で 19.8% 増、指示チューニングで 26.0% 増)、人間の選好データでは「利用者の信念に合うこと」が選好を最もよく予測する特徴の一つになる(Sharma ら 2023)。選好モデルは誤解を肯定する迎合応答を 95% の割合で基準の正しい応答より選び、利用者自身も迎合的なモデルをより信頼し、好む(Cheng ら 2026、Science)。Shapira ら(2026)は、選好データのこの偏りが報酬への最適化で増幅される条件を形式化した。モデルの内部では、誤りを検知する信号は残ったまま、後段の層やアテンションヘッドで出力が利用者の側へ切り替わるという像が複数のプレプリントで一致しつつある(「知っていて従う」)。入力の形も効き、同じ主張でも質問形なら迎合はほぼゼロで、平叙文との差は 24 ポイントあった(UK AISI 2026)。緩和策は合成データ、局所的な微調整、活性化ステアリング、質問への言い換えと揃ってきたが、迎合を抑えると根拠のある意見変更まで抑えるというトレードオフがある。外部の確かなフィードバックのない自己修正は精度を下げることがあり(Huang ら 2024)、根拠を伴わない「見直して」はそれ自体が押し返しとして働く。
-
AI のレビューと修正のループは、なぜ 10 円専用の投入口を作ってしまうのか
2026-09-27
AI にレビューさせ、別の AI に直させるループでは、本質的でない指摘に「指摘は妥当です」と応じて、使われない機能を積み増すことがある。catnose の戯画(2026-09-26)で問題の指摘に付いていた [P2] と [P3] は、OpenAI Codex のレビュー規準ではそれぞれ「いつか直す」「あれば良い」を意味する。レビュー側はすでに急がないと言っていて、壊れているのは受け取る側である。受け取る側には、指摘を採るかどうかを決める段がない。迎合は選好学習から来る一般的な性質で(Sharma ら 2023)、外部の確かなフィードバックのない自己修正は精度を上げず、むしろ下げることがある(Huang ら 2024、Kamoi ら 2024)。もう一つの LLM の指摘は、確かな外部フィードバックに当たらない。ベンダーはレビュー側で、重大度の定義、GitHub には P0 と P1 だけを出す設定、Nit の上限、再レビューで新しい Nit を出さない規則、マージを止めない既定を用意している。修正側では、Anthropic が「起こり得ないシナリオへの検証を足さない」「仮想の将来要件のために設計しない」「特定の入力でしか動かない解を作らない」という指示文を公式に示す。OWASP AISVS は、AI エージェントを人間のレビュアーに数えず、自分の生成物を自分で承認させないことを要件にしている。人間なら最初に問う二つの問い(その利用者に対応する必要があるか、対応するならその方針は汎用的か)は、ループの外にいる指揮者の仕事として残る。この二つを採否の段に書き込み、既定の答えを「対応しない」に置くのが、2026 年時点で資料から組み立てられる作法である。
-
RAG は使われなくなったのか、何が置き換わり、何が残ったか
2026-09-27
「RAG はもう使われなくなった」という噂は、利用の実態としては当たっていない。企業の RAG 採用率は 2023 年の 31% から 2024 年に 51% へ伸び(Menlo、600 名)、2025 年の調査でも prompt 設計に次ぐ 2 位にある。Google は 2025-11 に Gemini API へ managed RAG を組み込み、Microsoft は複合質問を分解する agentic retrieval を出した。噂の出どころはコーディングエージェントで、Claude Code と Cline は埋め込みの索引をやめ、モデルが grep とファイル探索で辿る方式を選んだ。理由はコードが速く変わり索引が古くなること、チャンク化でコードの論理が切れること、索引の管理と権限の問題である。死亡記事を書いた Fintool の創業者も、自社ではいまもハイブリッド検索を回している。退いたのは、1 回だけ埋め込み検索して上位を詰め込む素朴な構成であり、検索はエージェントが何度も呼ぶ道具に移った。long context は約 20 万トークン未満なら検索の代わりになるが、文脈が伸びるほど想起が落ちるので、選んで入れる仕事は残る。TypeSafe AI の Jev は検索をしないが、再順位づけ、passage の選別、引用の検査という RAG の判定段に入る部品として公式 cookbook に載っている。
-
いま新規性を生む人に何が要るのか:資質、態度、姿勢、能力、スキルを分けて確かめる
2026-09-26
LLM の研究アイデアは新規性の評点で専門家を上回ったが、実装すると評価を落として順位が逆転し(Si ら)、AI を使う科学者は論文と引用を大きく伸ばす一方で科学全体の話題は縮んだ(Hao ら、Nature 2026)。新しく見えるアイデアが希少でなくなったいま、新規性を生む人に何が要るのかを、求められるものを資質、態度、姿勢、能力、スキル、経歴に分けて確かめた。新たに集めた学術文献56件(本文ではこのうち36件に、姉妹ノートで確かめた文献など13件を加えて使う)と、AI 提供者、公的機関、調査会社、第一線の研究者の最新資料70件(本文では22件)から整理する。資質では、好奇心と創造性の相関は r = .41 だが他者が評定した創造性とは .16 にとどまり、開放性は .22、リスクを好む態度は .08 だった。grit のうち努力の粘りは創造的達成を正に、興味の一貫性は負に予測した。能力では、発散的思考が創造的達成を予測する程度は r = .216 と小さく、人は自分の良いアイデアをおおむね見分けられるが、不確実さを嫌う場面では創造的な案を見分けにくくなる。問題を見つける課題は発散の課題より独創的な回答を引き出した(g = 0.887)。経歴では、良い仕事は探索の後に焦点を絞る時期に固まり、以前の仕事から遠く離れるほど影響が下がる pivot penalty は50年で大きくなった。訓練の平均効果は g = 0.53 で、収束的思考を伸ばす方法が発散を伸ばす方法より効いた。生成 AI の普及で比重が移ったのは、生成から、実装に耐える案を選ぶこと、出力を検証すること、自分の領域の力に根ざした自信、集団の多様性を削らない方向を選ぶことへである。AI 提供者の資料も、人間に研究目標の設定、自動で検証できる形への定式化、選択、現実との照合を残しており、資金配分機関は判断を AI に委ねない規則を書き始めた。第一線の研究者がそろって口にする taste を測った実証研究は見つからず、その中身を問いの選択、評価と選択、領域の力の三つに分けて既存の実証に対応づけた。
-
新規性の主張はどう確かめ、どう守り、どう書くか:投稿前の確認から論文の束まで
2026-09-26
著者は投稿前と査読中に新規性の主張をどう確かめて守るのか、そして論文を何から順に決めて書くのかという二つの問いに、医学の evidence-based research、査読研究、学会と出版規範の公式文書、先取権の経済学、LLM による新規性チェックの評価、編集者論説と執筆過程研究から答えた文献ノート。学術文献76件(プレプリント1件を含む)と公式文書12件の計88件を集め、本文では67件を使う。確認の側では、RCT が先行試験の中央値21%しか引用せず(Robinson & Goodman)、プロトコルどおりの検索は一次資料の30%しか拾えない(Greenhalgh & Peacock)ことから、「我々の知る限り」は検索範囲の申告にすぎないことを示す。判定の側では、査読者が originality を7種の新しさとして語り(Guetzkow ら)、査読者間の一致は ICC .34、κ .17 にとどまり(Bornmann ら)、妥当性だけを見るはずの PLOS ONE でも共著ネットワーク上の近さで評価が動く(Teplitskiy ら)ことを確認する。学会規程は新規性を有効性や信頼性と明示的に交換し(電子情報通信学会)、原稿種別で基準を変える(日本デザイン学会)。先を越されたチームは被引用が21%少なく(Hill & Stein)、競争の激しい題材ほど質が落ちるため、プレプリントの日付と scoop protection が守りの手段になる。LLM の新規性チェックは既知の概念を新規と誤判定し、生成案の24%は既存研究の言い換えだった。執筆の側では、トピック選択で不採択の種が蒔かれ(Colquitt & George)、書く過程そのものが主張を見つけ(Galbraith)、rebuttal は最終スコアをほとんど動かさない(Gao ら)。最後に、投稿前に通す確認と執筆計画の立て方を、各段に根拠文献を付けた手順として示す。
-
新規性の芽はどこで見つかるのか:驚き、読み直し、見かけだけの新規性
2026-09-26
新規性がないように見える題材でも見方を変えれば新規性が出る、という見込みがどの条件で成り立ち、どの条件で見かけだけの新しさに終わるのかを、研究者が新規性の芽をどこでどう見つけるかの実証研究と、題材を読み直す方法論の文献から検討した文献ノート。学術文献81件を集め、本文では64件を使う。芽の出どころでは、成功した科学者は研究外の活動を研究と統合していて(Root-Bernstein ら)、集団をまたぐ位置の人ほど良いアイデアを出して評価される(Burt)一方、周縁にいること自体は革新を予測せず(Gieryn と Hirsh)、過少代表の集団が出した新規性は後続の研究に取り上げられにくい(Hofstra ら)ことを示す。偶然の発見は4つの類型と4つの機構に分かれ(Yaqub)、気づきは予想との食い違いとして起きるが、異常なデータへの7つの反応のうち6つは既存の理論を守る(Chinn と Brewer)。読み直しの操作は、構成概念を分ける、文脈を替える、水準を替える、同じデータを別の手続きで読む、操作化を替える、現象に戻る、異化する、の7つに整理し、それぞれに見かけに終わる条件を対にした。職務満足と組織コミットメントは測定誤差を補正すると .91 で相関し(Le ら)、外国生まれと非識字の相関は個人では .118 なのに州単位では −.526 と符号が逆になり(Robinson)、同じデータを分析した29チームのオッズ比は0.89から2.93に散らばった(Silberzahn ら)。見方を変える操作を、変異を生む段階と選び抜く段階の循環(Fiedler)のうち前者に置き、後者で通す検査を操作ごとに示す。最後に、予想を先に書くことから分野の文献で確かめることまでの10段の手順を、各段に根拠文献を付けて示す。
-
業務アプリの UI をひとつに決めるまで:案を狭めるもの、比べ方、決める人
2026-09-25
業務アプリの UI を無数の案から一つに決めるまでの材料と手順を、ISO 9241-210 と GOV.UK などの公的資料、NN/g と MeasuringU の調査、SAP、IBM、Salesforce、Atlassian、Basecamp、GV の一次資料、日本の業務 SaaS(SmartHR、マネーフォワード、ラクス、LayerX ほか)とソシオメディアの証言から整理した。案の多くは描く前に消える。対象にする利用者と外す利用者、成功の測り方(Carbon は作業時間と離脱率)、端末と入力方式(Fiori の cozy と compact)、用途から選ぶ画面の型(floorplan)と業務のオブジェクト(OOUI)、時間の予算(Shape Up の appetite)、アクセシビリティの要件が空間を狭める。残った空間では 3 案以上を粗く並行して作る。NN/g の 1996 年の事例では、並行デザインは費用が 73% 多く、改善は 70%(従来の反復は 18%)で、敗れた案の良い点を統合すると最良案を選ぶだけより高かった。比べる材料は代表タスクの少人数テストで、初心者と熟練者で見つかる問題は半分ほどしか重ならなかった。SUS で基準値との 5 点差を検出するには 58〜80 名が要り、少人数のテストは案を落とす根拠には向くが、最後の一つを選ぶ根拠にはなりにくい。最後の一つは、DACI の Approver、Sprint の Decider、Shape Up の betting table のように、比べる前に決めておいた人が、プロダクトの原則を拠り所に選ぶ。決定は記録され、コンポーネント、型、レビューの項目になって次の画面の案を減らす。業務アプリで迷いやすいところとして、情報密度、熟練者の効率、購入者と利用者の分離、既存業務からの移行、職員向けの画面での公共向けの原則の例外(GOV.UK)を扱う。
-
LLM にデザインを頼む:ありがちな UI に収束させないブリーフ、スキル、工程
2026-09-25
LLM にコードではなくデザインを頼むときの実践を、国内企業の事例、ベンダーの一次資料 16 件、調査会社の資料 7 件、学術文献 26 件から整理した。起点のカナリーの事例では、デザイン哲学を skill にした LLM はトンマナを合わせたが、どの画面もありがちな UI に収束した。ベンダーは原因を訓練データで多数派の「安全な選択」に戻る性質と説明し、学術側は事後学習の選好データにある典型性の偏りが出力分布を尖らせると示す(Zhang et al. 2025)。Anthropic の frontend-design スキルは、Inter などの既定を禁じる版から、題材に根ざしたブリーフ、既定の型の較正、計画を先に見直す 2 パスへと書き換えられた。よく使われる書体を禁じても生成を重ねると次の書体に集まる、とベンダー自身が書いている。発散については、役割名だけのペルソナより手順(CoT)と多様な標本化の手がかりが効くという実験がある(Meincke et al. 2024、Deng et al. 2026)。カナリーの「デザイナー人格」も、名は人格だが中身は出発点と戻り方と不成立の条件を定めた手順である。確認はスクリーンショットと明示的な基準で自動化できるが、LLM の UI 批評は人間に及ばず(Duan et al. 2024)、AI の案を見た人は最初の例に固着しやすい(Wadinambiarachchi et al. 2024)。依頼の型は、ブリーフ、既定の較正、デザインシステムの前に置く発散、デザインシステムでの収束、視覚的な確認、人による選択の順になる。
-
この wiki の引用ネットワーク:note をハイパーエッジとみなした分析と作品
2026-09-25
公開 note 142 本が参照文献節で引いた文献 4,227 件のうち、2 本以上の note に引かれた 445 件を結び目とし、共引用グラフ(エッジ 5,870 本)を Louvain 法で 11 群(モジュラリティ 0.7263)に分けた。群には中身を読んで主題名を付け、論文の割合の低い順に並べた。時間は note が log に初めて出た日で取り、トップページ「関心の推移」の 6 つの時期に分けた。論文の割合が 8 割以上の 7 群のうち 6 群は区間の 7 割以上が一つの時期に集まる一方、ウェブページが 9 割を占める「産業の観測」の群だけが 6 つの時期すべてに現れる。群をまたぐ要の文献は Doshi & Hauser 2024 で、6 つの時期のうち 5 つにわたって 8 本の note に引かれている。サイトの引用ネットワークのページは、この結果を 15 の作品として描く。閲覧のたびに力の計算で配置を生成する 4 つの動く作品(墨流しは描画域と同じ縦横比の平面、織物は枠のない自由な平面、星座は立体射影で写す天球、年輪は時期と群の区画に文献を置く)、群制御の規則で動く 5 つの動く作品(粘菌は Physarum 型の粒子、群れは Couzin の 3 領域モデル、細胞は Primordial Particle System、泡は重み付き重心ボロノイ法、一筆は Swarmalators)、Hierarchical Edge Bundling、Arc Diagram、Streamgraph に拠る 3 つの静止画、群制御で描く 3 つの静止画(枯山水は Vicsek モデル、珊瑚は群ロボットの反応拡散、根は合流するトークン受け渡し)である。その下に、ビルド時のデータで条件を確かめた 5 行の特徴(6 つの時期のすべてに引かれる唯一の群、ほぼ論文だけの群が主に一つの時期に引かれること、同じ note に並ばない群、5 つの時期の note に引かれる均質化の論文、文献を 10 件以上共有する note の組がどれも 3 日以内に書かれていること)を作品の下に並べる。既定の作品は墨流しで、note を書いた順に、note が引いた文献の点の重心へ墨と水の滴を 1 組ずつ落とし、数学的なマーブリングの滴の写像と発散 0 の流れ関数で、早く書かれた note の輪ほど外へ押し出して長く引き伸ばす。文献の点は配置の位置のまま動かさない。「もう一度生成」で変わるのは位置と、位置から決まる線や輪の形だけで、つながりは変わらない。墨流しと星座では、違う群の文献どうしの斥力を同じ群どうしより遠くまで強く届かせ、群を点の粗密だけで読めるようにした。見た目はサイトのテーマで切り替え、ライトは和紙に墨、ダークは暗い面に光を加算で重ねて描く。群は論文の割合の順に、ライトは一つの墨の濃さ、ダークは一つの色相の白い光の明るさで、文献の種類は塗りの円(学術。論文とプレプリント)と輪(実務。企業、公的機関、ニュースやブログなどのウェブ)の 2 つの形で、線が表すつながりの古さは線ごとのにじみ(ライトは墨の広がり、ダークは光の広がり。縁の濃さと粒状感は Curtis et al. 1997 に着想を得た)で表す。織物の糸だけはにじませない。どの作品も、描いている間は細い線で描き、描き終えてから作品ごとの「仕上げ」の文を出して約 10 秒かけてにじみを加える。数え方、力の計算、作品ごとの式と線の作り方(滴の写像、流れ関数と中点法、中心化 Catmull–Rom 曲線、立体射影、一様な 3 次 B-spline、半円、ガウス核)は、実装から書き起こして本文に載せた。
-
ネットワークをデータアートとして描く方法:配置、束ね、時間、流れの文献
2026-09-24
力学配置で描いたネットワークは、そのネットワークの唯一の形に見えるが、実際には多くの並べ方の一つである。力学配置の式(Eades 1984、ForceAtlas2)と球面の上の力学配置(Kobourov と Wampler 2005)、属性で座標を決める hive plot、辺の束ね(Holten 2006)、一本の軸と時間に並べる図法(arc diagram、ThemeRiver、streamgraph、alluvial diagram)、水面に滴を落として模様を作る数学的マーブリング(Lu ら 2012、Jaffer の滴の写像)、データを作品として扱う先行例、線を引くための曲線と数値計算(中心化 Catmull–Rom 曲線、一様 B-spline、中点法、ガウス核、流れ関数)、紙と墨のにじみの表現(Curtis ら 1997 の水彩、Chu と Tai 2005 の MoXi、Guo と Kunii 1991 の墨絵)を、確かめた範囲(本文、要旨、書誌のみ)を添えて並べる。この wiki の /network では、共引用の関係を固定したまま、並べ方だけを方法とシードで替えてこれらを使い分けた。力学配置を置く空間は作品ごとに固定した(墨流しは描画域と同じ縦横比の平面、織物は枠の無い自由な平面、星座は立体射影で写す球面)。シードによる絵の変化は、織物では初期配置の族と力の係数の範囲(ForceAtlas2 の LinLog 型と strong gravity を含む)から、墨流しと星座では初期配置の揺らぎと係数の小さな幅から作った。
-
データビジュアライゼーションとデータアートは何が同じで、何が違うのか
2026-09-22
同じ折れ線グラフでも、新聞に載れば「正確に読ませる図」、美術館にかかれば「データアート」と呼ばれる。両者はデータ、視覚変数、作り手、発表の場を共有しており、素材や道具では区別できない。実証研究は「可視化は正確、アートは美」という通説を両側から崩す。芸術の定義論は三つに割れており(対象の性質で決まる/単一の基準はない/制度が決める)、実証研究は判定者間の一致が低いことを示す。対象の性質だけから判別する方法は成立していない。ただし「どちらとして扱われたか」は客観的に記録でき、要求、意図と発表先、認定制度の三層を問う手続きとして運用できる。
-
「〇〇 Fiction」系の方法は何を考え、何を期待されてきたのか
2026-09-22
SF プロトタイピング、design fiction、critical design と speculative design、diegetic prototype、speculative fiction、experiential futures、social fiction を扱う学術文献を、どこから来た考え方か、互いにどう違うか、導入する側が何を期待してきたかの三点で読んだ。名前はよく似ているが、出どころは SF と技術開発(Johnson、Kirby)、RCA のデザイン批評(Dunne と Raby)、未来学(Candy)、文学のジャンル論(Oziewicz)と別々である。いちばん大きな違いは、作ったフィクションを製品化へ近づけたいのか、製品化から遠ざけて問いを残したいのかにある。Johnson は SF プロトタイプの狙いをイノベーションの促進に置き、Dunne と Raby は critical design の反対語を「現状を補強するデザイン」とした。導入の期待は、組織の予見、責任ある研究とイノベーション(RRI)の予期、HCI での価値の引き出し、倫理教育、周縁のコミュニティの想像の五つに分かれる。企業に持ち込まれた design fiction が現状を肯定する方向へ傾いた事例(Ringfort-Felner ら 2023)や、ギャラリーと特権の内側にとどまるという批判は、この二つの向きのずれとして読める。効果の実証は sf-prototyping-design-fiction-effects-literature に分けた。
-
SF プロトタイピングと design fiction は何をもたらすのか
2026-09-22
SF プロトタイピング(Johnson 2011)と design fiction(Bleecker 2009)の「効果」を扱う学術文献81件を、映画の中の技術が現実を動かす経路、組織の未来洞察、HCI の研究道具、教育の四つの場面に分けて読んだ。確かめられているのは主に、参加者から議論や価値観を引き出せるという点である。HawkEye の配備研究(Noortman ら 2019)は将来技術の帰結について共感的な議論が生まれたと報告し、Afrofuturism を中心に据えたデトロイトのワークショップ(Dillahunt ら 2023)は住民から代替的な経済像を引き出した。一方、学習や組織への効果を統制群つきで比べた研究は本コーパスには見つからず、定量の事前事後比較は大学生83名の作文認識を測った Nicholes(2020)にとどまる。評価の基準そのものが定まっていないこと(Baumer ら 2020)、もっともらしさの追求が欺瞞に近づくこと(Coulton ら 2016)、批判的な未来を想像させたはずの授業で学生が支配的な技術観をなぞってしまうこと(Rahm 2024)も報告されている。
-
創造的な仕事を人と協作すると、どんな社会的調整コストがかかるのか
2026-09-22
人を足しても仕事は人数分には進まず、差分は調整の損失と動機づけの損失(Steiner 1972)、そして助けを得にくいと感じる関係の損失(Mueller 2012)に消える。調整コストは一種類ではなく、段取りと情報の同期、手抜き、評価される気まずさ、対立、解釈の違いのすり合わせ、名前と取り分の交渉という、起きる理由の違う六つに分けて見る必要がある。創造的な仕事では、ブレインストーミングの順番待ち(Diehl & Stroebe 1987)に加えて、語の選択や問題の捉え方という成果物の中身そのものが交渉の対象になるため、調整を段取りの問題だけに切り離しにくい。慣習や transactive memory は調整を安くするが、ブロードウェイの協働ネットワークではまとまりの度合いと成功の関係が逆U字であり(Uzzi & Spiro 2005)、調整の安さと成果は途中から同じ方向に動かない。相手を AI にしても、ロボットの司会は評価懸念の影響を和らげず、人間-AI チームでも手抜きは起き、AI の着想で個々の作品の評価は上がる一方で作品同士が似る(Doshi & Hauser 2024)ため、「AI なら社会的な調整コストはゼロ」とは読めない。
-
LLM の文章から LLM 臭を抜く手法と、humanizer をこのプロジェクトに入れる方法
2026-09-22
LLM 臭の成分を、学術文献 23 件、ベンダー一次資料、Wikipedia の規約、著名スキルから整理した。人は AI の文章を直感では見分けられないが(Jakesch et al. 2023)、語頻度の超過(Kobak et al. 2025)と構文や構成の型は統計的に検出でき、モデル固有の癖は書き換えの後も残る(Sun et al. 2025)。手を入れる地点は生成の前、途中、後の検出、後の書き換えに分かれ、それぞれ効く条件と代償が違う。最も著名な humanizer(GitHub 51,020 stars)は Wikipedia の Signs of AI writing を下敷きにした英語専用のスキルで、25 パターンを 5 群に分け、弱い兆候は複数重なったときだけ直す。このプロジェクトの日本語規範は禁止語を止めているが、否定並列や数を決めた列挙などの型は既存 note に残っている。採用は、規範への型の追記と wiki:lint への報告のみの検出を先に行い、英語版 note に humanizer を vendoring する順が妥当である。
-
ギャルマインドは何として測られたか:8因子の由来と、その限界
2026-09-22
池上桃花ら(駒澤大学)による「ギャルマインド」の工学的操作化を、IWSDS 2026 と CHI EA 2026 の本文から詳細に記述し、その限界を検討する。8因子は一般書1冊から著者らの討議で分解され、基準スコアは第一著者が単独で付与した。予測精度は Spearman ρ=0.198 で信頼区間がゼロをまたぐ。標準化係数の総和 6.587 は誤差 RMSE 8.84 を下回り、モデルが人の間に作れる差より誤差のほうが大きい。CHI EA では対照群を置いた N=24 の実験で PANAS が動いたが、特性的自己効力感は有意差なし。2週間の追跡では2名中1名が「数時間で切れて翌日にはリセットされた」と証言している。人種化批判の論文(Kinsella 2005)が、その批判を落として中立記述の出典に使われている点を含め、限界を14件に整理する。あわせて、ギャルマインドの尺度化は池上らが最初ではなく、本出莉乃 2023(関西学院大学社会学部紀要)が2年先行して4因子の尺度を作成し1,487名で信頼性と基準関連妥当性を検証していたこと、その文献を著者らが日本語版では引き英語版では落としていることを示す。参照文献つき。
-
データビジュアライゼーションとデータアートは創造性教育でどう扱われてきたか
2026-09-22
データを扱う教育には、図を正しく読む力を測る流れと、データを作品に変える制作を授業に持ち込む流れがある。前者は可視化リテラシーの測定尺度(VLAT、CALVI、Mini-VLAT、多次元尺度)を持ち、尺度そのものへの批判も蓄積している。後者は科目設計と展覧会の事例が中心で、成果を測る標準尺度を持たない。両者を橋渡しするのは、Papert の構築主義に遡る「作ることで学ぶ」系譜と、データ物理化の教育実践である。芸術統合の実践は、芸術的創造性とデータの正確さの緊張を繰り返し報告する。日本語圏では、データアートを教育に用いた研究がほぼ存在しない。
-
Jev をどう使うか、どこで使わないか
2026-09-21
TypeSafe AI の Jev は、判断を型づけられた質問に書き下せた範囲でしか働かない。公開から 6 日の時点でベストプラクティスと呼べる合意はまだなく、本ノートは公式が逐語で条件を添えたものと、追試できる形で公開された実装だけを採り、方法論のない優位主張と出所を確認できない報告は落とした。公式ドキュメントは適用タスクを 10 種に限定し、算術と日付と多段推論と生成を明示的に外している。実装の作法は criteria の書き方に集中しており、Score は度合いでなく状況を書く、Noul は否定形を避ける、Choice は候補を省略しない、という指示が逐語で置かれている。閾値は 0.6 と 0.85 を出発点として自分のデータで調整する設計で、公式自身が confidence を convenient measure と呼ぶ。独立実装では eval 用途で判定一致率 91.5% を 100 万件 160 ドル、エージェントの操作リスク判定で正解率 91.7% という報告がある一方、曖昧なケースでは 71.4% まで落ち、棄権の選択肢がないため強制的に最もましな誤答を選ぶ。選定の分かれ目は精度ではなく、基準を先に書き切れるかどうかにある。
-
判断が関数呼び出しになったとき、デザインの何が動くか
2026-09-21
TypeSafe AI の Jev は、テキストを返さず型づけられた判断と確率だけを 1 件 0.0004 ドル、0.4 秒で返す。新しいのは学習手法ではなく、判断が何百回でも呼べる部品の形をとったことである。このブログは『クラフトは自動化され、残るのは判断だ』と書いてきたが、その枠はそのままでは持たない。独立検証と LLM-as-a-Judge 研究は別々の場所から同じ線を引いており、基準への当てはめは降りていく一方、どれが良いかを並べる判断と基準そのものを書く仕事は残る。さらに Jev は score と確率しか返さず、このブログが討議で出した処方(AI の評価は score でなく次操作候補に限定せよ)と食い違う。検品の価格が床に着き、利用率と肯定率では検出できない置換が起き、責任は使った側に残る。
-
AI とデザイン 週次ウォッチ(2026-09-14〜09-21)
2026-09-21
直近7日間の「AIとデザイン」動向をT1vベンダー一次、T2公的機関と標準、T3専門家私見の3ティアで収集した統合要約。ベンダー側はFigmaのWeaveツールのコミュニティ公開、CanvaのAI Essentials Certification、Adobeの教育向け展開と、新機能より配布と教育に寄った週だった。T2は窓内の新規公表を一次資料で確定できず、調査の採用も0件。T3ではJakob NielsenがAIプロトタイピングをUXD手法100種の1位に置き、Laurie Voss、Ethan Mollick、NN/gのTanner Kohlerが、作るコストが下がったあとに残る判断と文脈の与え方を論じた。
-
模試の採点と作問で、どの作業が置き換わったか
2026-09-18
国内の模試と大規模テストのうち採点工程と作問工程に限定した深掘り調査。採点で置き換わったのは判断ではなく、紙の運搬と集計と突合せである。部分点の判断は人に残り、2系統採点と突合せという検証工程が新設された。担い手は会場から在宅へ移ったが、出来高制という報酬の型は変わっていない。作問は時間が記録されず、点検が多重で、問題を漏らせないため置き換えが起きていない。生成AIが届くのはたたき台までで、その位置は技術の到達点であると同時に制度が引いた線でもある。AIが作った問題の欠陥は重複ではなく曖昧さと難易度の統制に集中し、作問と検証を同じモデルで回すと誤問が通過する。市場データでも採点は数えられ、作問は数えられていない。経済産業省の最終成果報告書を一次取得し、削減幅の内訳(10分から30分が40%、効率化を感じない21%、かえって時間がかかる15%)と、実証の範囲が第1フェーズの「教材の質進化」に限られること、報告書に採点の記載が無いことを確認した。
-
模試運営の負荷と AI 活用の現状
2026-09-18
国内の模試運営を工程ごとに分解し、負荷と AI 到達点を対応づけた産業調査。負荷は記述式の採点に集中し、デジタル化が実際に短縮したのは申込・回収・答案の電子化・返却の前後工程である。採点の自動化は限定的で、デジタル採点は採点を消さず検証工程を新設した。需要側は少子化、供給側は教員不足と採点労働市場の縮小が同時に進む。
-
TypeSafe AI の Jev は何を保証し、何を保証しないか
2026-09-18
TypeSafe AI が 2026-09-15 に公開した Jev は、テキストを生成せず、型づけられた判断と確率だけを返すモデルである。自社評価では精度 67.8% で最良の比較対象 74.1% に負ける一方、コストとレイテンシで大きく勝つ。保証されるのは出力の型であって判断の正しさではない。独立検証は分類課題では強く、較正と順位づけでは弱いという形で割れている。
-
ビジネスアナリストのスキルは、何で測るのか
2026-09-15
DX推進スキル標準(DSS-P)は2026年4月の ver.2.0 でビジネスアナリストをロールとして新設した。しかし標準自身が「詳細なレベル評価指標は設定せず」と明記し、熟達度を測る物差しを持たない。代わりに置かれるのはロールごとの重要度 a/b/c/d/z で、これは熟達度ではなく重みづけである。IIBA の BABOK Guide は6知識領域と30タスク、29の基礎コンピテンシー、テクニック一覧を標準化するが、個人の熟達度は Competency Model の自己評価尺度が担うと役割を分ける。認定試験は出題比率を公開する一方で合格基準を開示せず、更新では活動時間を積む。公的な測定手段は情報処理技術者試験と ITSS の経験判定に、団体側は時間要件と試験と単位数に、採用市場は経験の種類に寄り、いずれも実務の成果そのものは測らない。標準は語彙を与えるが、証拠は与えない。
-
AI とデザイン 週次ウォッチ(2026-09-07〜09-14)
2026-09-14
直近7日間の「AIとデザイン」動向をT1vベンダー一次、T2公的機関と標準、T3専門家私見の3ティアで収集した統合要約。ベンダー側の目立った新製品発表は少なく、Framerのリスト型CMSフィールドやOpenAIの全二重音声API GPT-Live-1などの機能拡張にとどまった一方、Jakob Nielsen、Luke Wroblewski、NN/gが独立にAIチャットUIの設計そのものを問い直す記事を出した週だった。線形なチャット構造の不向きさ、先に答えを出す設計、AIプロトタイピングの実務活用が論点になった。
-
デザインと新規事業の工程は、どの標準に載るか
2026-09-14
ポートフォリオに「担当した工程」を書くとき、独自分類には根拠がない。IPA に従おうとすると、共通フレーム2013 は IPA 自身が改訂を止めており現行の国際規格と整合しない。デジタルスキル標準 ver.2.0 は人材類型とスキルの標準で、工程を定義していない。工程の典拠として使えたのは ISO 9241-210(人間中心設計、JIS Z 8530)と ISO 56002(イノベーション・マネジメント、JIS Q 56002)の2つで、どちらも反復を規格本文で前提にしている。コンサルティングは ISO 20700 があるが JIS 化も日本語版もなく、マーケティング業務全体の公的標準は存在しない。アジャイルを定義した公的標準も存在しない。
-
デザインシステムの6つの対立点を判定する証拠はどこまで揃っているか
2026-09-11
6つの判定条件を測定の単位に分解すると37のピースになり、何らかの実測があるのは25、該当研究を確認できないのは12だった。ただし実測の大半は隣接分野の代理指標で、デザインシステムを直接対象にしたものは再利用の比較(n=8)と4つの DS の成果物評価(46基準)の2件だけである。共通して欠けているのは、連続量を二分した操作定義、縦断の時間軸、DS 由来か利用側由来かの帰属、盲検、自動監査のカバレッジ上限に埋もれる効果量である。
-
デザインシステムのベストプラクティス:研究と実務の証拠が支えるもの
2026-09-11
デザインシステムをめぐる学術23件と産業46件の証拠を突き合わせた。専任チームを持つ組織は83%(回答147名)だが、ROI を計測しているのは5%である。役割ベースのトークン設計、命名の統制、段階的移行、CI での自動検証、貢献モデルの定義には複数組織の一次証言が揃う。導入を止めるのは技術ではなく組織要因で、阻害要因4つが研究で特定された。ROI の統制実験は n=8 にとどまる。WCAG 2.2 AA と DTCG 2025.10 が実装の前提を外から決める。
-
AI とデザイン 週次ウォッチ(2026-08-31〜09-07)
2026-09-07
直近7日間の「AIとデザイン」動向をT1vベンダー一次、T2公的機関と標準、T3専門家私見の3ティアで収集した統合要約。GoogleはDocsとSlidesに画像生成/編集機能Google Picsを組み込み、AdobeはFireflyなど70以上のツールをSlackから呼び出せるようにし、WebflowはサイトのAIエージェント協働プラットフォームSource by Webflowを発表するなど、生成AIの出力先が専用の制作アプリから文書やチャットへ広がった週だった。同じ週にAnthropicのClaude Fable 5.1/Mythos 5.1とOpenAIのGPT-6 Astraが発表され、Simon Willisonが同一の非公式ベンチマークで両モデルを検証した。
-
AI とデザイン 月次学術ウォッチ(2026年8月〜9月)
2026-09-07
2026年8月4日から9月7日までを中心に、AIとデザインの交差領域における査読論文とプレプリント7件を収集した月次学術ウォッチ第3弾。前回のC&C 2026集中とは対照的に大規模学会の会期を含まず件数は薄いが、AI支援ツールにおける制御性・主体性の保持と、AIが意思決定プロセス自体を再編成するという教育現場の実証が、前回までの対立に具体的な機構を与えている。