Shuichiro Ogawa
English

ノート · updated 2026-09-21

判断が関数呼び出しになったとき、デザインの何が動くか

TypeSafe AI の Jev は、テキストを返さず型づけられた判断と確率だけを 1 件 0.0004 ドル、0.4 秒で返す。新しいのは学習手法ではなく、判断が何百回でも呼べる部品の形をとったことである。

目次(15)
  1. 判断だけを 1 件 0.0004 ドルで売る
  2. 新しいのは学習手法ではない
  3. 型は保証されるが、判断は保証されない
  4. 信頼性判断は外注できたのか
  5. 降りてくる判断と、降りてこない判断
  6. 基準を書く作業が前に出る
  7. score は返るが、次の一手は返らない
  8. 通ったチェックの束は品質ではない
  9. 検証が安くなると、検証の中身は固定される
  10. 安さをどう数えるか
  11. 検品の価格が床に着く
  12. 利用率では見えない置換
  13. 学ぶ側で何が起きるか
  14. 責任は使った側に残る
  15. 何が動いて、何が動かないか

判断だけを 1 件 0.0004 ドルで売る

このブログは、AI に持っていかれるのはクラフトで、デザイナーに残るのは判断だと書いてきた。 制作から編集への移行は数字でも出ている。 43 カ国 217 名の調査で、71% が自分で作るよりも AI 出力の評価とキュレーションに時間を使っており、上級者では 91% に達していた(Rivera & Russi 2026、制作者から編集者へ — AI時代のデザイナー役割移行の構造分析)。

TypeSafe AI が 2026-09-15 に公開した Jev は、その残ったほうを 1 件 0.0004 ドル、0.4 秒で売る。 文章は返さない。選択肢と確率、順序段階のスコア、0 から 1 の真偽値だけが返る(TypeSafe AI の Jev は何を保証し、何を保証しないか)。

残ると見込んでいたものに、値段がついた。

新しいのは学習手法ではない

較正を報酬にして学習させるアイデアは先にある。 対数スコアリング則を報酬に使って LLM に較正された信頼度を出させる研究は ICLR 2026 に採択されており(arXiv:2503.02623、初版 2025-03-04)、TriviaQA で ECE 0.0226 を報告している。 Anthony Maio も「Reinforcement learning for calibration is also not new」と書き、Jev の最も強い主張は「architectural rather than algorithmic」だと結論した。

新しいのは、判断が関数の形をとったことである。 入力はテキスト、出力は型づけられた値、API は 1 本、出力トークンは無料、レイテンシは 70ms から 500ms。 質問は並列に評価され、質問を足してもレイテンシは増えない。 TypeSafe 自身のマニフェストは「Intelligence today is like databases before SQL」と書いている。

比喩の当否はさておき、指している変化ははっきりしている。 判断を 1 回ずつ相談する相手ではなく、何百回でも呼べる部品として扱えるかどうか、という変化である。 370 ルールの差分チェックを 2 秒未満で回した実装例や、37 文書 × 21 問の 777 判定を 0.7 秒未満、約 0.25 セントで処理した記録は、その扱い方が現に成立することを示している。

型は保証されるが、判断は保証されない

TypeSafe のトップページには「Zero Hallucinations」と書かれている。 これは測定値ではない。 ローンチ記事に「Our number is not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots」とある。 型が合うことは定義上保証されるので 0% と書ける、という理屈である。

Maio の一文が短い。 「Jev constrains the shape of the output. It does not constrain the judgment.」

デザインの作業に置き直すと、返ってきたレビュー結果がスキーマどおりであることは、レビューとして正しいことを何も意味しない。 形式が整った誤りは、形式が崩れた誤りより見つけにくい。

信頼性判断は外注できたのか

このブログは、AI が入った制作現場で新しい判断類型が生まれていることを記録してきた。 Naik ら(2025)が HCI デザインコース 33 チームのリフレクション記録から同定したエージェンシー配分判断(どこまで AI に任せるか)と信頼性判断(AI 出力をどれだけ信じるか)である(制作者から編集者へ — AI時代のデザイナー役割移行の構造分析)。

Jev の confidence は、この信頼性判断を数値として売る商品に見える。 high は自動実行、medium は注意して続行、low は実行しない、という 3 段階のバンドまで示されている。

ところが公式の定義はこうである。 「confidence is a statistic computed from the probability distribution the answer already gives you」。 答えがすでに与えている確率分布から計算できる統計量であって、別に学習された数値ではない。 Archer Hume による約 1 万 API コールのブラックボックス監査も、confidence は先頭回答が一様分布からどれだけ離れているかの算術値だったと報告している(本人は再構成が speculative であると明記している)。

返ってくるのは、答えを別の単位で書き直したものである。 答えを裏づける独立した証拠ではない。 信頼性判断を外注したつもりで手に入るのは、同じ判断の言い換えということになる。

閾値で自動実行を決める設計には、すでに前例の警告がある。 Anthropic は permission prompt の 93% が承認されるという実測から、行為ごとの承認が監視として機能していないと判断し、境界の中で自由に動くモデルへ設計を変更した(AX × デザイン:学術と産業の対照)。 confidence の high を自動実行に割り当てる運用は、この 93% を人手を介さない形で再現する。

降りてくる判断と、降りてこない判断

独立検証の結果は、きれいに割れている。 分類では強い。事前登録つき pilot(300 例、jev-1.13.0)で AG News は Jev 0.910 対 GLiNER2.5 0.700、Banking77/BTZSC は 0.870 対 0.610 だった。 順位づけでは弱い。53 日分のニュース選別テストで日次 AUC の平均は Jev 0.653、Sonnet 5 0.697、並び順ベースライン 0.637 である。 較正では負ける。DAIR Emotion で Brier スコアは 0.846 対 0.668、真のラベルに確率 0 を与えた例が 16% あった。

同じ線を、別の場所から引いている証拠がある。 LLM-as-a-Judge の文献地図では、定型ルーブリック次元の人間相関は高い(AUT で r=.81、メタファーで r=.72)一方、独創性次元の判定と専門家品質のデザイン批評には未到達という乖離が確認できる(LLM-as-a-Judge の最新潮流:中核研究53件の文献地図と創造性評価の独立章)。 デザイナー批評 3,059 件のデータセット UICrit(UIST 2024)は、few-shot で LLM フィードバックを 55% 改善したうえで、それでも専門家品質には届かないと明記している。

判断モデルの独立テストと judge 研究の系列は、互いを知らないまま同じ境界を描いている。 決まった基準に当てはめる判断は降りてくる。 どれが良いかを並べる判断は降りてこない。

実務の粒度で言い直すと、ガイドライン違反の検出、コンポーネントの分類、コピーのトーン判定、アクセシビリティ規則の照合はこちら側に落ちる。 3 案のうちどれをクライアントに出すかは落ちない。

基準を書く作業が前に出る

Jev を呼ぶには criteria を書かなければならない。 Choice なら選択肢名から説明へのマップ、Score なら最低 2 段階から最大 10 段階の記述である。 判断を呼び出す前提条件が、評価軸を文章にしておくことになっている。

この形は、このブログがデザインシステムについて書いてきたものと同じである。 モジュール境界や制約を宣言した形式仕様を与えると、AI コーディングエージェントのナビゲーションステップが 33〜44% 減り、自動生成記述子でも精度 100% に達した(Jin 2026、Wilcoxon p=0.009、d=0.92。デザインシステム=AIの基盤レイヤー — 構造化されたデザイン知識がエージェント精度を決める)。 デザインシステムへの投資の意味が、一貫性の維持からエージェント精度の上限の決定へ移る、という見立てである。

Jev はそこに値札を貼った。 明文化された基準は、1 件 0.0004 ドルで何百回でも執行できる資産になる。 明文化されていない基準は、執行の回路に乗らない。

score は返るが、次の一手は返らない

このブログは、AI とデザインの討議で一つの処方を出している。 AI の評価は score ではなく feed-forward、つまり次の操作候補に限定せよ、という処方である。 AI 出力を確定ではなく暫定的な観点として提示し、評価を受けて次を選ぶ段を人の側に残す、という設計意図だった。

Jev は score と choice と確率しか返さない。 次の操作候補を返す設計ではない。 処方と食い違っている。

並列評価についても、似た形のずれがある。 質問は互いに独立に評価され、文脈を汚さないと公式が述べており、これは複数の評価軸を収束させずに並べる形に近い。 ところが返るのは軸ごとの確率であって、軸を組み替える操作ではない。 軸を握っているのは criteria を書いた人である。

リフレーミングは、この装置の外側にしか置けない。 Dorst と Cross が問題と解の共進化として記述した往復は、評価軸そのものが動くことで進む(デザインにおけるリフレーミングの活性化:認知メカニズムと実践手法)。 Jev は評価軸が止まっている間だけ働く。

もう一つ、出力の形に非対称がある。 Choice は 255 までの選択肢から 1 つを選び、Noul は命題の真偽を返す。 どちらも「選ばない」「作らない」を一級の出力として持たない。 人は手がかりがなければ要素を足す側に偏る(Adams ら 2021、Nature、8 実験)という知見をデザインに移した議論から見ると、判断モデルもまた付加の側に符号化されている(引き算の創造性:付加への偏りと、不在を設計するという仮説)。

通ったチェックの束は品質ではない

安い判断を束ねれば束ねた分だけ確かになるかというと、そうならない。 Maio の指摘が機構まで書いている。 「individually calibrated judgments do not automatically compose into a calibrated workflow」。 理由は 1 文である。「Correlated mistakes survive composition.」

TypeSafe 自身も、質問どうしの算術的な一貫性を保証していない。 公式ドキュメントが反例を出しており、同じ状態に対して Noul が 0.22 を返す一方で Choice の yes が 0.01、no が 0.99 になる。 別の例では refund が 0.72、not_refund が 0.47 で、合計が 1.19 になる。 「don’t hold the model to arithmetic identities between separate questions」と書かれている。 Hume の監査も、無関係な 5 番目の選択肢を足すと既存 2 択のログオッズが全ブロックで下がることを観測している。

デザインの運用に直すと、こうなる。 デザインシステムの 370 ルールをすべて通しても、それは 370 個の独立した合格の集合ではないし、良いデザインであることの証明でもない。 チェックの束を品質と読み替える運用は、Jev が安いほど採用されやすく、そして安いことは正しさの根拠にならない。

検証が安くなると、検証の中身は固定される

このブログは AI スロップを、出来の悪さではなく検証の負担の配分として読んできた(AIスロップ:質の低さではなく、検証の外部化として読む)。 語の初出が核に置いたのは、自分で検証していないものを他者に押し付けることだった(Willison 2024)。 骨格にあるのは費用の非対称である。低品質な生成の限界費用だけが下がり、検証の費用は下がらない(Zhang & Zhang 2025)。

Jev は、その非対称を検証の側から崩す道具に見える。 ただし独立テストで最も弱かったのが較正だった。 下がるのは検証の値段であって、検証が済んだという状態ではない。

崩し方には条件が付く。 Jev は検証の値段を下げるかわりに、検証の中身を criteria として先に書き切ることを求める。 書き切った基準は執行され、書かれなかった基準は執行されない。

隣接する実証は、固定された基準の側に注意を向けさせる。 生成 AI の利用は個人の作品評価を上げる一方で集団としての新規性を下げ(Doshi & Hauser 2024)、人間のエッセイ 1 本が足す新規性は GPT-4 の 2 倍から 8 倍だった(Moon ら 2025、N=2,200)。 安価で固定された基準による選別が、この方向をさらに押すかどうかは、まだ誰も測っていない。 ここは推測として置く。

安さをどう数えるか

このブログはモデルの安さを比べる単位を、すでに決めている。 1 リクエストあたりの価格ではなく、1 タスク完了あたりのコストである(フロンティアモデルと廉価モデルの使い分け(Fable 5 と GPT-5.6 Sol))。 安いモデルの失敗は、トークンと再試行と下流の手戻りを全部請求する。 20 問の調査タスクで 2 問が全支出の 43% を占めた、という実測もそこにある。

この基準を当てると、Jev の判定は保留になる。 自社評価の精度 67.8% は Claude Sonnet 5 と同値で、最良の GPT-5.6 Sol の 74.1% に負けている。 単価では 2 桁勝つ。 差の 6.3 ポイントが手戻りとして何を請求するかは、誰も測っていない。

引き合う場所は絞れる。 誤った合格判定の手戻りが小さく、量が多く、基準が固定されている作業である。 デザインの実務でそれに当たるのは納品前の機械的な点検であって、提案の選定ではない。

検品の価格が床に着く

課金の側では、このブログはすでに結論に近いものを書いている。 課金モデルの AI 耐性は成果連動、時間、成果物の順で弱くなり、成果物を物として定義した瞬間に価格は AI の限界費用へ滑る。 そして番人ビジネスは、規程を設計する上位と検品する下位に割れる(デザイン課金モデルの AI コモディティ化耐性 — 成果物課金は最も脆く、運用常駐の複製困難性は高粗利を意味しない)。

Jev は、その下位に具体的な価格を与える装置である。 アクセシビリティ規則の照合、ガイドライン適合の点検、納品物のトーン確認といった作業の限界費用は、1 判定 0.0004 ドルの側に寄る。 実測もある。53 日分のニュース選別で 3,408 リクエストの課金は $0.22 だった。 同じ作業を Sonnet 5 で回すと 1 日あたり 78 秒と $0.167 かかる。

上位、つまり何を合格とするかを決める仕事は残る。 ただし残り方が変わる。 基準は頭の中ではなく、執行できる文章として存在しなければ値段が付かなくなる。

利用率では見えない置換

このブログは、AI ツールの普及率を肯定の証拠に使ってはいけないと書いてきた。 利用 86% に対して業界への肯定は 10%、バーンアウトは 69% という乖離があり、これは個人の矛盾ではなく組織の効率化圧力と専門職アイデンティティの衝突として読める(90%採用 × 10%肯定 — AIツール普及と評価乖離のパラドクス)。

Jev はこの測定の外側にいる。 デザイナーが画面で触るツールではなく、コードから呼ばれる判断部品だからである。 使ったかと聞かれて「使った」と答える機会が発生しない。

判断の一部が置き換わっても、乖離の指標に使ってきた利用率と肯定率では検出できない。 検出したいなら、見るべきは人の回答ではなく、ワークフローの中でどの判断が質問として型に起こされたかである。

学ぶ側で何が起きるか

デザイン教育の側には、害を判定する軸がすでにある。 代行される処理が現在の学習目標そのものであるときに害が出る、という軸である(デザイン教育(Not クラフト教育)の論点:失敗設計と認知オフローディングの証拠から)。 生成 AI についてこの軸が問題にしたのは、既定で代替案の生成と探索を代行してしまう点だった。

Jev が代行するのは生成ではなく評価である。 デザイン教育の学習目標には評価判断が含まれるので、この軸では害の側に落ちる。 ただし代行する処理が違うので、生成 AI について集めた証拠をそのまま当てることはできない。

ここで効いてくる区別がある。 トルコの高校数学 約 1,000 名の実験では、素の GPT-4 は練習成績を 48% 上げた一方、AI を外した試験では対照群より 17% 下げた。 問いかけと足場かけを行う GPT Tutor 条件では、練習が 127% 上がったうえで試験の有意な低下がなかった(Bastani ら 2025、PNAS。生成AIの早期利用は思考の醸成を阻害するか:cognitive offloading と学習の文献地図)。 効いたのは答えを出さないことではなく、問いを返すことだった。 Jev は答えを出さないが、問いも返さない。

教える側には利点もある。 Choice と Score と Noul は、任せる範囲が型として見える。 何をどこまで AI に任せるかというエージェンシー配分判断は、型が契約として書かれている分だけ教材にしやすい(デザイン教育のAI適応 — カリキュラム改革の現在地と構造的課題)。 逆に confidence の閾値で自動実行を決める設計は、学生が自分で判断する場面を閾値の設定に置き換えてしまう。 どちらに転ぶかは、まだ観察されていない。

責任は使った側に残る

モデル側の義務は薄い。 EU AI 法はモデルとシステムを分けて扱い、モデル段階の義務は汎用目的 AI モデルの提供者に結び付いている。 欧州委員会の FAQ が示す該当性の指示的基準は、学習計算量と、言語や画像や動画の生成能力の二本立てである。 生成能力を持たない決定専用モデルは、この一方を満たさない。 当てはめは推論であり、Jev を名指しした公的資料は確認できていない。

契約側も薄い。 利用規約は AS IS で保証を全部否認し、累積責任の上限は $100 USD である。 誤った決定に対する特別条項はない。

そしてデザインは、職能として制度的な防壁を持たない。 知的条件は専門職の要件をほぼ満たしながら、参入ライセンスと管轄の独占を欠いたまま今日に至っている(デザインと専門職:専門職理論から見たデザインの位置づけの文献地図)。 誤った合格判定の責任は、使った側に残る。 安い判断を大量に回すほど、残る責任の総量は増える。

何が動いて、何が動かないか

このブログの見立ては、部分的に更新される。

クラフトが自動化され判断が残る、という枠はそのままでは持たない。 判断のうち、基準への当てはめは降りていく。 残るのは、基準そのものを書く仕事と、どれが良いかを並べる仕事である。

制作者から編集者へという移行の先にいるのは、編集者ではない。 基準の著者である。 そして基準の著者の仕事は、Jev が得意な形に基準を書き下すことだけではない。 書き下せないものを、書き下せないまま扱い続けることでもある。

未検証事項

  • 要一次検証 Rivera & Russi (2026) の 71%(43 カ国 217 名)は、制作者から編集者へ — AI時代のデザイナー役割移行の構造分析 の時点で論文 URL に到達できていない。
  • 要一次検証 利用 86%、肯定 10% の Creative Boom (2025) は n=882 のオンライン自己選択サーベイで、90%採用 × 10%肯定 — AIツール普及と評価乖離のパラドクス が発行主体側のバイアスを明記している。
  • 要一次検証 Jev の自社 eval のケース数はダッシュボードに表示がなく、報道の「711 例」は一次で確認できない(TypeSafe AI の Jev は何を保証し、何を保証しないか)。
  • 要一次検証 confidence の算出式。Hume の再構成は本人が speculative と明記している。
  • 要一次検証 EU AI 法の当てはめは推論であり、Jev と TypeSafe AI を名指しした公的一次資料は確認できていない。
  • 要確認 「安価で固定された基準による選別が生成物の均質化をさらに押すか」は、本ノートでは推測として置いた。Jev を対象にした実測はない。
  • 要確認 精度差 6.3 ポイントが 1 タスク完了あたりのコストに何を足すかの実測はない。

参照文献

すべて 2026-09-21 にアクセス。本ノートが引く Jev の仕様と数値の一次出典は TypeSafe AI の Jev は何を保証し、何を保証しないか に完全な形で載せてある。

Jev をめぐる一次情報と独立検証

デザインと学習の側の出典

関連ノート: TypeSafe AI の Jev は何を保証し、何を保証しないかJev をどう使うか、どこで使わないか制作者から編集者へ — AI時代のデザイナー役割移行の構造分析LLM-as-a-Judge の最新潮流:中核研究53件の文献地図と創造性評価の独立章デザインシステム=AIの基盤レイヤー — 構造化されたデザイン知識がエージェント精度を決めるフロンティアモデルと廉価モデルの使い分け(Fable 5 と GPT-5.6 Sol)デザイン課金モデルの AI コモディティ化耐性 — 成果物課金は最も脆く、運用常駐の複製困難性は高粗利を意味しない90%採用 × 10%肯定 — AIツール普及と評価乖離のパラドクスAX × デザイン:学術と産業の対照デザイン教育(Not クラフト教育)の論点:失敗設計と認知オフローディングの証拠からデザイン教育のAI適応 — カリキュラム改革の現在地と構造的課題生成AIの早期利用は思考の醸成を阻害するか:cognitive offloading と学習の文献地図デザインにおけるリフレーミングの活性化:認知メカニズムと実践手法引き算の創造性:付加への偏りと、不在を設計するという仮説デザインと専門職:専門職理論から見たデザインの位置づけの文献地図AIスロップ:質の低さではなく、検証の外部化として読む


書いた人:小川 修一郎(Design Researcher / Consultant) 経歴を見る →