目次を表示
記事
技術・研究

AIが示す「85点」は信頼できる? — キャリブレーションを理解する

2026.05.05·5分·OPENSEED
参照するエージェント総括アナリスト

AIが事業計画書に85点をつけたとき、その数字は実際に何を意味するのでしょうか。直感的には、85点の事業計画書なら、現実に成功する確率もおよそ85%だろうと期待するかもしれません。スコアが現実とどれほど一致するかを測る学術的な概念を「キャリブレーション」と呼びます。この記事では、キャリブレーションの概念とその意味を、利用者の視点から紹介します。

はじめに

#キャリブレーションとは — 身近な例で考える

ある気象情報サービスが、明日の降水確率を80%と予報したとします。同じ80%という予報を出した100日のうち、実際に80日雨が降ったなら、その予報は適切にキャリブレーションされています。一方、100日のうち50日しか雨が降らなかったなら、予報は確信度を高く見積もりすぎています。

TIP
キャリブレーションは、AIが示す確信度に見合う頻度で、実際に予測が当たっているかを測ります。点数そのものが正確かどうかではなく、その点数が意味する確率が正確かどうかを扱う概念です。
02

#事業計画書の評価に当てはめる

AIがある事業計画書について「成功確率85%」と示した場合、同じスコアを得た100件の計画のうち、およそ85件が実際に成功して初めて、そのAIは適切にキャリブレーションされていると言えます。この差が大きいほど、AIの確信度が現実と合っていないことを強く示します。

AIが予測した成功確率実際の成功率 — 適切にキャリブレーションされている場合実際の成功率 — 確信度が高すぎる場合
50-60%約55%20%
60-70%約65%30%
70-80%約75%45%
80-90%約85%60%
03

#ECE — キャリブレーションを測る指標

期待キャリブレーション誤差(Expected Calibration Error:ECE)は、AIが予測した確率と実際の結果との差を平均した指標です。ゼロに近いほど適切にキャリブレーションされており、学術研究では標準的な測定指標として使われています。機械学習の分野で広く確立され、公開文献でも説明されている概念です。

  • ECE < 0.1 — 適切にキャリブレーションされている(予測と現実の差が平均10パーセントポイント以内)
  • 0.1 ≤ ECE < 0.2 — 再キャリブレーションが必要
  • ECE ≥ 0.2 — 確信度が高すぎる、または低すぎるため、結果の解釈には注意が必要
주의
ECEは平均値なので、特定のスコア帯に大きな誤差が集中していても、全体の数値は小さくなることがあります。正確に診断するには、区間別のキャリブレーション図も併せて確認する必要があります。
04

#利用者が知っておきたい限界

キャリブレーションは学術的に確立された概念ですが、2つの限界があります。第一に、測定には十分な検証データが必要です。第二に、市場や業界が変化するため、過去のキャリブレーションが現在も成り立つかを再検証する必要があります。

  • 検証データ — 「予測と実際の結果」を対応づけたデータが、少なくとも数十〜数百組必要
  • 時間への依存 — 昨年の市場をもとに測定したキャリブレーションが、今年も成り立つとは限らない
  • 業種による違い — IT、バイオテクノロジー、D2Cなど、業種ごとに分けて測定することが望ましい
まとめ

#OpenSeedの方針

OpenSeedは、AIレビューの結果を人間の評価者による評価や実際の結果と照らし合わせて検証すべきだという原則に従っています。資金調達や助成プログラムの結果といった事業計画書の検証データを蓄積し、AIレビューの結果が現実とどれほど一致するかを測定しています。その測定結果は、管理者向けダッシュボードで透明性をもって開示しています。

CTA
OpenSeedのAIレビューには、分析開始画面に表示される現行の支払い条件が適用されます。すべての点数について、その意味と、その点数に至った判断の根拠をお伝えします。
広告

AIが示すすべての点数に、意味と根拠を

分析開始画面に表示される現行の支払い条件のもとで、点数とその判断の根拠を受け取れます。

提出前に根拠・論理・リスクを確認する意思決定支援サービス

OpenSeedのレビューを始める →

관련 AI 피드백 서비스.

AI 피드백
사업계획서 AI 추천 →
AI 피드백
예비창업패키지 점검 →
AI 피드백
초기창업패키지 점검 →
関連記事技術・研究
AIがコードを書ける時代、コンピューターサイエンスの学生は何を学ぶべきか?2026.07.28 · 8分AI時代に本当に必要なスキルは、プロンプト作成ではなく読解と批評2026.07.28 · 8分なぜ1つのAIでは足りないのか — マルチエージェントレビューの考え方2026.07.24 · 7分同じ事業計画書を異なるAIモデルで評価 — 数値の誤りは、実際にどれくらい見つかるのか?2026.07.14 · 9分初めて取り組むソーシャルスタートアップのためのインパクト測定実践ガイド:SROIとロジックモデル2026.07.06 · 8分
← ガイド一覧へ