#キャリブレーションとは — 身近な例で考える
ある気象情報サービスが、明日の降水確率を80%と予報したとします。同じ80%という予報を出した100日のうち、実際に80日雨が降ったなら、その予報は適切にキャリブレーションされています。一方、100日のうち50日しか雨が降らなかったなら、予報は確信度を高く見積もりすぎています。
#事業計画書の評価に当てはめる
AIがある事業計画書について「成功確率85%」と示した場合、同じスコアを得た100件の計画のうち、およそ85件が実際に成功して初めて、そのAIは適切にキャリブレーションされていると言えます。この差が大きいほど、AIの確信度が現実と合っていないことを強く示します。
| AIが予測した成功確率 | 実際の成功率 — 適切にキャリブレーションされている場合 | 実際の成功率 — 確信度が高すぎる場合 |
|---|---|---|
| 50-60% | 約55% | 20% |
| 60-70% | 約65% | 30% |
| 70-80% | 約75% | 45% |
| 80-90% | 約85% | 60% |
#ECE — キャリブレーションを測る指標
期待キャリブレーション誤差(Expected Calibration Error:ECE)は、AIが予測した確率と実際の結果との差を平均した指標です。ゼロに近いほど適切にキャリブレーションされており、学術研究では標準的な測定指標として使われています。機械学習の分野で広く確立され、公開文献でも説明されている概念です。
- ECE < 0.1 — 適切にキャリブレーションされている(予測と現実の差が平均10パーセントポイント以内)
- 0.1 ≤ ECE < 0.2 — 再キャリブレーションが必要
- ECE ≥ 0.2 — 確信度が高すぎる、または低すぎるため、結果の解釈には注意が必要
#利用者が知っておきたい限界
キャリブレーションは学術的に確立された概念ですが、2つの限界があります。第一に、測定には十分な検証データが必要です。第二に、市場や業界が変化するため、過去のキャリブレーションが現在も成り立つかを再検証する必要があります。
- 検証データ — 「予測と実際の結果」を対応づけたデータが、少なくとも数十〜数百組必要
- 時間への依存 — 昨年の市場をもとに測定したキャリブレーションが、今年も成り立つとは限らない
- 業種による違い — IT、バイオテクノロジー、D2Cなど、業種ごとに分けて測定することが望ましい
#OpenSeedの方針
OpenSeedは、AIレビューの結果を人間の評価者による評価や実際の結果と照らし合わせて検証すべきだという原則に従っています。資金調達や助成プログラムの結果といった事業計画書の検証データを蓄積し、AIレビューの結果が現実とどれほど一致するかを測定しています。その測定結果は、管理者向けダッシュボードで透明性をもって開示しています。
AIが示すすべての点数に、意味と根拠を
分析開始画面に表示される現行の支払い条件のもとで、点数とその判断の根拠を受け取れます。
提出前に根拠・論理・リスクを確認する意思決定支援サービス
OpenSeedのレビューを始める →