#1世紀前からの知見:人間の評価は一貫しない
1920年、Edward Thorndikeは、上官が137人の軍人に付けた評価を分析しました。本来は独立しているはずの体格、知性、人格といった項目の間に、異常に高い相関が見られました。1つの特性に対する好印象が、ほかのすべての評価に波及していたのです。彼はこれを「ハロー効果」と名付けました。
Thorndikeの結論は単純でした。評価者は、人を独立した特性の総和として見ることができません。「良い」「悪い」という全体的な印象が、個々の判断すべてに影響します。1世紀後の今も、この知見は採用、昇進、審査に関する文献で教科書的な位置を占めています。
#事業計画の評価に現れる4つのバイアス
ハロー効果は始まりにすぎません。採用、評価、審査の場面全般で繰り返し確認されてきた認知バイアスのうち、事業計画の評価でも同じ仕組みで働く可能性が高い4つに絞りました。事業計画審査に特化した大規模な実証研究はまだ少ないものの、評価対象が人から文書に変わったからといって、メンターの認知システムそのものが変わるわけではない、という見方が広く共有されています。
| バイアス | 定義 | 事業計画審査での現れ方 |
|---|---|---|
| ハロー効果 | ある印象が、無関係な評価基準にまで波及する | チーム紹介スライドの強い好印象によって、市場分析や財務予測の採点まで甘くなる |
| アンカリング | 最初に見た数字や事実が、その後のすべての判断の基準になる | TAMが₩5兆と示された後では、SOMの₩10十億が相対的に小さく見える |
| 新近性バイアス | 最後に見た情報を過大に重視する | 最終スライドの一文が、評価全体を揺さぶる |
| 確証バイアス | 最初の仮説を支持する証拠だけを取り上げる | 「韓国市場は小さい」と考えるメンターが、それを裏付ける情報だけを資料から選択的に見つける |
#学術研究で測定された影響はどれほど大きいのか
バイアスは抽象的な懸念ではありません。繰り返し行われた実験で、その影響がどれほどの大きさとして測定されているかを見てみましょう。
- アンカリング — TverskyとKahnemanによる1974年の古典的な実験では、被験者がルーレットを回して無作為な数字(10または65)を見た後、国連加盟国に占めるアフリカ諸国の割合を推定しました。10を見たグループの推定値の中央値は25%、65を見たグループでは45%でした。質問とはまったく関係のない無作為な数字が、20ポイントの差を生みました。
- アンカリング — 同じ論文では、8×7×6×5×4×3×2×1の値を推定するよう求められたグループの回答の中央値は2,250だったのに対し、1×2×3×4×5×6×7×8を推定するよう求められたグループでは512でした。正解は同じ40,320です。異なるのは提示された順序だけでした。
- VCの意思決定 — Gompersら(2020年、JFE)が885のVCを対象に行った調査では、投資判断で最も重視される要因はチームであり、ビジネスモデル、技術、市場よりも重みが大きいことがわかりました。チームが判断の中で最大の比重を占めるため、分野ごとに評価を分離しなければ、チームの強い第一印象がハロー効果を通じてほかのすべての判断に波及する余地が大きくなります。(チームの比重が大きいという事実だけでは、ハロー効果の直接的な証拠にはなりません。)
#AIによる分担審査が補える領域
OpenSeedが1人の総合担当に任せず、分野別の専門担当に審査を分ける理由の1つは、こうしたバイアスが伝わる経路を短くすることです。構造的に完全に遮断できると言っているわけではありません。分業してもバイアスはゼロにはなりません。それぞれのバイアスをどう軽減するかを示します。
| バイアス | AIによる分担審査での軽減方法 |
|---|---|
| ハロー効果 | 各メンターは、自分の担当分野についてのみスコアと根拠を出力します。チームの高評価が、市場担当メンターのスコア算出に直接入り込むことはありません。分野をまたぐスコアの影響を遮断します(ただし、全メンターが同じ元資料を共有している点は変わりません) |
| アンカリング | 評価基準と出力をメンターごとに分離します。別分野の大きな数字(TAMなど)が、ほかのメンターのスコア(SOMの妥当性検証など)の直接的な基準にはなりません |
| 新近性バイアス | AIは時間帯、空腹、疲労といった人間側の変動要因に影響されません。100件目の事業計画書も、1件目と同じように扱います |
| 確証バイアス | 各メンターは独立して動作します。あるメンターの仮説が、別のメンターの推論に直接流れ込むことはありません。見解が分かれた箇所は、意見の不一致としてユーザーに提示します |
さらに、同じ入力からは同じ結果が得られるという一貫性の保証があります。同じ事業計画書を2回提出した際のばらつきが抑えられていれば、「今回は運が悪かっただけ」と片付けるのではなく、「この箇所を修正すればスコアが上がる」と学べます。
#AIも例外ではない — 限界を率直に見る
AIは人間のバイアスから完全に自由だと主張すること自体、一種のハロー効果でしょう。AIによる分担審査には、独自の限界があります。
- 学習データのバイアス — 過去に成功した事業計画書が特定の業種、地域、創業者属性に偏っていれば、AIもその偏りを学習します
- 位置バイアス — 長い文脈の中央よりも冒頭や末尾の情報を重く扱う現象は、LLMでも観察されています(「lost in the middle」と呼ばれる現象など)。ここでは人間の新近性バイアスが弱まるのであって、なくなるわけではありません
- 共通の元資料 — 各分野のメンターは同じ元資料を読むため、ある箇所の強く訴える文章が、ほかの分野のスコアにも小さな影響を及ぼす可能性は残ります
- プロンプトへの依存 — メンターに与える指示の設計が不適切であれば、AIの推論もあらかじめ決められた結論へ誘導される可能性があります(確証バイアスの一種)
- 検証データの限界 — 実際の資金調達結果についての正解ラベル(採択・不採択)がなければ、AI審査の結果だけから、評価が実際の結果にどの程度対応しているかというキャリブレーション精度を測定することはできません
#適切に設計された人間の審査もバイアスを減らせる
公平に比較するために、明確にしておくべき点があります。人間の評価でバイアスが生じるからといって、すべての人間の審査が、無防備にその影響を受けているわけではありません。次のような設計は、人間の審査におけるバイアスを有意義に減らします。
| 人間の審査の設計 | 軽減できるバイアス |
|---|---|
| ブラインド審査(創業者の身元を非公開) | ハロー効果と属性に基づくバイアス |
| 複数メンターによる審査とスコアの平均化 | メンター個人によるばらつきを統計的に相殺 |
| 事前に定めた評価基準とチェックリスト | 評価基準の後付けの正当化を防ぐ |
| 審査順序の無作為化 | 新近性とアンカリングを部分的に軽減 |
| 独立した採点が完了するまでスコアを非公開にし、その後にすり合わせる | メンター間での印象の伝播を防ぐ |
したがって、実際の比較は「人間対AI」ではなく、「体系化されていない1人の人間による審査」と「適切に設計された人間の審査にAIの分担審査を組み合わせたもの」に近いと言えます。後者が最も強力な組み合わせです。
#AIと人間は実際にどう協働すべきか
結論は、AIが人間の審査担当者を代替するということではありません。両者は異なる形で誤るため、組み合わせることで最も信頼できる結果が得られます。
- AIによる分担審査 → 一次チェック:人間の認知的疲労や印象の伝播なしに、不足、弱点、整合性を分野ごとに素早く確認する
- 人間の審査担当者 → 最終判断:上記のバイアス軽減策を併用しながら、新しい産業、創業者の誠実さ、社会的価値などを定性的に判断する
- 創業者であるあなた → 意思決定者:両者の結果の差を使って、事業計画書のどこをさらに練り直すべきかを見極める
認知バイアスを減らすための一次審査
7つのコア評価役が事業の基礎を確認し、専門評価役は事業との関連性に応じて適用されます。それぞれが担当領域を独立して評価します。分析開始画面に表示される現在の支払い条件でご利用いただけます。
提出前に根拠・論理・リスクを確認する意思決定支援サービス
OpenSeedのレビューを始める →