AIベンダーの選定は、ほとんどの場合デモで決まります。しかしデモは、手に入る判断材料の中で最も当てにならない部類です。デモが証明するのは、ベンダーが選んだ条件のもとで、モデルがある作業を1回こなせるということだけです。貴社が買うのは、ベンダーが選んでいない条件のもとで同じ作業を1万回こなす仕組みです。この2つを実際に見分けるのが、以下の9つの質問です。それぞれの質問が本当は何を確かめているのか、はぐらかした答えがどう聞こえるのかもあわせて示します。
これらの質問が重要なのは、成功する確率がもともと低いからです。企業の生成AIパイロットの95%は、損益に測定可能な効果を出していません(MIT Project NANDA, 2025)。同じ調査は、この確率を上回るやり方も示しています。専門ベンダーからの購入や協業は約67%の割合で成功し、これは内製のおよそ3倍です。外部と組むことは有効です。ただし、95%の大半は組み方を誤ったケースです。
1. これまでに本番稼働させたものは何で、今は何をしていますか?
聞くべきは「何を作ったか」ではありません。今日この時点で、利用者が頼りにしている状態で「何が動いているか」です。対象の業務、処理件数、稼働してからの期間を尋ねてください。
悪い答えの例:パイロット、試作品、概念実証(PoC)の実績を過去形で並べる答えです。デモは誰にでも作れます。本番に出して動かし続けることこそが技術のすべてであり、それをやり遂げた会社は具体的な話ができます。当社の実績は導入事例のページに、案件ごとの投資額と効果とともに掲載しています。
2. 実際に作業するのは誰ですか。契約前に会えますか?
提案の場に出てくる人と、実際に手を動かす人が違う。多くの案件はここからおかしくなります。担当者の名前と経験の水準、ほかの案件と兼務しているかどうかを尋ねてください。
悪い答えの例:「当社のチームが担当します」という答え、組織図、あるいは「案件には近くで関わります」と言う役員クラスの担当者です。範囲を決める人と構築する人が別であれば、貴社が伝えた前提知識はすべて、もう一度別の人へ伝え直されることになります。これこそが、貴社チームに入り込む(フォワードデプロイ型)体制が必要とされる理由です。詳しくはフォワードデプロイ型の解説記事(英語)をご覧ください。
3. 総額はいくらですか。超過した場合は誰が負担しますか?
1つの金額を書面で示してもらい、期間が延びた場合にどうなるかも確認します。契約形態を見分けるうえで、9つの中で最も早く答えが出る質問です。
悪い答えの例:単価表、金額の幅、あるいは「範囲によります」という答えです。範囲によって変わるのは当然です。問題は、そのリスクを誰が負うのかです。安く始めて後から請求が膨らむ仕組みについては、Bait-and-Billの記事(英語)で解説しました。当社の料金は公開していますので、同じ基準で当社を評価してください。
4. うまくいっているかどうかを、どうやって判断しますか?
確認したいのは指標と測定方法です。できれば構築前に合意しておきます。どのテストセットに対する正答率か。どの基準値と比べた解決率か。誰が、どの頻度で測るのか。
悪い答えの例:定性的な成果、利用状況の数字、あるいは「成功の定義はヒアリングの中で一緒に決めましょう」という答えです。AIの構築を本業とする会社であれば、測り方について自分たちの考えを持っています。それが評価セット(英語)です。貴社の案件の測り方について何も意見がないのであれば、それ自体が判断材料になります。
5. モデルが間違えたとき、何が起きますか?
確率的に動くシステムは必ず間違えます。確かめたいのは、質問される前から失敗の仕方を考えてあるかどうかです。ガードレール、エスカレーションの経路、人による確認の工程、そして最悪の日に影響がどこまで広がるかです。
悪い答えの例:「このモデルは非常に高精度です」という答えや、信頼性をモデルの周りの仕組みではなくモデル自体の性質として語る答えです。本物の答えは、コードで実装した制約を説明します。モデル提供元のベンチマークへの信頼を語るものではありません。
6. 基盤のモデルが変わったとき、何が起きますか?
モデルの提供元は、自社の都合で旧版の提供を終了し、調整を加え、挙動の変わる更新を出します。何が壊れるのか、どうやってそれに気づくのか、どれだけ早く元に戻せるのかを尋ねてください。
悪い答えの例:言葉に詰まる、あるいは裏付けのないまま「特定のモデルに依存しません」と主張する答えです。信頼できる答えには、バージョンの固定、プロンプトのバージョン管理、回帰テスト、正常に動いていた状態へ戻す手順が含まれます。これらの層は本番用エージェントの構成についての記事(英語)で説明しています。
7. コード、プロンプト、評価セットは誰のものになりますか?
3つすべてについて明示的に尋ねてください。インフラとデータについても同様です。プロンプトと評価セットは案件を通じて蓄積された知識であり、黙ってベンダーの手元に残されやすい部分でもあります。
悪い答えの例:「成果物」の所有権という言い方や、コードは貴社のものでも全体を制御する処理はベンダーのプラットフォーム上に残る構成です。離れるには作り直すしかないのであれば、その契約の代金には「二度と離れられないこと」が含まれています。
8. 公開後の運用費用はいくらですか。誰が運用しますか?
稼働中のAIシステムは少しずつ挙動が変わっていきます。誰かが見ていなければなりません。月額の金額と、その責任者を尋ねてください。
悪い答えの例:運用を任意の項目や、サポート商品の1つとして扱う答えです。推論そのものは安価です。1件あたり数セントで、しかも急速に下がっています。しかし、監視、評価結果の悪化への対応、ドリフトの管理は実際に手間のかかる仕事です。当社の場合は、管理対象のシステム数に応じて月額$3,000〜$20,000です。後から判明するよりも、最初にお見積りでお伝えしたいと考えています。
9. どんな場合に「これは作るべきではない」と言いますか?
9つの中で最も多くのことが分かる質問であり、ほとんど誰も聞かない質問です。確かめたいのは、その会社が向き不向きについて意見を持っているのか、それともどんな課題も自社の商品でたまたま解決できることになっているのかです。
悪い答えの例:前向きな熱意だけの答えです。依頼する価値のある会社は、進めるべきでない条件を挙げられます。データがない。業務の件数が少なすぎる。正解を定義できない。指標の責任者がいない。顧客に「やめたほうがいい」と言ったことが一度もない会社にとって、貴社は顧客ではなく売上の見込みです。
答えの使い方
当社を含め、すべてのベンダーに9つの質問をし、答えを横に並べて書き出してください。個々の答えよりも全体の傾向が重要です。本番まで届ける会社の答えは具体的で、数字が入っていて、少し地味です。デモで終わる会社は、何ができるかを自信たっぷりに語ります。この比較を体制の違いから整理したものとして、コンサルティング会社や自動化代行会社と当社の違いをまとめています。相手のほうが適している場面も記載しています。



