AIの「自信度」が高ければ、仕事を任せていいのか

AIが「自信があります」と答えたら、そのAIに、そのまま仕事を任せてよいのでしょうか。
たとえば、講座に届いた問い合わせを、AIが内容に応じて「参加申し込み」「会場案内」「資料の送付」の3種類に分け、それぞれの担当者へ回すとします。AIが担当者を正しく選んでくれれば便利です。しかし、AIが問い合わせを間違った担当者に回したり、必要な確認が抜けたまま処理が進んだりすれば、結局は人がその問い合わせの対応をやり直すことになります。
2026年10月1日、AWS(Amazon Web Services)のStrandsチームが、Strands Decider 2Bを公開しました。Strands Decider 2Bは、規模の小さな判断用のAIモデルです。使う人が状況の説明と選択肢を渡すと、このモデルが選択肢をそれぞれ評価し、選んだ一つを答えとして返します。
Strands Decider 2Bは、Qwen3.5-2B-BaseというAIモデルを土台にしています。土台のモデルのうち文章の生成を受け持つ部分を、選択肢を採点するための部分に置き換えて作られています。
文章を作るAIと組み合わせて使う場合、Strands Decider 2Bは、届いた問い合わせなどについて「どの作業へ回すか」を決める役を受け持てます。このように回す先を決めることを、ルーティングと呼びます。
自信度の数字が何を表しているか確かめる
このモデルに選択肢の中から一つを選ばせると、モデルは、選んだ答えに加えて、選択肢ごとに付けた確率と、confidenceという指標を返します。この記事では、confidenceを「自信度」と呼びます。
ただし、選択肢に付く確率と自信度は、同じ数字ではありません。
選択肢が3つあり、そのうち最も高い確率が0.8だったとします。公式の計算式に当てはめると、自信度は0.7になります。これは計算方法を示すための例で、実際にモデルを動かした結果ではありません。
つまり、自信度が0.7だからといって、「この答えが正しい確率は70%だ」と読むことはできません。自信度は、モデルが付けた確率が一つの選択肢にどのくらい偏っているかをもとに計算される指標だからです。
自信度を仕事に使うなら、自信度が高かった答えのうち実際に正しかったものがどのくらいあるかを、使う人がその仕事に近いデータで調べる必要があります。公式モデルカード(モデルの説明書にあたる文書)も、短い分類課題で確かめた自信度を、別の用途にそのまま当てはめないよう注意を促しています。
まず、AIが間違えた後の対応を考える
ここからは、AIによる振り分けの仕組みを理解するための架空の例です。
公開講座の案内係に、「申込方法と、当日の資料について教えてください」という連絡が届いたとします。
AIがこの連絡を「参加申し込み」に振り分けたとしても、それだけでは、資料についての質問は未対応のまま残ります。AIが分類を一つ選べば済むのか、それとも一つの連絡に入っている複数の用件を、用件ごとに確認する必要があるのか。AIを使う人は、振り分けをAIに任せる前に、こうした仕事の進め方を決めておく必要があります。
分類の選択肢に、「よく分からないものは人に回す」を加える方法も考えられます。ただ、この選択肢を加えても、AIが自分では判断できない連絡を必ず見分けられるわけではありません。
AIによる振り分けを試すときは、正しく振り分けられた件数に加えて、AIの振り分けが間違ったまま次の作業へ進んでしまった例も記録しておくと役立ちます。たとえば、自信度が高かったのに振り分けが間違っていた例や、複数の用件が混ざった問い合わせ、情報が足りない問い合わせです。こうした記録をもとに、AIに渡す質問の文面や選択肢を見直せます。
無料で入手できても、運用の費用と手間は別に考える
Strands Decider 2Bのプログラムのコードと公開モデルは、Apache 2.0ライセンスという利用条件で提供されています。これらは無償で入手でき、ライセンスの条件に従って使えます。ただし、モデルを動かす機器やクラウドの費用、設定や保守の手間までなくなるわけではありません。
モデルの学習手順と、学習に使ったデータの出典も公開されています。学習データの入手先や利用条件はデータごとに異なるため、学習データの全部が同じライセンスで自由に使える、と捉えないことも大切です。
人がどの段階で確認するかを、先に決める
医師の仕事でこうした判断用AIをどう使えるかを考えるなら、患者情報を使わない架空の事務連絡を例にして、AIによる振り分けの仕組みを理解するところから始めるとよいでしょう。患者情報など実際の情報をAIで扱う前には、所属先のルールや利用環境の確認が必要です。
この記事は公開資料を読んだニュース解説です。著者がこのモデルを実測した報告や、診療での性能を検証した報告ではありません。
たとえば、AIが選んだ振り分け先を人が確認し、そのあとで返信の準備に進むという手順が考えられます。送信の前には、人が宛先と内容をもう一度確認します。このように、同じ仕事の中でも、AIに判断を任せる部分と、人が確認する部分を分けられます。
自信度の数字を見るだけでなく、「AIが間違えたとき、人がどの段階で気づけるか」まで考えることが、小さな判断用AIを仕事に組み込むときの出発点になりそうです。
※2026年10月5日時点の公開資料に基づきます。仕様や利用条件は更新されるため、導入時には最新の公式資料をご確認ください。
すでに登録済みの方は こちら