AIに自分の作品を採点させると、毎回甘くなった ― 作ったAIとは別のAIに同じ採点表で採点させた話

文・編集: J-WORKS編集部公開日: 更新日: 事実確認日:

J-WORKSでは、AIに手順書を渡して商品を作らせている。完成品の品質を確かめるため、作ったAI自身と、事情を知らない別のAIの両方に、同じ採点表で採点させたところ、作ったAIの自己採点はどの商品でも高めに出た。さらに、作ったAIが「すべて確認済み」とした部分に、別のAIが試すと見逃しが見つかった。採点の点差と、そこから決めた品質確認のやり方の記録。

検証条件

J-WORKSでは、商品の作り方をまとめた手順書をAIに渡し、AIに商品を作らせている。2026年9月29日には、IT作業の事故事例をまとめた「事故カルテ集」、Excelテンプレート、note記事、デジタルペーパー(柄の画像素材)といった商品を作らせた。作った商品をそのまま合格にしてよいかを判断するため、6項目をそれぞれ5点で評価する(30点満点)採点表を用意した。今回確かめたのは、「商品を作ったAI自身に採点させた場合と、作った経緯を知らない別のAIに同じ採点表で採点させた場合とで、点数は変わるのか」という点である。

実行内容

同じ商品を、同じ採点表で、2通りに採点させた。1つは、その商品を作ったAI自身による自己採点である。もう1つは、作った経緯や手順書の内容を知らされていない、別のAIによる採点である。別のAIには辛口にレビューするよう求め、採点表の各項目を採点させた。あわせて、作ったAIが「確認済み」と報告していた内容についても、別のAIに実際に試させた。報告を読むだけでなく、実際に試させたのがこの検証の要点である。

結果

採点は、どの商品でも作ったAIの自己採点の方が高かった。事故カルテ集では、「買う価値」の項目が自己採点では4点、別のAIの採点では3点だった。Excelテンプレートは、30点満点中、自己採点が27点、別のAIが22点だった。note記事は、自己採点が24点、別のAIが21点だった。点数の差以上に大きかったのは、確認作業の中身の違いである。事故カルテ集には、危険な操作を止める方法の例が載っており、作ったAIはこれを「20通りすべて確認済み」と報告していた。ところが別のAIが試したところ、実際の事故と同じ書き方(フォルダの中身をまるごと消すような操作の書き方)が、止められずに素通りしてしまった。作ったAIの「確認済み」は、自分で考えた試し方の範囲での確認にすぎなかったことになる。3つの商品のいずれでも、作ったAIの点が別のAIの点を下回ることは無く、点差はExcelテンプレートで5点、note記事で3点だった。採点表を共通にしたことで、甘さを点差という数字で比べることができた。

採点結果(同じ採点表: 6項目×各5点=30点満点)
商品作ったAIの自己採点別のAIの採点記録に残っている範囲
事故カルテ集「買う価値」4点「買う価値」3点「買う価値」の1項目のみ
Excelテンプレート27点(30点満点)22点(30点満点)合計点のみ
note記事24点21点合計点のみ
デジタルペーパー記録なし記録なし点数の記録は残っていない

6項目のうち、項目名が記録に残っているのは「買う価値」だけです。ほかの5項目の名前と、項目ごとの点数は記録に残っていないため、表には載せていません。

別のAIが見つけた見逃しの例(記録に残っている1件)
確認した部分作ったAIの報告別のAIが試した結果
事故カルテ集の、危険な操作を止める方法の例「20通りすべて確認済み」実際の事故と同じ書き方(フォルダの中身をまるごと消す操作など)が、止められずに素通りした

失敗原因

自己採点が高めに出た理由の一つは、作ったAIが、自分の意図や作る過程で考えたことを前提に完成品を見てしまうためだと考えている(ただし、後の「この検証の限界」に書いたとおり、レビューの指示の違いによる影響は切り分けられていない)。作り手は、説明が足りない部分も頭の中で補って読めてしまい、自分が想定した使い方でしか試さない。確認のための試し方も自分で考えるため、自分が想定していない書き方や使い方は、最初から試験の対象に入らない。この構造は人間の作り手にもよくあることだが、AIは「確認済み」と自信を持って報告するため、報告だけを見ていると見逃しに気づきにくい。書いた本人の校正より、別の人の校正の方が誤字を見つけやすいのと同じ構造である。AIだから客観的に見られる、とは限らない。

改善

この結果を受けて、商品の品質確認のやり方を次のように決めた。(1)AIに作らせたものは、作ったAIに採点させない。(2)作った経緯を知らない別のAIに、同じ採点表で辛口のレビューをさせる。(3)指摘された点を直した版を、もう一度採点してから合格にする。(4)作ったAIが自分で考えた試験だけで「確認済み」としない。特に、安全に関わる部分は、実際に起きた事故と同じ書き方など、作り手が想定していない入力でも試す。AIの採点を「合格の判定」として使うのではなく、「見落としを探す道具」として使う、という考え方である。指摘が出たら作ったAIに直させ、直した版を再び別のAIに採点させてから合格にする。

現在の結論

2026年9月29日の採点で確認できたのは、Excelテンプレートで27点対22点、note記事で24点対21点、事故カルテ集の「買う価値」で4点対3点と、作ったAIの自己採点がいずれも高めに出たこと、そして「すべて確認済み」とされた部分に別のAIの試験で見逃しが見つかったことである。AIに品質チェックまで任せる場合は、作ったAIとは別のAIに、作った経緯を伝えずにレビューさせることをおすすめする。採点表を共通にしておくと、点差という形で甘さを比べられる。また、AIの「確認済み」という報告は、何を、どんな入力で確かめたのかまで見てから受け取るとよい。別のAIにレビューさせるときのポイントは、(1)作った経緯や作り手の意図を伝えない、(2)採点表は作り手と同じものを使う、(3)問題点を探す立場で、辛口にレビューさせる、(4)作り手が「確認済み」とした項目も、別の入力で試し直させる、(5)指摘を直した版をもう一度採点する、の5点である。点差が大きい項目ほど、作り手が見落としている部分がある可能性が高い。特に安全に関わる確認は、作り手が用意した試験に合格しただけで「確認済み」とせず、実際に起きた事故の書き方など、現実に近い入力で試すことが大切である。

この検証の限界

この比較は、条件が完全にはそろっていない。別のAIには辛口にレビューするよう求めたが、作ったAIの自己採点には同じ指示を出していない。そのため、点差の一部は「作り手が自分で採点したこと」ではなく、この指示の違いから生じた可能性がある。今回の結果だけでは、自己採点であること自体が点差の原因だとは断定できない。また、比べたのは2026年9月29日の1回分で、点数が記録に残っているのは3商品だけであり、項目ごとの点数や採点の理由は残っていない。原因を切り分けるには、両方に同じ指示を出して採点させる比較が必要で、これはまだ行っていない。一方、「すべて確認済み」とされた危険な操作の例が、別のAIの試験で素通りした件は、点数の付け方とは関係なく、実際に試した入力で確かめられた事実である。

根拠

2026-09-29(JST)に実施した商品づくりの採点結果(作り手のAIの自己採点と、別のAIによる採点)を記録した、J-WORKS社内のノウハウ記録による。