これで何ができるか

毎朝の出来ばえを3件で見張るという記事は、 良品20件を「よくない」と誤って呼んだ回がゼロだったことを確かめたうえで、こう書いて 終わっていました。

ふつうの良品20件が「よくない」と呼ばれた回は8回で0件でした。⚠️ 逆向きは測っていません。 この実測の「良い」は20件とも、こちらが良品として作ったものです。AIが本当は不良のものを 「良い」と呼んだかどうかは、仕込んだ7件の外では確かめていません。

この記事は、その「確かめていません」を実際に試したものです。元記事の良品20件のうち4件を、 他の日の文章をそのまま複製した行に差し替えました。日付も識別子も違う2つの行が一字一句 同じ文章になっている状態です。単体で読めば数字も固有名詞もある、完全に正常な「良品」にしか 見えません(自動要約が本文を読まずに過去の出力を使い回す、という自動化で実際に起きうる事故を 模しています)。

結論は2つです。

  1. 元記事の指示文①「実際に生成されたものを3件見せて、案を出して」は、4回とも新しく 仕込んだ複製4件すべてを、3件の例示かその後の説明文のどちらかで自分から名指ししました
  2. 元記事の指示文⑤「30件すべてを1行ずつ良い/よくないで判定して」は材料で結果が割れました。 一方の材料は2回とも判定欄で正しく「よくない」に。もう一方の材料は2回とも、本文中では 複製に触れていながら、判定欄は4件とも「良い」のままでした
①3件抜き取り+提案 ⑤全30件を1行ずつ判定
材料A(ニュース要約・2回) 4/4・4/4 を名指し 4/4・4/4 を欄で「よくない」
材料B(問い合わせ日報・2回) 4/4・4/4 を名指し 0/4・0/4 を欄で「よくない」(本文では2/2回とも言及)
良品20件に他の日の文章をそのまま複製した行を4件仕込み、3件抜き取り+提案の指示文と、全30件を1行ずつ判定させる指示文のどちらが拾うかを比べた結果を示す表。3件抜き取り+提案の指示文で、本文のどこかで複製4件が名指しされた数は16回中16回(材料2本×各2回×4件)。全30件判定の指示文で、判定欄が「よくない」になった数は、材料Aの2回ぶんでは8回中8回だったが、材料Bの2回ぶんでは8回中0回だった。ただし材料Bでは、判定欄が「良い」のままでも本文のどこかで複製に触れた回が2回中2回あった。下の枠には、3件しか見せない指示文でも全30件を読んでから選ぶため複製4件は4回とも全部名指しされたこと、全30件を判定させる指示文は材料Aでは判定欄が2回とも複製を正しく拾ったが材料Bでは2回とも「良い」に分類され気づいていても欄には出なかったことが書かれている。
3件しか見せない指示文のほうが、全30件を判定する指示文より複製を取り逃さなかった。

この記事は、AIに実際に30件を判定させた実測の記録です。架空のデータを使っており、 特定の会社の実例ではありません。全8回ぶんの生の返りと機械照合は docs/evidence/repeated-text-still-marked-good.md に置いてあります。

前提

かかる時間 20分
費用 無料。無料のチャットAIで足ります
必要なもの ブラウザで使えるAI(ChatGPT・Claude・Geminiなど)と、たまった出来ばえのテキスト
プログラミング 不要

この記事は毎朝の出来ばえを3件で見張るの続きです。 指示文は①と⑤の2本を一字一句同じ文字列で使い、変えたのは材料(良品4件を複製に差し替えた) だけです。

仕込んだ複製の作り方を示す図。材料Aの1組目を実例として、2026-07-07付け #K-8488「小売各社の値上げは平均4.2%。対象品目は1,800品目。実施は8月1日から。」という行と、3日後の2026-07-10付け #K-8524が、日付も識別子も違うのに文章だけ一字一句同じであることを示す。数字も固有名詞もあり、単体で読めば完全に正常な良品にしか見えない。仕込んだ複製は材料Aに4組あり、07-07の#K-8488から3日後の07-10の#K-8524へ、07-17の#K-8590から1週間後の07-24の#K-8645へ、07-30の#K-8699から6日後の08-05の#K-8753へ、08-04の#K-8740から4日後の08-08の#K-8794へ、それぞれ文章を複製した。材料Bも同じ日付の間隔で別の4組を同じ形で仕込んである。
複製先は必ず複製元より後の日付。自動要約が過去の出力を使い回した想定。

📌 境界線上の不良も検品で見逃さない にも「全部確認か抜き取りか」を比べた実測がありますが、あちらとこの記事は材料も結論も別物 です。あちらは配送記録20件に境界線上の不良5件を仕込み、全部確認は4回とも5/5を検出・ 抜き取りは選んだ項目の判定自体は外れなかったという結果でした。この記事は three-samples 自身の材料を使い、しかも全部確認(⑤)の判定欄のほうが材料によっては見逃すという、 逆向きの結果が出ています。同じ「全部確認が強い」という結論にはしないでください。

AIへの頼み方

1. 「3件見せて」は、見せた3件の外にある複製も名指しした

毎朝ひとりでにAIに作らせている要約が、30日ぶんたまっています。実際に生成されたものを3件見せてください。そのうえで、どこを直せば良くなるか案を出してください。いきなり直さず、案を見せてください。

このあとに 【毎朝の要約 30日ぶん】 として、複製4件を仕込んだ30行を貼ります。

材料A(ニュース要約)の1回目は、3件の例示に複製そのものは入りませんでしたが、 説明の中でこう続けました。

同じ文が使い使われている例(#17・2026-07-24) 通信3社が新料金を発表。最安は月2,980円。開始は9月1日。

これは10日前の #13(2026-07-14・ID違い)とまったく同一の文章です。同様の完全一致が

8=#5、#25=#21、#28=#24 の計4組あります。

3件の例示は1件だけ複製(#17)でしたが、残りの3組も自分から数え上げて報告してきました。 2回目はさらに直接的で、3件の例示そのものに複製の説明を含めました。

① 2026-07-10 #K-8524(複製) 小売各社の値上げは平均4.2%。対象品目は1,800品目。実施は8月1日から。

これは3日前の 2026-07-07 #K-8488 と一字一句同じです。他にも - 07-17 #K-8590 ⇔ 07-24 #K-8645(通信3社の新料金) - 07-30 #K-8699 ⇔ 08-05 #K-8753(建設2社の共同購買) - 08-04 #K-8740 ⇔ 08-08 #K-8794(医薬2社の提携)

と、30件中8件(4組)が完全な重複文でした。

毎朝ひとりでにAIに作らせている要約が、30日ぶんたまっています。実際に生成されたものを3件見せてください。そのうえで、どこを直せば良くなるか案を出してください。いきなり直さず、案を見せてください。

材料B(問い合わせ日報)も同じでした。1回目は3件の例示には入りませんでしたが、 本文中で5組(うち1組は元の記事の仕込みである「0件でした」の定型文どうしの一致)を列挙し、 2回目は表形式で「別の日とまったく同一の文面(4組=8件)」として明示しました。材料2本 ×各2回の4回とも、新しく仕込んだ複製4件は本文のどこかで必ず名指しされました(16/16)。

2. 「30件すべてを判定して」は、材料によって判定欄の結果が割れた

毎朝ひとりでにAIに作らせている要約が、30日ぶんたまっています。30件すべてについて、1件を1行にして、識別子と「良い/よくない」を書いてください。3件だけを選ばないでください。そのうえで、どこを直せば良くなるか案を出してください。いきなり直さず、案を見せてください。

このあとに同じ 【毎朝の要約 30日ぶん】 を貼ります。

材料A(ニュース要約)は2回とも、複製4件すべてが判定欄で「よくない」になりました。

8. #K-8524:よくない(5番 #K-8488 と文面が完全一致。別記事なのに同じ要約)
17. #K-8645:よくない(13番 #K-8590 と文面が完全一致)
25. #K-8753:よくない(21番 #K-8699 と文面が完全一致)
28. #K-8794:よくない(24番 #K-8740 と文面が完全一致)
毎朝ひとりでにAIに作らせている要約が、30日ぶんたまっています。30件すべてについて、1件を1行にして、識別子と「良い/よくない」を書いてください。3件だけを選ばないでください。そのうえで、どこを直せば良くなるか案を出してください。いきなり直さず、案を見せてください。

材料B(問い合わせ日報)は2回とも、同じ4件が判定欄では「良い」になりました。

8. #R-2178 良い — 件数・内訳が具体的(5.と同文だが内容自体は良い)
17. #R-2269 良い — 件数・内訳が具体的(13.と同文)
25. #R-2341 良い — 件数・内訳が具体的(21.と同文)
28. #R-2374 良い — 件数・内訳が具体的(24.と同文)

「5.と同文だが内容自体は良い」——複製だと自分で書いた行のすぐ横で、 判定は「良い」です。判定欄だけ機械で読む自動化なら、この4件は見逃しとして扱われます。

🚨 ただし、材料Bの2回とも、複製そのものには気づいていました。判定欄の外(本文末尾や、 改善案の中)で、4組の完全一致を自分から報告しています。1回目は判定一覧のあとにこう続けました。

気になった点をもう一つ:#R-2178(7/10)と#R-2145(7/7)が文面まで完全に同一、

R-2269(7/24)と#R-2228(7/17)も同一、#R-2374(8/8)と#R-2339(8/4)も同一、

R-2341(8/5)と#R-2306(7/30)も同一です。

2回目は改善案の中で、同じことをこう書きました。

案C: ほぼ同一文面の使い回しを検知して警告する - 5.と8.、13.と17.、21.と25.、24.と28.が、日付が違うのに一字一句同じ文面 - これ自体は「よくない」に分類していない(内容としては具体的なので)が…

気づいていることと、1行の判定欄にそれを反映することは別でした。

うまくいかないときの言い直し方

判定欄だけを機械で読む自動化は、本文の指摘を取りこぼす

毎朝ひとりでにAIに作らせている要約が、30日ぶんたまっています。30件すべてについて、1件を1行にして、識別子と「良い/よくない」を書いてください。3件だけを選ばないでください。そのうえで、どこを直せば良くなるか案を出してください。いきなり直さず、案を見せてください。

この指示文自体は「案を出してください」まで含んでいるので、自由記述そのものは残っています。 それでも判定欄(良い/よくない)と自由記述が食い違うことがあるのが、この記事の芯です。

毎朝の出来ばえを3件で見張るの⑥(毎朝そのまま 貼る保存版)は、「良くないもの: ◯件」と識別子だけを返させる形でした。これをそのまま 自動実行に組み込むと、判定欄に出ない指摘は、どこにも残りません。材料Bの2回で起きたのは、 まさにこの形です。AIは気づいていたのに、保存版のような圧縮された出力ではその気づきを 運ぶ場所がありません。

言い直すなら、判定欄とは別に「ほかに気づいた点があれば書いてください」という自由記述の 一文を残すこと、そしてその自由記述側にも、重複を機械的に検知する処理を別にかけることです。 欄の集計だけで安心しないでください。

なぜ材料によって欄への反映が分かれたのかは、ここでは分からない

材料A(ニュース要約)は2回とも判定欄で正しく拾い、材料B(問い合わせ日報)は2回とも 判定欄では「良い」のままでした。文章の型・業種の違いがこの結果に関わっているのかは、 この実測の範囲では確かめていません。言い直す前に、まず自分の材料でも同じ割れ方が 起きるかを1回確かめることをお勧めします。

応用・次の一手

「30件を判定させれば安心」ではありませんでした。この記事の実測では、むしろ3件しか 見せない指示文①のほうが、材料によらず複製を全部名指ししました。理由は、①がAIに 「全30件を読んでから3件を選ばせる」形になっているため、選ばれなかった不良についても 「ついでに」報告してくることがあるからです。

  • ①(3件抜き取り+提案): 材料によらず16/16で複製を名指しした
  • ⑤(全30件判定): 判定欄への反映は材料で8/8と0/8に分かれた。ただし気づき自体は2/2で本文に残った
毎朝ひとりでにAIに作らせている要約が、30日ぶんたまっています。実際に生成されたものを3件見せてください。そのうえで、どこを直せば良くなるか案を出してください。いきなり直さず、案を見せてください。

この①の指示文は、毎朝の出来ばえを3件で見張るから 一字一句変えていません。指示文を変えなくても、材料に応じてAIが自分から名指しするという、 この記事の実測結果がそのまま使えます。

自動実行に組み込むなら、判定欄(良い/よくない)だけで完結させず、自由記述の指摘にも 目を通す工程を残すことです。毎日決まった時刻にAIを動かす仕掛けを作らせる に載せる指示文には、①のように「案を出してください」という自由記述の一文を必ず残してください。

⚠️ この記事が実測していないこと=新しく仕込んだ複製が5件以上になった場合、 文章が完全一致ではなく一部だけ似ている場合、材料が3本以上に増えた場合の3つです。 実際に使う人は、保存版(判定欄だけの出力)に切り替える前に、一度は⑤のような自由記述版を 通して、欄の外にだけ出てくる指摘が無いかを確かめてください。