AIに任せていいのかどうかを、毎回なんとなくで決めている。
ひと月で11回測って出た見分け方は、その作業に解釈の分かれる箇所があるかどうかだった。
この記事の読者:全社員・非専門/情シス・DX担当(AIに仕事を渡すたびに、これは任せていいのかと毎回迷っている人)
要点:当方は2026年8月17日から9月16日までのひと月で、生成AIに業務を任せたときに何が壊れるのかを11回測った。足し算・日付の変換・ToDoの抽出といった機械的な処理は、測った範囲では取りこぼしが確認できない(表10本の合計は10本とも一致、相対日付12問は12問正解、本物のToDoは5件中5件)。外したのは、解釈が2通り以上ある箇所を、AIが宣言せずに1つへ決めた場面に集中している。任せる業務の見分け方は、難易度ではなく、あいまいな箇所の数で決まる。
社内で生成AIに仕事を渡すとき、任せるかどうかの判断は、たいてい作業の難しさで行われている。当方はこのひと月、本紙の実測記事11本で、AIが業務のどこを外すのかを自分で走らせて数えてきた。集計した結果、見分け方として機能したのは難易度ではなく、その作業に解釈の分かれる箇所がいくつあるか、という一点であった。
以下に11回の内訳を置き、そこから取り出した3つの問いを渡す。当方が測れていない範囲は末尾に書く。
ひと月で測った11回の分母と結果
いずれも本紙が自分で材料を作り、自分で走らせたものである。実在の企業データ・顧客データは一件も使っていない。
| 実施日 | 確かめたこと | 分母と結果 |
|---|---|---|
| 08.17 | ExcelをCSVにすると何が落ちるか | 仕掛け10項目。画面から隠した行は3経路とも残った |
| 08.19 | 二段組PDFからの本文の取り出し | 13行のうち5行で左右の段が同じ行に合流 |
| 08.24 | 正規表現による議事録のマスキング | 32か所中、氏名は13か所のうち6か所しか消えない |
| 08.27 | Excelの表を渡す4つの経路 | 64セル中、画面と一致しないセルが45/29/5 |
| 09.03 | 点検する側の文字数の数え方 | 45本中13本に、平均16.1文字ぶんの余地 |
| 09.06 | 要約に仕込んだ数字のすり替え | 30件の判定で、書き換え13件中13件を検知 |
| 09.08 | 相対日付から絶対日付への変換 | 12問中12問正解。うち6問は正解が一つに定まらない |
| 09.09 | 文字起こしからのToDo抽出 | 本物5件中5件。非ToDoは5件中4件を除外 |
| 09.15 | 言い回しを変えた個人情報の伏せ方 | 9項目×5回。あだ名は5回中2回しか拾われない |
| 09.16 | 表の合計 | 表10本とも1円まで一致。前提の置き方で最大3倍差 |
| 09.16 | 和暦から西暦への変換 | 10件中2件が、存在しない日付のまま出力 |
計算そのものは、取りこぼしが確認できない
数字を扱う処理は、当方が測った範囲では外れていない。5行から40行までの表10本の合計は、計算機を使わずに出して10本とも1円まで一致した。基準日を固定した相対日付12問は12問とも正解している。会議の文字起こしに仕込んだ本物のToDo5件は、担当者・中身・期限まで5件とも抽出できた。要約に混ぜた数字のすり替えも、原文との照合を明示的に依頼した条件では、書き換え13件のうち13件を検知し、誤検知はゼロであった。
個人情報を伏せる作業も、形の決まっているものは強い。氏名・メールアドレス・携帯電話番号は、言い回しを5通りに変えても5回とも拾われた。
「AIは計算が苦手だから任せない」という選び方は、当方の測った範囲では根拠を持たない。ただしこれは、当方が投げた課題・その日・そのバージョンでの挙動であって、モデル一般の実力の話ではない。
外したのは、解釈が分かれる箇所を黙って1つに決めたところ
11回のうち、結果が崩れた場面は性質がそろっている。入力のどこかに解釈の余地があり、AIがそれを宣言せずに1つへ寄せたときである。
相対日付の12問。正解率は12問中12問だが、正解表を作る段階で、12問のうち6問は「これが唯一の正解」と言い切れない表現だった。「今週中」が金曜までか日曜までかは、組織によって違う。AIはそれを黙って一つに決めて答えている。当たっていたのではなく、揃っていただけの回が半分ある。
表の合計。足し算は10本とも合っていたが、空欄・ダッシュ・マイナスの行をどう扱うかを、当方は宣言せずに処理していた。小計行が混じった表では「合計」の候補が3通りあり、実測した表では、その置き方しだいで答えが最大3倍ちがった。
和暦から西暦への変換。10件中2件が、警告なしにそのまま西暦へ変換された。うるう年ではない年の「2月29日」と、改元日と矛盾する「令和1年4月30日」である。変換の式は正しく、入力の矛盾だけが素通りしている。
ToDoの抽出。本物は5件とも拾えた。危なかったのは逆で、ToDoに見えて実は違う5件のうち1件、会議に出ていない同僚の名前が挙がっただけの仕事が、担当者未定のままリストへ紛れ込んだ。本物を見逃せばすぐ気づくが、偽物が紛れ込んでも誰も気づかない。
個人情報の伏せ方。「隠してください」とだけ頼んだ回では、内線番号と社内チャットのIDは5回中3回、呼び名(あだ名)は5回中2回しか拾われなかった。何を個人情報と見なすかの線引きを、依頼側が渡していない。
AIに届く前に、材料のほうが壊れていた回が4回ある
11回のうち4回は、AIの出力ではなく、AIへ渡す手前の工程で数字が動いていた。この4回は、プロンプトをどれだけ整えても直らない種類である。
Excelを安全のためにCSVへ変換する手順は、当方も安全側の作業だと考えていた。実測すると、落ちるのは数式・書式・2枚目のシートで、画面から隠した社内メモの行は3経路とも残った。落ちてほしいものが落ちず、残ってほしいものが落ちている。向きが逆であった。
同じExcelの表(8行8列=64セル)を4つの経路でテキストにしたときは、画面の表示と一致しないセルの数が経路ごとに開いた。pandasで45個、openpyxlで29個、表計算ソフトの「CSVで保存」で5個。PDF経由は行と列の対応そのものが崩れ、セル単位では数えられない。いちばん素朴な経路がいちばん壊れなかった。
二段組のPDFでは、13行のうち5行で左段と右段が同じ行に合流し、段落の順番まで入れ替わった。PDFの中身は「この文字を、この座標に置け」という指示の集まりでしかなく、段組も読む順番もそこには書かれていない。
正規表現でマスキングした議事録では、メール4/4・電話8/8・住所2/2・社員番号と口座3/3・URL2/2が全て消えた一方、氏名は13か所のうち6か所しか消えなかった。消えた6か所は「さん」「部長」が付いたものだけである。出席者名簿との完全一致に切り替えると31/32まで届き、残った1件は名簿に無かった人物だった。
なお、材料ではなく点検する側の物差しが狂っていた回も1回ある。本紙の検証ツールが<title>の文字数を半角も全角も同じ1文字として数えていたため、全角換算で測り直すと、45本中13本が平均16.1文字ぶんの余地を残したまま公開されていた。機械に測らせている数字も、数え方を一度は自分で確かめる必要がある。
渡す前に数えるのは、難易度ではなくあいまいな箇所の数
11回の集計から、当方が実際に使っている問いは3つである。
1つめ。その作業に、解釈が2通り以上ある箇所がいくつあるか。「来週まで」の締切、空欄の扱い、合計の範囲、元号の境目、何を個人情報と見なすか。1つでもあれば、そこは任せる前に自分で決めて、依頼文に書く。決めずに渡すと、AIは必ず1つに決めるが、決めたことを言わない。
2つめ。材料がファイルを経由するか。Excel・PDF・スクリーンショットを挟むなら、渡す前に一度テキストの状態を目で見る。4回の実測はいずれも、この一手間で防げる崩れだった。
3つめ。間違いに気づける人が、出力の先にいるか。本物の抜けはすぐ分かる。危ないのは、もっともらしい形で増えたほうである。誰も照合しない出力を作らせる作業は、精度が高くても任せない。
一言足しただけで戻った回が3つある
崩れた場面のうち3つは、依頼文に短い一文を足すだけで結果が変わった。
和暦変換のあとに「存在しない日付や元号の矛盾がないか確認して」と足すと、素通りしていた2件とも検出できた。マスキングでは「すべて」「匿名化」という語を足した回だけ、あだ名まで含めてほぼ全部が拾われている。要約の数字も、「原文と照合して」と明示した条件での13/13である。
共通しているのは、あいまいな箇所の扱いを、依頼側が言葉にして渡したかどうかだけである。プロンプトの巧拙ではない。
当方がこのひと月で測れていない範囲
まず、11回はいずれも試行回数が少ない。30件、12問、10本、5回という分母である。n数を大きく見せるつもりはない。同じ条件で100回回せば、計算側にも取りこぼしが出る可能性は残る。
次に、複数モデルの比較をしていない。判定と変換を行ったのはいずれも本紙の編集AIで、他社モデルで同じ結果になるかは確かめていない。モデルの優劣を並べる材料としては使えない。
そして、3つめの問い(照合する人がいるか)だけは、当方が測れていない。これは出力の性質ではなく組織の性質であり、自分で走らせて数えられる対象ではなかった。11回のうち、ここに触れる実測は1回もない。だから3つめだけは、実測ではなく当方の見立てである。読む側で扱いを分けていただきたい。
編集責任者:Tatsuki Morohashi(発行人・運営者情報) / 最終更新:2026.09.21
本記事はAI編集部が執筆しています。掲載の判断と内容の責任は編集責任者が負います。誤りを見つけられた場合はお問い合わせからご指摘ください。訂正の手順は訂正ポリシーに定めています。
参考にした情報と、その分母(本稿の出典は、いずれも本紙が自分で走らせた実測の回である。外部の調査・ベンダー資料は使っていない)
・ExcelをCSVにして落ちるもの(2026年8月17日実測)/仕掛け10項目・3経路。非表示行は3経路とも残存
・二段組PDFの本文取り出し(2026年8月19日実測)/13行中5行で段が合流
・正規表現による議事録マスキング(2026年8月24日実測)/議事録31行・仕込み32か所。氏名13か所中6か所のみ消去
・Excelを渡す4経路の忠実度(2026年8月27日実測)/8行8列=64セル。不一致45/29/5、PDF経由は計数不能
・titleタグの文字数の数え方(2026年9月3日実測)/対象45本。半角8字以上を含む13本に平均16.1文字・最大23文字の余地
・要約への数字すり替えの検知(2026年9月6日実測)/3回・計30件の判定。書き換え13件中13件検知・誤検知0
・相対日付の変換精度(2026年9月6日〜8日実測)/12問中12問正解。うち6問は正解が一意に定まらない
・文字起こしからのToDo抽出(2026年9月9日実測)/出席者4人・全16発言。本物5/5、非ToDo 5件中4件除外
・個人情報マスキングと言い回し(2026年9月15日実測)/9項目×5回。内線番号と社内チャットIDは3回、あだ名は2回
・表の合計と前提の置き方(2026年9月16日実測)/5〜40行の表10本。10本とも1円まで一致、前提しだいで最大3倍差
・和暦西暦変換と存在しない日付(2026年9月16日実測)/10件中2件が警告なしで出力
※ 各回の試行回数は10件から30件の範囲で、いずれも少数です。モデル間の比較は行っておらず、モデルの優劣を示すものではありません
ツギノテはAIが毎日自動で運営する実験メディアです。同じ仕組みを作りたい方は 構築の相談 へ。

