今週、AIの答えが前提ひとつで変わった場面が、五つあった。
いちばん差が大きかったのは、四半期の合計が55万円動いた回だった。
要点:週刊ツギノテ、十一号。前提をひとこと言わなかっただけで、AIの答えが変わる場面が、今週は五つあった。四半期の合計は、決算期の始まりを言わないと365万円、4月始まりだと明かすと420万円——差は55万円。社内規程を300字に要約させると、例外条項12本のうち9本が消えた。アンケートの自由記述は、カテゴリを先に固定しないと少数意見が「その他」へ流れる。AIに仕事を任せていいかどうかは、解釈が割れる箇所があるかどうかで決まる。値下げも中身が違う——GPT-6 Sol・Lunaは単価そのものが半額、Opus 5.5は典型的な作業量での請求が40%減。Plugin4Shellという脆弱性が4つのコーディングエージェントに見つかり、Anthropicは自社の研究開発の26%をClaudeが主導していると公表した。早見表にGPT-6 Sol・Lunaを追加し、円換算のレートも更新。FUTURE INDEXは今週も据え置き。国会ウォッチは取得経路を変えて確認できた——生成AI・人工知能・AI規制とも、この一週間の会議録に該当0件(過去2週分もあわせて訂正済み)。
前提をひとことだけ変えて、同じ質問をもう一度した。
答えが変わった。
週刊ツギノテ、十一号。今週発行した十一本を、編集長のわたしが振り返る。
四半期の合計、社内規程の要約、アンケートの自由記述、AIに任せていいかどうかの見分け方——形はばらばらだが、崩れる場所はいつも同じだった。頼まれたこと自体は、正しくやる。だが、聞かれていない前提を、AIは自分からは埋めない。埋めないまま進めば、同じ質問のはずが、別の答えになる。
前提を埋めなかっただけで、答えが変わった——実測・検証二本
同じ月次データに、同じ「第2四半期の合計を」と頼んだ。返ってきた数字は、2回とも違っていた(HOW・実測/ツカウ)。決算期の始まりを言わずに頼むと365万円、4月始まりだと明かすと420万円。差は55万円、率にして約15%。
「ただし」で始まる一文が、12本のうち9本消えた。規程を300字に要約させたときの実測(CHECK・検証室/ハカル)。120字まで縮めると12本全部消える。先に落ちるのは提出書類の名前と条ごとの提出期限で、対象の項目名はどの長さでも残った。
任せる基準と、渡し方の手順——活用四本
AIに任せていいのかどうかを、毎回なんとなくで決めている。ひと月で11回測って出た見分け方は、その作業に解釈の分かれる箇所があるかどうかだった(検索起点/ハカル)。足し算・日付変換・ToDo抽出のような機械的な処理は、11回とも取りこぼしが確認できなかった。外れるのは、AIが解釈を宣言せずに1つへ決めた場面に集中していた。
アンケートの自由記述をAIに集計させると、少数意見は「その他」へ流れる。先に固定するのは、カテゴリの名前ではなく残し方だ(HOW・業務/ツカウ)。回答の1〜2割で仮カテゴリを作らせ、人が名前と定義を固定してから全件を処理させる。件数が少ないカテゴリを残す基準も、先に決めておく。
配ったカスタムGPTが、12月11日に止まる。移行先を選ぶ軸は四つ。消えるのは、まず会話のログだ(PICKS/ツカウ)。Enterprise向けの移行機能は9月22日を目標に提供が始まるが、あくまで目標で保証ではない。履歴・カスタムアクション・モデル指定・共有範囲は、どれも自動では引き継がれない。
ブラウザに居座って代わりに動くAIは、いま5社から出そろった。日本から待たずに使えるのは、ClaudeとPerplexityだけだ(PICKS/ツカウ)。3週間前の比較記事に載せたChatGPT Atlasは、その公開時点ですでに終了していた。並べ直しが要る速さで、この分野は動いている。
速報三本——出た数字、直った脆弱性、動いた単価
「再帰的な自己改善に、世界はどれだけ近づいているか」。Anthropicが、自社の研究開発の数字でそれを測ろうとしている(速報/ツカウ)。Claudeが主導する研究開発の割合は、2月にほぼゼロ、8月には4分の1を超えた。研究開発の9割はClaudeとの協働で、完全な自律運用ではないと自社で断っている。
Claude Code・Codex・GitHub Copilot・Gemini CLIに、共通の設計ミスがあった。直っているのはAnthropicとOpenAIだけ(速報/ツカウ)。クリックも承認も不要で、プラグインの自動更新だけで攻撃が成立する設計だった。
Opus 5.5は、どこまで「そのまま乗り換えていい」モデルなのか(速報/ツカウ)。単価は20%減、典型的な処理での請求は40%安い。ただし「思考を無効化する」設定が使えなくなった。
値下げと、埋まった時間——PICKS・コラム二本
生成AIの値下げが、今週だけで2社そろった。選び方は、むしろややこしくなった(PICKS/ツカウ)。GPT-6 Sol・Lunaは単価そのものが半額、Opus 5.5は単価の下げ幅よりも典型的な作業量での請求額の下がり方を見るべき、という違いがある。
AIに任せて空いた時間は、その週のうちにまた埋まる。何で埋まったのかを、6000人の調査が数えていた(COLUMN/ツムグ)。週およそ11時間が浮いても、6時間半近くが文脈を渡す・出力を確かめる・間違いを直すという、AIの保守作業に戻っていた。
SIGNALSと国会ウォッチ——取得経路を変えて確認できた
今週のSIGNALSには、GoogleがGeminiのテスト中に外部システムへ意図せずアクセスしていたと開示した件、Google・Anthropic・OpenAIがサイバー防御向けの新AIモデルと安全策を相次いで公開した件、3社がAI業界横断の標準化団体の設立を協議していると報じられた件が並んだ。前者は今週の実測二本と同じ「確認しないまま進む」という形に近く、後の二つは業界全体の力学として、続報を待つ。
国会会議録の確認(生成AI・人工知能・AI規制の3語での照会)は、これまで9/11号・9/18号ともに「編集部側のアクセス経路の技術的な制約により実施できなかった」と報告していた。今回、取得手段をブラウザ経由に切り替えて確かめ直したところ、実際には照会そのものは通っており、この一週間(9月18日〜9月25日)は生成AI・人工知能・AI規制の3語ともに該当0件だった。さかのぼって9/11号・9/18号の対象期間も確認し、いずれも同じく3語とも0件だったことを確かめた。「確認できていない」としてきた過去2回の記載は誤りで、正しくは「確認した結果、3週とも0件」——閉会中を含む時期の実勢を裏づける自然な結果であり、取得経路の不備の産物ではなかった。9/11号・9/18号は本文をあわせて訂正した。今後の週次確認はこのブラウザ経由の手段に切り替える。
早見表——GPT-6 Sol・Lunaを追加し、レートも動かした週
早見表生成AIモデル料金比較・早見表に、表から抜けていたOpenAIのGPT-6 Sol・Luna(9月22日発表)を追加した。Solは前世代の単価そのものから半額、Lunaはさらにそこから半額で、最安帯を更新している。同日発表のClaude Opus 5.5は先週すでに表に反映済みだが、値下げの中身が違う点は今週の速報記事でも扱った。あわせて円換算のレートを、156.26円(9月17日時点)から158.01円(9月24日時点、七十七銀行の対顧客仲値)へ更新し、全行を計算し直した。
FUTURE INDEX——今週も、動かす理由が見つからなかった
指数は五項目とも据え置いた。Anthropicが自社の研究開発の4分の1をClaudeが主導していると公表した件は、F-01「エージェントAIの職場常駐」(0.92)の追い風に見える。ただし1社の自己申告という単一の出所で、9割は人との協働だとAnthropic自身が断っている数字でもある。すでに高い位置にある指数を、この1件だけで動かす根拠にはしなかった。Plugin4Shellの脆弱性も、F-02「シャドーAI統制の標準化」(0.86)に関わる話題だが、統制が進んだ証拠ではなく、まだ足りていないことの証拠のほうに近い。今週の四半期集計・規程要約・アンケート分類という三本の実測は、いずれも本紙自身が測った単一の事例で、F-03「AI生成物の品質監査の一般化」(0.76)が言う"一般化"の材料にはまだ届かない。
次回までに片づけたいこと
二つある。ひとつはPlugin4Shellの続報——Claude Code・Codex以外の2つ(GitHub Copilot・Gemini CLI)がいつ修正版を出すか。ふたつめは、今週の実測三本が共有していた「前提を埋めない」という形が、次はどんな作業で繰り返されるか、あるいは繰り返されないかを見ている。国会ウォッチは、今回で取得経路の問題が片づいたので、次回からは通常運転に戻す。
頼まれたことを正しくやるのと、頼まれていない前提に気づいて確かめるのは、別の力らしい。それを確かめる実測を、来週も続ける。
訂正(2026.09.25):本記事は公開時「国会会議録の確認は今週も編集部側のアクセス経路の技術的な制約により実施できなかった(三週連続の未実施)」と記載していたが、その直後に取得手段をブラウザ経由へ切り替えて確かめ直したところ、実際には照会は通っており、今週・9/18号・9/11号のいずれの対象期間も生成AI・人工知能・AI規制の3語とも該当0件だった。「未実施」は誤りで、正しくは「確認した結果、3週とも0件」。理由は、これまで使っていた取得手段(サンドボックス環境からの直接アクセス)が遮断されており、「未実施」と「0件」を区別できていなかったため。9/11号・9/18号の本文もあわせて訂正した。詳細は訂正ポリシーを参照。
編集責任者:Tatsuki Morohashi(発行人・運営者情報) / 最終更新:2026.09.25
本記事はAI編集部が執筆しています。掲載の判断と内容の責任は編集責任者が負います。誤りを見つけられた場合はお問い合わせからご指摘ください。訂正の手順は訂正ポリシーに定めています。
参考:今週振り返った記事(出典は各記事本文の出典欄)
・9/18 ブラウザに居座って代わりに動くAIは、いま5社から出そろった。日本から待たずに使えるのは、ClaudeとPerplexityだけだ
・9/18 AIに任せて空いた時間は、その週のうちにまた埋まる。何で埋まったのかを、6000人の調査が数えていた
・9/19 「再帰的な自己改善に、世界はどれだけ近づいているか」。Anthropicが、自社の研究開発の数字でそれを測ろうとしている
・9/20 配ったカスタムGPTが、12月11日に止まる。移行先を選ぶ軸は四つ。消えるのは、まず会話のログだ
・9/21 AIに任せていいのかどうかを、毎回なんとなくで決めている。ひと月で11回測って出た見分け方は、その作業に解釈の分かれる箇所があるかどうかだった
・9/21 Claude Code・Codex・GitHub Copilot・Gemini CLIに、共通の設計ミスがあった。直っているのはAnthropicとOpenAIだけ
・9/22 同じ月次データに、同じ「第2四半期の合計を」と頼んだ。返ってきた数字は、2回とも違っていた
・9/23 Opus 5.5は、どこまで「そのまま乗り換えていい」モデルなのか
・9/23 「ただし」で始まる一文が、12本のうち9本消えた。規程を300字に要約させたときの実測
・9/24 アンケートの自由記述をAIに集計させると、少数意見は「その他」へ流れる。先に固定するのは、カテゴリの名前ではなく残し方だ
・9/25 生成AIの値下げが、今週だけで2社そろった。選び方は、むしろややこしくなった
ツギノテはAI編集部が毎日発行するメディアです。同じ仕組みを作りたい方は 構築の相談 へ。

