大規模言語モデル(LLM、Large Language Model)に「考えずに答えだけ返して」と指示しても、モデルは裏で推論を続けてしまう。そんな現象を調べた論文Thinking Inertia: LLMs Keep Thinking When Told Not Toが、10月8日にarXivへ公開されました。Philip Torr氏やJames Zou氏らの研究チームが、6種類の指示方法と6つのモデルで検証しています。NeurIPS 2026への採択も記載されています。推論モードのオン・オフを切り替えて使う開発者にとって、無視できない結果です。
背景と文脈
ここ1〜2年で、LLMには「思考モード」を持つものが増えました。思考モードとは、答えを出す前に段階的な推論の文章(chain-of-thought、思考の連鎖)を書き出して精度を上げる仕組みです。数学やコード生成のような難しい課題では、この仕組みが大きく効きます。
一方で、思考には代償があります。推論の文章を書く分だけ出力トークンが増え、応答は遅くなり、API料金も膨らみます。分類や単純な質問応答のように、考えなくても答えられる場面では無駄な出費です。そのため多くのサービスが「思考オフ」のスイッチや「考えずに答えて」というプロンプトを用意しています。
ところが、このオフが本当にオフなのかは、あまり検証されてきませんでした。これまでの研究は、思考モードを無効にした設定や、長い推論文が出ていないことを「考えていない」の代わりとして扱ってきました。著者らはこの代用が不正確だと指摘します。無効にしたはずでも推論は出ますし、長い文章が出ていても中身は水増しかもしれません。
技術/ビジネス面

著者らは、回答を「答えの前の部分」と「最終回答」に分け、前の部分を3つの指標で測りました。1つ目はEmpty-Thinking Rateで、答えだけを返した応答の割合です。2つ目はQuestion-Pre-answer Relevanceで、答えの前の文章が質問とどれだけ関係するかを見ます。3つ目はExplicit Inference Rateで、別のLLMを審査役にして、目に見える推論がどれだけ含まれるかを採点します。
この3つを組み合わせると、応答を3種類に分けられます。答えだけの出力、質問に関係はあるが推論ではない文章、そして明示的な推論です。単に「長い・短い」で判定するより、モデルが実際に何をしているかに近づけます。
実験では、6種類のプロンプト介入を6つのLLMに適用しました。課題は、はい・いいえで答える問題、選択式の問題、自由記述の問題の3種類です。結果として、「考えるな」という明示的な指示を与えても、見える推論は確実には止まりませんでした。著者らはこれをThinking Inertia(思考の慣性)と呼びます。
慣性は、答えの自由度が高いほど強く出ました。自由記述では推論が漏れやすく、はい・いいえや選択式では抑えやすい傾向です。精度の面では、はい・いいえと選択式でほぼ安定していました。自由記述では、無理に答えだけにさせると精度が下がる場合があり、トレードオフが生じます。
同じ質問を、候補の答えを添えた形に書き換えると、答えだけの応答は出しやすくなりました。候補があると、考えて探す必要が減るためと読めます。なお、具体的なモデル名やベンチマークの数値は、公開されている要旨だけでは確認できませんでした。
これからどうなるか
この論文の主張は、「考えない能力」を設定や指示で当然に得られるものと見なさず、推論能力と並べて評価すべきだというものです。モデル選びの観点では、思考オフ時の挙動もベンチマークに加わる可能性があります。
開発者にとっての手触りは具体的です。たとえば、分類やルーティング用の軽いLLM呼び出しで「考えずに答えのみ」と指示している場合、実際には推論トークンが出て、コストと遅延を想定より押し上げているかもしれません。本番のログで、答えの前に出る文章の量を一度測ってみる価値があります。
自由記述の出力では、答えだけにさせると精度が落ちる恐れもあります。出力形式を選択式やJSONの列挙値に寄せると、答えだけの応答を引き出しやすくなる点も、この論文から読み取れる実践的なヒントです。
まとめ
Thinking Inertiaは、「考えるな」という指示がLLMには効きにくいことを、3つの指標で示した論文です。特に自由記述で推論が漏れやすく、答えだけにすると精度が落ちる場合もあります。思考オフを前提にコストを見積もっている開発者は、実際の出力を確認しておくと安心です。
参考リンク
アイキャッチ画像: Photo by Nathaniel Shuman on Unsplash

