arXiv論文:Sharpening Taxで後訓練の網羅性低下を測定

Curving layers of white paper creating an abstract pattern of flowing lines AI

後訓練を施したモデルは、1回の正答率が上がる一方で、試行を重ねたときに解ける問題の幅が狭まります。Changdae Oh氏らの論文Sharpening Tax in Post-Trainingが、エージェント課題でこの現象を確認しました。損失を測る指標「Sharpening Tax」と、緩和する手法PTGSも提案しています。エージェントの試行回数を増やして精度を稼ぐ開発者に関わる知見です。

背景と文脈

LLM(Large Language Model、大規模言語モデル)の強化学習による後訓練には、一つの仮説があります。後訓練はベースモデルの既存の挙動を「研ぎ澄ます」だけ、というものです。単発の正答率は上がる代わりに、解ける問題の網羅性が下がるとされます。

この傾向は、数学とコーディングの課題で観測されてきました。しかし、複数ターンにわたってツールを使うエージェント課題では事情が異なるかもしれません。後訓練で新たに身につく能力が必要になる可能性があるためです。

論文が問うのは、この仮説がエージェント課題でも成り立つのかという点です。結論から言えば、成り立ちました。

pass@1とpass@Kの違いは重要です。前者は一発勝負の成績で、後者は何回か試してよい場面での成績を表します。エージェントの運用では、失敗したらやり直す設計が一般的です。そのため、pass@Kの高さは、実際の成功率に直結する場合があります。

なお、今回の比較は、14組のモデルペアと3つのエージェントベンチマークという幅広い条件で行われています。特定のモデルや課題に偏った結果ではない点が、主張の説得力を支えています。

技術/ビジネス面

black and white chess piece
Photo by Adlan on Unsplash

著者らが見つけた驚きの結果は、後訓練前のモデルでも、軽い推論用ハーネスを付ければ、有能なエージェントになることです。pass@1(1回で解ける割合)は大きく劣ります。それでもpass@K(K回試して一度でも解ける割合)では、十分な試行予算があれば、後訓練後のモデルを上回ることがよくあります。

仕組みの分析も行われました。後訓練は、課題を「いつも解ける」か「決して解けない」かの両極端に押しやります。その結果、サンプリングの効率と一貫性は上がりますが、解の網羅性が失われます。

この損失を測るのが、提案指標のSharpening Taxです。後訓練で、テスト時のスケーラビリティ(試行を増やして伸ばせる余地)がどれだけ減ったかを数値にします。4つのモデルファミリーの14組と、3つのエージェントベンチマークで調べたところ、42ケースの大半でこの「税」を確認しました。数回の試行から推定でき、他の指標とも相関します。

緩和策としてPTGS(posterior-tempered group sampling)も提案しました。課題ごとの推定難易度に応じて、サンプリング温度(出力のばらつきの大きさ)を調整するベイズ的なサンプラーです。2つのエージェント環境で強化学習中に使うと、固定温度よりも税が小さくなりました。繰り返し試行での解決数が増え、単発の精度も向上しています。

両極端への偏りは、直感的に理解できます。得意な課題はますます確実に解け、苦手な課題は何度試しても解けない状態になります。多様な試行の中から、たまたま正解が出る余地が消えるわけです。

これからどうなるか

実務への含意は具体的です。「後訓練済みのモデルを選び、同じ課題を何度も試して精度を稼ぐ」運用では、後訓練前のモデルが、予算次第で有利になる場合があります。自社のエージェントで試行回数を増やす設計なら、モデル選びの前に、pass@1とpass@Kの両方を測っておくと安心です。

モデルを学習する側にとっても、単発の正答率だけを追うと、網羅性を犠牲にしている可能性があります。Sharpening Taxは数回の試行から推定できるため、学習の途中経過の監視にも使えそうです。

今後は、PTGSのような手法が他の環境や大型モデルでも効くか、検証が進むかが注目点です。

PTGSの発想は、難しい課題ほど温度を上げて多様な試行を促し、易しい課題では安定させる、というものです。一律の設定では取りこぼす部分を、課題ごとの調整で拾います。単純で差し込みやすい形にしてあるため、既存の学習の流れにも組み込みやすいでしょう。

評価の面でも注意が要ります。ベンチマークの順位は、多くの場合pass@1で決まります。その順位だけで後訓練済みモデルを選ぶと、試行を重ねる運用では最適でない選択になり得ます。自分の運用の試行回数に合わせた指標で比べることが、これからの選び方の基本になるでしょう。

まとめ

強化学習による後訓練は、エージェント課題でも、単発の精度と引き換えに解の網羅性を削っていました。論文はその損失をSharpening Taxで測り、PTGSで緩和できると示しています。試行回数を増やす運用では、後訓練前後のモデルの比較が欠かせません。

参考リンク

アイキャッチ画像: Photo by JJ Ying on Unsplash

タイトルとURLをコピーしました