Thinking Machines、対話AIの新型で遅延0.4秒に

紫色の煙の波のイメージ AI

元OpenAI CTOのミラ・ムラティ氏らが立ち上げたThinking Machines Labが、音声と映像をリアルタイムでやり取りできる新方式のAIモデル「Interaction Models」を研究プレビューとして公開しました。話しかけてから応答が返るまでの遅延はわずか0.4秒で、人間同士の自然な会話に近い速さです。音声アプリを開発するエンジニアにとって、会話のテンポそのものを設計し直す新しい選択肢になりそうです。

背景と文脈

音声で対話するAIアシスタントは、多くの場合「ユーザーの発話が終わるのを待つ→内容を理解する→応答を生成する」という順番で処理が進みます。この方式では、相づちを打ったり、相手の話を遮って割り込んだりといった、人間同士の会話にある自然なやり取りが難しくなります。発話の区切りをどう検出するか(ターン管理)の精度が、体験の良し悪しを大きく左右してきました。無音区間の長さだけで発話の終わりを判定する従来方式では、考え込んで間を置いただけなのに応答を割り込まれてしまうといった不満も指摘されてきました。

Thinking Machines Labは、この構造そのものを見直す形でInteraction Modelsを開発しました。同社はムラティ氏に加え、OpenAIで強化学習を率いたジョン・シュルマン氏らが参加する研究組織で、これまでも既存の音声AIとは異なる設計思想を掲げてきました。今回が同社にとって初めての本格的なモデル公開となり、音声対話という領域で独自路線を示した格好です。

技術/ビジネス面

白背景の黒いマイク
Photo by Madrosah Sunnah on Unsplash

Interaction Modelsは、音声・映像・テキストを同時に受け取り、同時に出力できるマルチモーダル(複数の種類のデータを一括で扱えること)なモデルです。0.2秒単位の細かい塊(チャンク)で入力と出力を並行処理する「マルチストリーム・マイクロターン」という設計を採用し、話しながら聞く・見ながら話すといった全二重(送信と受信を同時に行える通信方式)のやり取りを実現しています。音声データは専用の圧縮形式で、映像は40×40ピクセルの小さな断片に分けて、軽量な変換層を通してモデルに直接取り込む仕組みです。これらの要素はすべて、あとから組み合わせるのではなく、同じトランスフォーマーの中で最初から一緒に学習させている点が特徴です。

公開されたモデル「TML-Interaction-Small」は、2760億パラメータのMoE(Mixture of Experts:入力ごとに得意な部分のネットワークだけを動かす仕組み)構成で、実際に計算に使われるのは120億パラメータ分だけです。この設計により、大規模なモデルでありながら0.40秒という応答速度を達成しています。視覚的な合図に気づいて話に割り込む、相手の発話中に相づちを入れるといった挙動も、この並行処理の枠組みの中で実現されているとのことです。現在は研究プレビューの段階で、数カ月以内に限定公開、その後年内に広く一般提供する計画です。

これからどうなるか

音声インターフェースを使ったアプリやカスタマーサポートAIを開発するエンジニアにとって、ターン管理の精度に悩まされてきたこれまでの設計を見直す契機になりそうです。相づちや割り込みまで含めた自然な対話を前提にしたAPIが一般提供されれば、コールセンター向けAIや語学学習アプリ、音声操作の家電インターフェースなど、応答速度が体験を左右する用途で活用が進むと見られます。映像入力にも対応している点は、対面接客やオンライン診療のような、相手の表情や仕草も踏まえて応答するアプリケーションにも広がる余地を示しています。一方でMoE構成の大規模モデルを低遅延で動かすには相応の計算基盤が必要になるため、実際のAPI料金や利用条件が公開されるまでは、導入コストの見極めも重要になるでしょう。既存の音声AI APIから乗り換える場合は、割り込みや相づちを前提としたUI設計そのものを見直す作業も発生しそうで、単純な置き換えでは済まない可能性がある点も留意が必要です。

まとめ

Thinking Machines Labは、入力と出力を同時に処理する新方式で応答遅延0.4秒を実現したInteraction Modelsを発表しました。音声AIの会話体験を根本から変える可能性があり、今後の一般提供に注目です。

参考リンク

アイキャッチ画像: Photo by MARIOLA GROBELSKA on Unsplash

タイトルとURLをコピーしました