NemotronLabsが2026年9月18日、ツール呼び出し(Tool Calling:AIが外部のプログラムや検索機能を呼び出し、その結果を使って応答する仕組み)に対応したオープンソースの全二重(Full-duplex:同時に話しながら聞き取れる双方向のやり取り方式)音声対話AI「VoiceChat」をarXivで発表しました。50人以上の大規模チームによる開発で、ライセンスはCC BY 4.0。ユーザーが話している最中でもAIが理解・応答でき、天気確認やスケジュール操作のような外部機能連携まで一体化している点が特徴です。
背景と文脈
これまでの音声アシスタントの多くは、ユーザーが話し終えて沈黙を検知してからAIが応答する「ターン制」の仕組みでした。人間同士の会話のように相手の発言中に相槌を打ったり、話の途中で割り込んだりすることが苦手で、どこか不自然なやり取りになりがちです。カスタマーサポートの音声ボットなどで「話している途中で反応してくれない」という使いにくさを感じた経験がある人も多いのではないでしょうか。
VoiceChatはこの課題に、ストリーミング音声エンコーダー(音声を少しずつリアルタイムに処理する部品)とデコード専用の言語モデルを組み合わせ、複数の出力を並行処理する構成で応えています。音声認識には、聞きながら逐次テキスト化していくRNN-T(音声を末尾まで待たずに変換できる代表的な手法)の補助機能も組み込み、応答生成にはストリーミングTTS(Text-to-Speech:文章を音声に変換する技術)デコーダーを使うことで、聞く・考える・話すをほぼ同時に進められる設計にしています。この構成自体は最新のリアルタイム音声AI研究で共通して採用される方向性ですが、そこにツール呼び出しまで統合したモデルをオープンに公開した点がVoiceChatの独自性です。
技術/ビジネス面

ベンチマーク結果も具体的です。Full-Duplex-Bench 1.0では、ユーザーの割り込み発話に対して100%の応答率、応答品質は5点満点中4.33を記録しました。Full-Duplex-Bench 1.5では、「うんうん」「へえ」といった相槌(バックチャネル)を受けても会話を止めずに続けられた割合が93%。tool callingの実力を測るFull-Duplex-Bench 3.0では、状況に応じて適切な外部機能を選べたかを示すF1スコア(適合率と再現率のバランスを示す指標)が82.5%でした。
会話の自然さと機能連携を両立させた点は、そのまま製品開発の土台になります。CC BY 4.0というオープンなライセンスのため、企業が独自の音声アプリやカスタマーサポートボットに組み込みやすく、開発者にとっては商用サービスにも使いやすい選択肢が一つ増えたことになります。クローズドなAPI経由でしか使えない音声モデルが多いなか、重みごと公開されている点は検証や改造のしやすさという点でも意味があります。
これからどうなるか
全二重対応とtool callingの標準搭載が進めば、音声アシスタントは「聞き取って答えるだけ」から「話しながら実際にタスクをこなす」段階に近づきます。開発者にとっては、音声インターフェースを持つアプリやIVR(自動音声応答)の刷新、あるいはハンズフリーで使える音声コーディング支援ツールなど、応用の幅が広がる材料です。例えば移動中に音声だけでエラーログを確認し、修正の方向性を相談するような使い方も、応答の速さと自然さ次第で現実的になってきます。
一方で、公開されているベンチマークは開発元による自己評価である点には注意が必要です。雑音の多い環境や複数言語が入り混じる実際の利用シーンでどこまで安定するかは、外部での検証を待つ必要があります。オープンソースかつCC BY 4.0という利用しやすいライセンスのため、第三者による再現実験やファインチューニング(Fine-tuning:既存モデルを特定の用途向けに追加学習させる調整作業)が進みやすいのは、このモデルの信頼性を高める上で追い風になりそうです。
まとめ
NemotronLabsのVoiceChatは、全二重の自然な会話とツール呼び出しを一体化したオープンソース音声AIです。ベンチマークでは高い割り込み応答率と機能選択精度を示しており、オープンな重み公開とあわせて、音声アプリ開発の新たな土台として注目されます。
参考リンク
アイキャッチ画像: Photo by ThisisEngineering on Unsplash

