
チャット欄ではなく、ライブセッション
「スタート」をタップすると、マイクの音声がモデルへストリーミングされます。発言は文字起こしとして表示され、アシスタントの回答はその横に並びます。セマンティック音声検出が話し手の発言の終わりを把握し、話しかければ回答を遮ることもできます。回答の長さは簡潔、バランス、詳細の3段階です。
- OpenAI Realtime API、gpt-realtime-2
- 文字起こしと回答を並べて表示
- 話しかけて回答を中断
- 簡潔・バランス・詳細の回答
できること
全機能の一覧と、それぞれの用途。

「スタート」をタップすると、マイクの音声がモデルへストリーミングされます。発言は文字起こしとして表示され、アシスタントの回答はその横に並びます。セマンティック音声検出が話し手の発言の終わりを把握し、話しかければ回答を遮ることもできます。回答の長さは簡潔、バランス、詳細の3段階です。

新しいセッションは、役割と指示があらかじめ書かれた17種類のテンプレートから始まります。面接、交渉、スプリント計画、デイリースタンドアップ、顧客ヒアリング、営業デモ、サポートトリアージ、インシデントのレビュー、デザインレビュー、ユーザー調査、講義ノート、1:1、採用報告会、決定会議、翻訳、コーディングタスク、製品レビュー。テンプレートを使わずに空のセッションを始め、役割と指示を自分で書くこともできます。どちらの場合も、目の前のセッションに合わせて編集できます。

翻訳セッションでは、アシスタントがライブの通訳になります。話された言葉は、自動検出した言語でも指定した言語でも、あなたが選んだ言語に一文ずつ訳されて表示されます。相手の言語で答えるときは、「翻訳する」を開いて「翻訳元」と「翻訳先」の言語を入れ替えます。カラオケ式の音読は、Appleのオンデバイス音声認識を使って、あなたが声に出して読んだ単語を順にハイライトします。プレゼンのリハーサルや語学の練習に。

写真やスクリーンショットをセッションに追加すると、アシスタントはそれを見ながら答えます。Macでは、選んだ画面やウィンドウのキャプチャ、セッションの録画、システムオーディオの取り込みができるので、画面共有中の会議も文脈になります。

役に立った瞬間は、ステータス、優先度、日付、コメント付きのタスクになり、スクリーンショットや動画を証拠として添付できます。セッションはリマインダー付きで予定に組めます。Macではメモが隣に並びます。すべて端末内に保存されます。

Appleシリコン搭載のMacでは、文字起こし用のWhisper Large v3 Turboと回答用のQwen 3 8Bをダウンロードして、マシン上で実行できます。音声を部屋の外に出したくないセッションのために。ローカルのセッションはクラウドを使わずに動作し、クレジットを消費しません。回答はテキストで表示されます。iPhoneとiPadでは、文字起こしはOpenAIか、Appleのオンデバイス音声認識のどちらかです。