
音声 AI のハードウェアは、文字起こしか対話か、どの処理をローカルに残すか、マイクをどこに置くかの三点で決まります。三点はそれぞれ、スピーカーとボード上のエコーキャンセルの要否、演算ボックスの階層、マイクの機種と接続方式を決めます。
本記事は四段階の選定手順に加え、reSpeaker シリーズ AI マイクの形態・公称収音距離・参考価格、およびローカル演算機器 5 機種の文字起こし同時処理の実測値、対話言語、ローカル LLM への対応を掲載します。同時処理チャネル数は、指定コーパスで ASR サービスを測定した実測値で、VAD・アップロード・保存は含みません——算出基準は末尾を参照してください。
結論早見表
以下は後段で導く結論のまとめです。「音響・音声AI」技術ページの構成ツールにある三つの質問(何をするか / どこまでローカルで処理するか / マイクをどう置くか)に一対一で対応します。
| 何をするか | ローカルで処理する範囲 | 演算機器 | 参考価格 | マイク | 根拠 | |
|---|---|---|---|---|---|---|
![]() | 文字起こし | ローカルで文字起こし | reRouter CM4 | 約 $246 | 卓上:reSpeaker Lite | VAD と ASR を CPU で処理、1〜2 人の単一拠点に限る。複数拠点の同時処理は RK3576 |
![]() | 文字起こし | ローカルで文字起こし | reComputer RK3576 | 約 $199 | 部屋:reSpeaker XVF3800 / 装着:reSpeaker Clip | SenseVoice 12 チャネル同時処理、p95 1067 ms |
![]() | 文字起こし | クラウドで文字起こし | 不要 | — | Lite / XVF3800 / Clip | 音声を SenseCraft Voice にアップロードして文字起こし。マイクのみ購入 |
![]() | 音声対話 / 割り込み可能な対話 | 音声はローカル、LLM はクラウド | reComputer RK3576 | 約 $199 | XVF3800 / Flex(割り込み不要なら Lite も可) | VAD・ASR・TTS をローカル処理し、認識テキストのみ LLM へ送信 |
![]() | 音声対話 / 割り込み可能な対話 | すべてローカル(LLM を含む) | reComputer J4012 | 約 $1299 | XVF3800 / Flex(割り込み不要なら Lite も可) | 音声処理と Qwen3.5-4B を同一ボードで実行 |
![]() | 音声対話 / 割り込み可能な対話 | すべてクラウド | reRouter CM4 | 約 $246 | XVF3800 / Flex(割り込み不要なら Lite も可) | ローカルは VAD と音声の送受信のみ、常時接続が必要 |
参考価格は照会時点の演算機器本体の価格で、マイクは含みません(マイクの価格はステップ 2)。発注時は商品ページの価格が優先します。
上表の結論を変える三つの条件:
- 割り込みが必要 —— マイクは reSpeaker XVF3800 または reSpeaker Flex に限定されます。ボード上の AEC が機器自身の再生音を除去します。構成ツールの割り込みルートに Lite は含まれません
- 対話言語が中国語・英語以外にも及ぶ —— reComputer RK3576 の対話パイプラインは中国語と英語に対応します。その他の言語には reComputer RK3588、J3011、J4012 を選びます。三機種は 30 の対話言語すべてに対応します
- 話者とマイクの距離が約 3 m を超える、または定常騒音が約 70 dB を超える —— 演算性能より先にマイクの位置や台数を見直します。この二条件では、演算性能が制約になる前に認識精度が低下します
用途・ローカル処理範囲・マイク位置が決まっている場合は、下の構成ツールで機器リストを生成できます。各選択の根拠を先に確認する場合は、四段階の手順をお読みください。
なぜ音声処理をローカルで行うのか
以下の四段階では「どこまでローカルで処理するか」を明示的な選択肢としています。選択の根拠は、ローカル処理の三つの性質です。
音声が現場の外に出ない。 ローカル文字起こしでは VAD と ASR を現場で処理し、アップロードするのは各発話の最終テキストです。音声をローカル、LLM をクラウドとする構成でも、クラウドへ送るのは認識テキストのみです。
導入後はオフラインで稼働。 完全ローカル対話ルートでは、初回のオンライン起動でイメージとモデルをダウンロードした後、VAD・ASR・TTS・LLM がすべて機器上で動作し、インターネット接続を必要としません。
インターフェースはクラウドと共通。 二つのローカル LLM ルート(reComputer J4012、reComputer RK3588 + NPU 拡張カード)は機器上で OpenAI 互換の Chat Completions エンドポイントを提供します。ローカルとクラウドの切り替えはエンドポイントアドレスの変更のみで、上位アプリケーションは変更不要です。
システム構成と三種類の音声機能

AI マイク → 演算ボックス → スピーカー / 出力 → アプリケーション
音声システムは四つの役割で構成されます:
- AI マイク——収音し、ボード上でエコーキャンセル(AEC)、ノイズ抑制、ビームフォーミングなどの前処理を行ってからホストに渡します
- 演算ボックス——ローカルに残す処理を実行します:音声区間検出(VAD)、音声認識(ASR)、音声合成(TTS)、大規模言語モデル(LLM)
- スピーカー / 出力——対話ルートではマイクボードにスピーカーを接続して応答を再生し、再生とエコーキャンセルを同一ボードで処理します。文字起こしルートはテキストのみを出力します
- アプリケーション——テキストまたは音声を受け取り、業務システムに連携します
対話の形式により、音声アプリケーションは三種類に分かれ、必要な機能は順に増えます。
文字起こし:発話を検索可能なテキストにする

店舗カウンター、会議室、診察室、点検現場での会話を構造化テキストに変換し、振り返りと検索に使います。機器は応答しないため、TTS・LLM・スピーカーは不要です。必要なのは VAD(発話区間の切り出し)と ASR です。
音声対話:理解して音声で応答する

両手がふさがる作業では、画面操作の代わりに音声で照会と応答を行う
機器が質問を聞き取り、LLM が応答を生成し、TTS で再生する一問一答の形式です。文字起こしに必要な VAD と ASR に、TTS・LLM・スピーカーが加わります。
割り込み可能な対話:機器の発話中にユーザーが割り込める
機器が応答を再生している間にユーザーが話し始めると、機器は再生を即座に止めて新しい発話を聞き取ります。スピーカーの再生中もマイクが人の声を分離できる必要があり、マイクボード上の AEC に依存します。エコーを避けるために再生中にマイクをミュートする方法は使いません。エコーと同時に割り込みも機能しなくなります。
ステップ 1:用途を決め、必要な機能を導く
| 何をするか | VAD | ASR | TTS | LLM | スピーカー | ボード上 AEC |
|---|---|---|---|---|---|---|
| 文字起こし | 必要 | 必要 | — | — | — | — |
| 音声対話 | 必要 | 必要 | 必要 | 必要 | 必要 | 必要(Lite・XVF3800・Flex はいずれも搭載) |
| 割り込み可能な対話 | 必要 | 必要 | 必要 | 必要 | 必要 | 必要、XVF3800 / Flex のみ |
二つのルール:
- テキストだけが必要で、機器は応答しない:文字起こしルートを選びます。ステップ 2 では装着型の Clip を選べ、ステップ 3 では演算ボックスなし(クラウドで文字起こし)も可能です
- 機器が応答する:マイクボードにスピーカー出力とボード上 AEC が必要です。機器の発話中にユーザーが割り込む場合、ステップ 2 は XVF3800 または Flex に限定されます
ステップ 2:収音方式と接続方式を決める
マイクの設置場所で機種を選ぶ
| マイク | 形態 | 公称収音距離 | カバー角度 | 内蔵アンプ | 用途 | 参考価格 | |
|---|---|---|---|---|---|---|---|
![]() | reSpeaker Lite | 卓上 · 2 マイク | 3 m | 180° | 5 W | 卓上近距離、1〜2 人。文字起こし、音声対話 | 約 $25 |
![]() | reSpeaker XVF3800 | 据え置き · 円形 4 マイク | 5 m | 360° | 5 W | 部屋の中央、複数人。文字起こし、対話、割り込み可能な対話 | 約 $55 |
![]() | reSpeaker Flex Circular-4 | 分離型 · 円形 4 マイク | 5 m | 360° | 10 W | ロボットや製品への組み込み。対話、割り込み可能な対話 | 約 $55 |
![]() | reSpeaker Flex Linear-4 | 分離型 · 線形 4 マイク | 5 m | 約 180°(後方抑制) | 10 W | 前方の収音のみが必要な製品 | 約 $55 |
![]() | reSpeaker Clip | 装着型 · 2 マイク | 3 m | 360° | — | 巡回点検、外勤、店舗接客。文字起こしのみ | 約 $76 |
四つの選定ルール:
- 複数人が囲む部屋、または割り込みが必要:XVF3800 を選びます。360° 収音、ボード上の AEC とノイズ抑制を備え、USB-C ケーブル一本で給電とデータ通信を兼ねます。対話型音声すぐに導入できるソリューションの標準マイクです
- ロボットや製品の筐体にマイクを組み込む:Flex を選びます。アレイボードと処理ボードが分離しケーブルで接続するため、アレイを筐体内の任意の位置に配置できます。前方の収音のみなら Linear-4 を選びます。10 W のスピーカー負荷はボードの外部 12 V 電源端子経由で駆動します
- 卓上で 1〜2 人、文字起こしまたは割り込み不要の対話:Lite を選びます
- 話者が移動する(巡回点検、外勤、店舗接客):Clip を選びます。スマートフォンなしで 14〜18 時間連続録音でき、音声はスマートフォンアプリ経由でアップロードします。文字起こし専用です
ホストの位置で接続方式を選ぶ
| 接続方式 | 音声経路 | 用途 |
|---|---|---|
| USB でホストに直結(ドライバ不要) | マイク → USB → 演算ボックス | マイクと演算ボックスが同じ場所にある場合。本記事の構成ツールの全セットがこの方式 |
| I2S + XIAO ESP32S3 | マイク → I2S → XIAO ESP32S3 → Wi-Fi → サーバー | マイクとホストが離れている場合、または製品に MCU のみを搭載する場合 |
- マイクと演算ボックスが同じ場所:USB で接続し、XIAO なしの版を購入します。出荷状態のまま使えます
- マイクがホストから離れている、または製品に MCU のみを搭載:XIAO ESP32S3 付きの版を購入し、I2S ファームウェアを書き込みます。サーバー側の音声受信と文字起こしは別途構築が必要で、USB ルートより納品の作業量が増えます。ファームウェアとサンプルプロジェクトは reSpeaker XVF3800 Wiki を参照してください
- Clip はいずれの方式も使わず、スマートフォンアプリ経由で音声をアップロードします
適用範囲。 収音距離とカバー角度は公称値で、現場での実際の距離は残響と騒音に左右されます。確認方法はステップ 4 を参照してください。
ステップ 3:ローカル処理の範囲を決め、演算機器の階層を選ぶ
ローカル処理範囲の選択肢
| ローカル処理範囲 | ローカルで実行 | アップロード内容 | ネットワーク要件 | 対応する演算機器 |
|---|---|---|---|---|
| クラウドで文字起こし(文字起こしのみ) | なし | 音声 | 常時接続 | 演算ボックス不要 |
| ローカルで文字起こし(文字起こしのみ) | VAD · ASR | 各発話の最終テキスト | テキストのアップロード時 | reRouter CM4 / reComputer RK3576 |
| 音声はローカル、LLM はクラウド | VAD · ASR · TTS | 認識テキスト | 常時接続 | reComputer RK3576 / RK3588 |
| すべてローカル(LLM を含む) | VAD · ASR · TTS · LLM | なし | 初回起動後はオフライン可 | reComputer J4012、または RK3588 + NPU 拡張カード |
| すべてクラウド(対話) | VAD と音声の送受信 | 音声 | 常時接続 | reRouter CM4 |
演算機器の階層別実測値
| 機器 | ローカルで実行 | SenseVoice 推奨同時処理チャネル数 | p50 / p95 | 対話言語 | ローカル LLM | 参考価格 | |
|---|---|---|---|---|---|---|---|
![]() | reRouter CM4 | VAD · ASR(CPU) | 1〜2 人の単一拠点のみ。複数拠点の同時処理は RK3576 | — | — | — | 約 $246 |
![]() | reComputer RK3576 | VAD · ASR · TTS(NPU) | 12 | 583 / 1067 ms | 中国語、英語 | クラウド | 約 $199 |
![]() | reComputer RK3588 | VAD · ASR · TTS(NPU) | 8 | 659 / 902 ms | 30 言語 | NPU 拡張カードで Qwen3-4B | 約 $279 |
![]() | reComputer J3011 | VAD · ASR · TTS(GPU) | 32 | 167 / 293 ms | 30 言語 | このボードでは 4B モデルを実行しない | 約 $699 |
![]() | reComputer J4012 | VAD · ASR · TTS · LLM | 48 | 505 / 789 ms | 30 言語 | Qwen3.5-4B を同一ボードで実行 | 約 $1299 |
測定条件:SenseVoice モデル、各音声 4 秒以内、p50 / p95 は ASR の発話終了から最終結果までを計測し、VAD・アップロード・保存は含みません。精度は同一の 100 件コーパスで別途評価しました:中国語 CER は 4 機種すべてで 4.82%、英語 WER は 7.50%〜8.51% です。参考価格は照会時点の本体価格で、商品ページの価格が優先します。
四つの選定ルール:
- 文字起こしのみ、単一拠点、1〜2 人:reRouter CM4 で足ります。複数拠点や複数チャネルの同時処理には reComputer RK3576 を選びます
- 対話、LLM はクラウド:中国語・英語は reComputer RK3576、その他の言語は reComputer RK3588 を選びます
- 対話、すべてローカル:reComputer J4012 を選びます。RK プラットフォームを採用済みの案件は reComputer RK3588 + NPU 拡張カード(専門スタッフにご相談)
- 同じ機器で映像など他の AI 処理も実行する:reComputer J3011 を選び、LLM はクラウドとします
適用範囲。 上表は同一コーパス・同一 ASR サービスによる横並びの比較で、選定範囲を絞るためのものであり、受け入れ基準ではありません。次の場合は対象現場で実測してください:一発話が 4 秒を大きく超える、VAD・アップロード・保存をエンドツーエンド遅延に含める必要がある、主な言語が英語または中国語・英語以外である、reRouter CM4 で正式な容量計画を行う。
ステップ 4:現場の音響条件を確認する
演算機器の選定は、マイクが認識可能な音声を取得できることが前提です。確認の順序は、距離と騒音が先、エコーが後です。
| 現場条件 | 目安 | 超える場合の対処 |
|---|---|---|
| 話者からマイクまでの距離 | 約 3 m 以内 | マイクを近づける、またはエリアごとにマイクを追加する。移動する話者には Clip を使う |
| 定常的な背景騒音 | 約 70 dB 以下 | マイクの向きと位置を騒音源から離す。本番前に現場録音で認識精度を確認する |
| 機器自身の応答再生(対話) | ボード上の AEC が有効 | スピーカーをマイクボードに接続し、XVF3800 または Flex を使う |
約 3 m を超える、または定常騒音が約 70 dB を超えると、アレイは話者を分離できなくなり、演算性能が効く前に単語誤り率が悪化します。この二つの目安は店舗音声文字起こしすぐに導入できるソリューションの適用範囲の記述に基づく現場調査の判断基準で、実測の閾値ではありません。
割り込み可能な対話の受け入れ試験:スピーカーを通常の室内音量に設定し、実際の部屋で 3 回連続して、応答開始から 0.5〜1 秒後に割り込み、以前の応答が即座に止まり割り込んだ発話が欠落しないことを確認します。低音量で合格した端末でも、実運用の音量では音響上の理由で失敗することがあり、モデルとは無関係です。
ソリューションプロバイダー・SIer 向け:検証から納品まで
下流の顧客に納品する場合は、選定段階で次の三点を確認します。
検証の手段。 音声対話と割り込み可能な対話には動作するすぐに導入できるソリューションがあり、提案段階のデモ環境構築に使えます:対話型音声 AIを参照してください。
自社システムとの連携。 対話ルートの連携ポイントは OpenAI 互換のストリーミング Chat Completions エンドポイントです。エンドポイントアドレスを自社の RAG サービス、チケット・注文システム、ロボットの指令層に向ければ、音声層の変更は不要です。ローカルとクラウドの LLM の切り替えも、エンドポイントアドレスの変更のみです。文字起こしルートは各発話の最終テキストを業務システムにアップロードします。
ハードウェアのカスタマイズと量産供給。 筐体、ブランド表示、パッケージ、インターフェースの変更はカスタマイズ案件として検討できます。reSpeaker Flex の分離構造により、製品筐体に合わせてアレイを配置できます。カスタマイズの範囲、認証、納期は ODM/OEM カスタマイズサービスを参照してください。
算出基準と比較範囲
同時処理チャネル数と精度は ASR サービスの実測値であり、エンドツーエンドの受け入れ値ではありません。 計測は ASR の発話終了から最終結果までで、VAD・アップロード・保存は含みません。コーパスは 4 秒以内の短い音声で、長い発話や連続した対話は別途測定が必要です。
機器データは Seeed 自社製品ラインから取得しており、入門ゲートウェイの reRouter CM4 から reComputer J4012 まで、同一の ASR サービスと同一のコーパスで測定しています。単一の製品ラインで比較しているのは、メーカーをまたぐ音声同時処理のデータは測定条件が揃わないことが多く、モデル・音声長・計測の開始点と終了点のいずれかが異なると数値を比較できないためです。本記事の手順(対話形式を決め、次に収音とローカル処理範囲を決め、最後に現場の音響条件を確認する)は特定ブランドに依存せず、他社の機器にも同様に適用できます。
データ出典と測定条件
- SenseVoice 同時処理チャネル数と p50 / p95:OpenVoiceStream ASR サービス、SenseVoice。Jetson は 200 系統、RK は 100 系統の同時処理コーパス、各音声 4 秒以内。ASR の発話終了から最終結果までを計測。出典:店舗音声文字起こしすぐに導入できるソリューションの技術文書
- 精度:同一の 100 件コーパス。中国語 CER 4.82%(J3011、J4012、RK3576、RK3588 で同一)、英語 WER は J4012 7.62%、J3011 7.62%、RK3576 8.51%、RK3588 7.50%
- 対話言語:reComputer RK3576 は中国語と英語、RK3588・J3011・J4012 は 30 言語すべて。出典:対話型音声 AI すぐに導入できるソリューションの技術文書
- マイク仕様:収音距離、カバー角度、アンプは Seeed Wiki の各機種ページと製品ページに基づく公称値
- 現場音響の目安(約 3 m、約 70 dB):店舗音声文字起こしすぐに導入できるソリューションの技術文書の適用範囲の記述。現場調査の判断基準
- 参考価格:Seeed 商品ページの価格。構成と時期により変動するため、商品ページの価格が優先します
本記事のデータは選定範囲を絞るためのものです。正式な納品前に、対象現場で実際のマイクと実際の音量による測定を一度行い、認識精度、割り込みの動作、エンドツーエンド遅延を確認することを推奨します。












