卓上対話ロボット、産業用音声制御、スマートホームアシスタントの3つの現場における対話方式と導入の選択肢。
デバイス上で多言語を認識し音声で応答します。卓上機器、会議端末、案内キオスクに組み込み、双方向の音声対話に使えます。
主なメリット



倉庫、工場、サーバールームなどの現場で、エッジ音声が複雑なUIやバーコードスキャナを代替。現場作業員は自然言語で入出庫登録、設備点検、巡回報告、危険通知を実施。ローカルASRが構造化テキストを出力し、WMS、MES、IoTプラットフォームに直接連携可能。
主なメリット



XIAO ESP32S3を低消費電力のウェイクフロントエンドとし、起動後は本体が認識・対話・音声応答を行い、Matter、HomeAssistant、Mi Homeなどのローカルプロトコルで機器を制御します。ローカルLLMを選ぶとコマンドはローカルで処理され、オフラインでも使えます。
主なメリット



構成ツールは用途、音声グレード、同時処理数、ローカルLLM、集音方式、遅延要件を順に選んで具体的な型番を出します。
選び方に迷ったら 選定ガイドを詳しく見る →
音声処理の計算リソースをどこに置くかが、性能上限と単体BOMを決定します。一般的な3つの展開モデル:
主なメリット
| 製品画像 | デバイス | 同時対話数(音声のみ) | 音声機能 | ローカルLLM |
|---|---|---|---|---|
![]() | reRouter CM4 シリーズ | 1チャネル | マシン音声 | 非対応(クラウド可) |
![]() | reComputer RK3576 シリーズ | 1チャネル | シミュレート音声 | 4B–7B(RK1828必要) |
![]() | reComputer RK3588 シリーズ | 1チャネル | シミュレート音声 | 4B–7B(RK1828必要) |
![]() | reComputer J30 シリーズ | 1チャネル | リアル音声 | ~2B |
![]() | reComputer J40 シリーズ | 2〜3チャネル | リアル音声 | 4B–7B |
![]() | reComputer J50 シリーズ | 3チャネル以上 | リアル音声 | 7B–14B |
![]() | NVIDIA Jetson AGX Thor Developer Kit | 6チャネル以上(音声のみ) | リアル音声 | 14B–32B |
AIコンピュートボックスは対応音声能力によってランク分けされています。下表は本シナリオで利用できるデバイス一覧(ファミリー単位):各ファミリーの音声のみの同時対話数、音声機能、実行可能なローカルLLM規模を記載(マイクとスピーカーの選定は次のタブを参照)。具体的な型番・構成・アクセサリは下の構成ツールで選択してください。注:ローカルLLMを音声パイプラインと同一デバイスで実行すると性能が低下し、応答遅延が増加します。高並列 + 大規模モデルの場合は、より高い演算能力のグレードを推奨します。
主なメリット
| 製品 | タイプ | チップ | 集音 距離 | 収音 角度 | 内蔵 アンプ | コアアルゴリズム |
|---|---|---|---|---|---|---|
reSpeaker Lite | リニア 2マイク | XMOS XU316 | 3m | 180° | 5W | AEC · DoA |
reSpeaker XVF3800 | 円形 4マイク | XMOS XVF3800 | 5m | 360° | 5W | AEC · DoA · Multi-beamforming |
reSpeaker Clip | ウェアラブル 2マイク | nRF5340+nRF7002 | 3m | 360° | — | ノイズ抑制(SpeexDSP) |
reSpeaker Flex Circular-4 | 円形 4マイク | XMOS XVF3800 | 5m | 360° | 10W | AEC · DoA · Multi-beamforming |
reSpeaker Flex Linear-4 | リニア 4マイク | XMOS XVF3800 | 5m | 180° | 10W | AEC · DoA · Multi-beamforming |
主なメリット
対話モデルの配置によります。ローカルLLM(RK3588 + RK1828カード、またはJ4012)を選ぶと、認識・対話・音声合成はすべてデバイス上で実行され、初回オンライン起動でイメージとモデルをダウンロードした後はオフラインで動作します。クラウドモデルを選ぶと対話にはネットワークが必要で、認識と音声合成は引き続きデバイス上で実行されます。
演算能力のグレードによります。RK シリーズと J3011 は 1 チャンネル、J4012 は 2〜3 チャンネル、J5012 は 3 チャンネル以上に対応——いずれも音声処理のみ(認識+合成)の場合の数値です。ローカルLLMを載せると演算リソースがモデルに使われるため、1 チャンネルでの運用を推奨します。多拠点であればデバイスを増やして水平展開も可能です。
音声は出ません。認識と音声合成はデバイス上で行い、録音はアップロードされません。クラウドモデルを選ぶと、認識したテキストは設定したモデルAPIに送信されます。ローカルLLMを選ぶとテキストもデバイス内に留まります。業務システムと連携する場合に送られるのは認識後のテキストです。
可能です。ウェイクワードは短い中国語または英語のフレーズに変更でき、起動時に反映され、感度は厳格・標準・高感度の3段階です。声はマシン音・シミュレート音・リアル音の3段階で、J4012のリアル音モデルは参照音声から声をクローンできます。
1 年間のハードウェア保証と 1 年間の技術サポートを提供します。二次開発に関わる内容(自社開発アプリ、高度なカスタマイズ)はカスタマイズサービス窓口を通じ、プロジェクトチームがサポート方法を評価します。
可能です。本ソリューションで使用する Seeed 製品は、ロゴ・筐体・パッケージ・プリインストールファームウェアのカスタマイズに対応し、既存モデルへのインターフェースや機能の追加・削除も可能です。対応範囲と流れはハードウェアカスタマイズサービスをご覧ください。。