OpenJarvis — 全離線 AI 會議助理
建立重視資料隱私的本地 AI 會議工具,支援語音辨識、逐字稿與摘要,敏感音訊不需上傳雲端。
PrototypeGWP4 自有產品案例
本案例為 GWP4 自行開發的產品或研究專案,並非外部客戶委託案。列出的內容用於呈現實際技術能力與做法。
- 本地 AI
- 語音辨識
- 資料隱私
- 桌面應用
- AI 摘要
背景與問題
會議音訊往往包含客戶名稱、報價、內部決策等敏感內容。市面上的 AI 會議工具多半需要把音訊上傳雲端處理,對資安要求高的團隊來說難以採用。另一個實際情境是:有些場合不方便開口說話,需要用打字取代發言。
原本的處理方式
會議紀錄靠人工邊聽邊打,或事後回聽錄音整理;若使用雲端 AI 工具,則必須接受音訊離開自有環境。
設計目標
- 所有音訊處理都在本機完成,不呼叫雲端 API
- 即時產生逐字稿並在會後給出摘要
- 能以文字輸入合成語音,在會議中代替發言
- 在一般筆電硬體上就能運作
解決方案
以 Tauri 建立 macOS 桌面應用,音訊 I/O 走系統原生介面,語音辨識使用可在 Apple Silicon 本地推理的模型,摘要由本地 LLM 產生,語音合成同樣在本機執行。透過虛擬音訊裝置做音訊路由,讓合成語音能送進會議軟體,同時使用者仍聽得到會議中其他人的聲音。
核心功能
- 本地語音辨識與即時逐字稿
- 本地 LLM 會議摘要
- 本地語音合成(文字轉語音代替發言)
- 虛擬音訊路由,可與線上會議軟體整合
- 全程離線,音訊不離開裝置
系統架構
Tauri 2.x(Rust + WebView)桌面框架;前端 React 19 + TypeScript;音訊 I/O 使用 cpal 與 CoreAudio FFI;語音辨識 WhisperKit(Apple Silicon 本地推理);LLM 以 Ollama 執行;TTS 使用本地語音合成模型;虛擬音訊裝置負責 loopback 路由。
技術選擇
- Tauri 2.x(Rust)
- React 19 + TypeScript + Vite
- cpal / CoreAudio FFI
- WhisperKit 本地語音辨識
- Ollama 本地 LLM
- 本地 TTS 模型
- BlackHole 虛擬音訊裝置
開發過程與限制
- 本地推理受硬體限制,模型大小與延遲需權衡
- 音訊路由需依賴虛擬音訊裝置,使用者需先完成系統設定
- 目前僅支援 macOS(Apple Silicon)
- 屬於原型階段,尚未包裝成一般使用者可直接安裝的產品
可驗證指標
以下皆為可查證的技術事實,不含未經驗證的成效數字。
- 資料處理位置
- 全部於本機執行,無雲端 API 呼叫
- 支援平台
- macOS(Apple Silicon)
- 功能模組
- 語音辨識、逐字稿、AI 摘要、語音合成
- 專案狀態
- Prototype
可以延伸到哪些產業
- 法律、醫療、金融等資料敏感產業
- 有資安規範不得將音訊上雲的企業
- 需要會議紀錄自動化的顧問與研究團隊
- 任何需要本地端 AI 推理的應用場景