跳到主要內容

OpenJarvis — 全離線 AI 會議助理

建立重視資料隱私的本地 AI 會議工具,支援語音辨識、逐字稿與摘要,敏感音訊不需上傳雲端。

PrototypeGWP4 自有產品案例

本案例為 GWP4 自行開發的產品或研究專案,並非外部客戶委託案。列出的內容用於呈現實際技術能力與做法。

  • 本地 AI
  • 語音辨識
  • 資料隱私
  • 桌面應用
  • AI 摘要

背景與問題

會議音訊往往包含客戶名稱、報價、內部決策等敏感內容。市面上的 AI 會議工具多半需要把音訊上傳雲端處理,對資安要求高的團隊來說難以採用。另一個實際情境是:有些場合不方便開口說話,需要用打字取代發言。

原本的處理方式

會議紀錄靠人工邊聽邊打,或事後回聽錄音整理;若使用雲端 AI 工具,則必須接受音訊離開自有環境。

設計目標

  • 所有音訊處理都在本機完成,不呼叫雲端 API
  • 即時產生逐字稿並在會後給出摘要
  • 能以文字輸入合成語音,在會議中代替發言
  • 在一般筆電硬體上就能運作

解決方案

以 Tauri 建立 macOS 桌面應用,音訊 I/O 走系統原生介面,語音辨識使用可在 Apple Silicon 本地推理的模型,摘要由本地 LLM 產生,語音合成同樣在本機執行。透過虛擬音訊裝置做音訊路由,讓合成語音能送進會議軟體,同時使用者仍聽得到會議中其他人的聲音。

核心功能

  • 本地語音辨識與即時逐字稿
  • 本地 LLM 會議摘要
  • 本地語音合成(文字轉語音代替發言)
  • 虛擬音訊路由,可與線上會議軟體整合
  • 全程離線,音訊不離開裝置

系統架構

Tauri 2.x(Rust + WebView)桌面框架;前端 React 19 + TypeScript;音訊 I/O 使用 cpal 與 CoreAudio FFI;語音辨識 WhisperKit(Apple Silicon 本地推理);LLM 以 Ollama 執行;TTS 使用本地語音合成模型;虛擬音訊裝置負責 loopback 路由。

技術選擇

  • Tauri 2.x(Rust)
  • React 19 + TypeScript + Vite
  • cpal / CoreAudio FFI
  • WhisperKit 本地語音辨識
  • Ollama 本地 LLM
  • 本地 TTS 模型
  • BlackHole 虛擬音訊裝置

開發過程與限制

  • 本地推理受硬體限制,模型大小與延遲需權衡
  • 音訊路由需依賴虛擬音訊裝置,使用者需先完成系統設定
  • 目前僅支援 macOS(Apple Silicon)
  • 屬於原型階段,尚未包裝成一般使用者可直接安裝的產品

可驗證指標

以下皆為可查證的技術事實,不含未經驗證的成效數字。

資料處理位置
全部於本機執行,無雲端 API 呼叫
支援平台
macOS(Apple Silicon)
功能模組
語音辨識、逐字稿、AI 摘要、語音合成
專案狀態
Prototype

可以延伸到哪些產業

  • 法律、醫療、金融等資料敏感產業
  • 有資安規範不得將音訊上雲的企業
  • 需要會議紀錄自動化的顧問與研究團隊
  • 任何需要本地端 AI 推理的應用場景

想做類似的東西?

不需要先寫好規格。描述目前的流程與資料來源,我們就能評估可行做法與風險。