Windows下目前最強的本地離線語音輸入法,沒有之一

語音輸入已經成爲提升效率的重要方式,但很多語音輸入工具依賴雲端服務,用戶需要聯網才能使用,同時也會面臨隱私、延遲以及數據安全等問題。

軟件格律詩 推薦的 CapsWriter-Offline 提供了一種不同的選擇。

CapsWriter-Offline 是一款專爲 Windows 打造的完全離線語音輸入工具,它通過本地語音識別模型完成語音轉文字,不依賴雲端服務。用戶只需要按住 CapsLock 鍵或者鼠標側鍵 X2 開始說話,鬆開按鍵後,識別出的文字就會自動輸入到當前光標所在位置。

它追求的是一種接近“無感輸入”的體驗:不用切換窗口,不需要複製粘貼,只需要像和電腦說話一樣,就能完成文字輸入。項目強調完全離線、不受網絡限制、低延遲以及高度自定義熱詞系統,讓語音輸入更加貼近日常工作流。

核心功能特點:從語音輸入到完整語音工作流

  • 語音輸入:按住 CapsLock鍵 或 鼠標側鍵X2 說話,鬆開即輸入,超低延遲,默認去除末尾逗句號。支持對講機模式和單擊錄音模式。

  • 文件轉錄:音視頻文件往客戶端 exe 一丟,字幕 (.srt)、文本 (.txt)、時間戳 (.json) 統統都有。

  • 數字 ITN:自動將「十五六個」轉爲「15~16 個」,支持各種複雜數字格式。

  • 熱詞替換:在 hot.txt 記下偏僻詞,通過音素模糊匹配,相似度大於閾值則強制替換。

  • 正則替換:在 hot-rule.txt 用正則或簡單等號規則,精準強制替換。

  • LLM 角色:預置了潤色、小助理等角色,當識別結果的開頭匹配任一角色名字時,將交由該角色處理。

  • 托盤菜單:右鍵托盤圖標即可添加熱詞、複製結果、清除 LLM 記憶。

  • C/S 架構:服務端與客戶端分離,雖然 Win 7 老電腦跑不了服務端模型,但最少能用客戶端輸入。

  • 日記歸檔:按日期保存你的每一句語音及其識別結果。

  • 錄音保存:所有語音均保存爲本地音頻文件,隱私安全,永不丟失。

按住即說,鬆開即輸入

CapsWriter-Offline 最核心的功能就是實時語音輸入。

它支持兩種觸發方式:

使用鍵盤 CapsLock 鍵;使用鼠標側鍵 X2。

用戶按住按鍵後開始講話,鬆開後程序自動完成識別並將文字輸入到當前應用中,同時默認會去除末尾逗號、句號等標點,讓輸出更加符合連續輸入習慣。除此之外,它還支持對講機模式和單擊錄音模式,適應不同使用場景。

這種交互方式非常適合:

寫文章;聊天回覆;整理筆記;會議記錄;快速輸入長文本。

相比傳統鍵盤輸入,語音輸入能夠明顯降低雙手操作壓力。

支持音視頻文件轉錄

除了實時語音輸入,CapsWriter-Offline 還支持文件轉錄功能。

用戶可以直接將音視頻文件拖入客戶端 exe,程序會自動生成:

字幕文件 .srt;文本文件 .txt;帶時間戳的數據文件 .json。

這個功能對於視頻創作者、播客整理、課程筆記製作等場景非常實用,可以將已有音視頻內容快速轉換成文字資料。

如果需要使用文件轉錄功能,還需要安裝 FFmpeg,並確保其位於系統 PATH 中。

多種語音識別模型選擇

CapsWriter-Offline 支持多種語音識別引擎,用戶可以根據準確率、速度以及硬件條件選擇合適模型。

目前支持:

不同模型適合不同需求:

如果更關注速度,可以選擇輕量模型;如果更關注識別準確率,可以選擇更強模型;

如果擁有顯卡,則可以利用 GPU 加速提升處理效率。

低延遲本地識別體驗

CapsWriter-Offline 在 README 中提供了不同模型的性能參考,以 20 秒音頻轉錄延遲作爲測試指標:

在 CPU U 9-285 H 環境下:

Paraformer 延遲約 0.6 秒;

SenseVoice-Small 延遲約 0.6 秒;

Fun-ASR-Nano 延遲約 2 秒;

Qwen 3-ASR-1.7 B 延遲約 4 秒。

在 RTX 5050 GPU 環境下:

SenseVoice-Small 可達到約 0.15 秒;

Fun-ASR-Nano 約 0.5 秒;

Qwen 3-ASR-1.7 B 約 1 秒。

這樣的本地響應速度,讓語音輸入更接近實時交流體驗。

熱詞替換與自定義優化

對於專業用戶來說,普通語音識別經常會遇到專有名詞識別錯誤的問題。

CapsWriter-Offline 提供熱詞系統。

用戶可以在 hot.txt 中添加特殊詞彙,程序會通過音素模糊匹配,當相似度超過設定閾值後自動強制替換。

專業軟件名稱;人名;公司名稱;技術術語。

都可以通過熱詞配置提高識別準確率。

此外,它還支持正則替換功能,可以在 hot-rule.txt 中使用正則表達式或簡單等號規則,實現精準替換。

數字 ITN 智能轉換

CapsWriter-Offline 支持數字 ITN 功能。

語音輸入:

“十五六個”

可以自動轉換爲:

“15~16 個”。

同時支持複雜數字格式處理。

這對於寫作、數據記錄以及辦公輸入場景非常方便。

LLM 角色輔助處理

項目還加入了 LLM 角色功能。

程序預置了潤色、小助理等角色,當識別結果開頭匹配某個角色名稱時,會交由對應角色進行處理。

輸入一段語音草稿;

調用潤色角色;

獲得更加適合發佈的文本。

這讓 CapsWriter-Offline 從單純語音輸入工具進一步擴展爲語音創作助手。

本地保存錄音與日記歸檔

隱私保護也是 CapsWriter-Offline 的重要特點。

所有語音都會保存爲本地音頻文件,不上傳雲端。

同時,它支持按照日期保存每一句語音以及對應識別結果,形成語音日記歸檔。

對於重視數據安全的用戶,這種本地保存方式更加安心。

使用教程:如何安裝並開始語音輸入

第一步:準備運行環境

CapsWriter-Offline 目前主要保證在 Windows 10/11 64 位系統下運行。

首先需要安裝 VC++ 運行庫。

如果需要文件轉錄功能,還需要安裝 FFmpeg。

第二步:下載程序和模型

下載軟件主體。

隨後進入 Models Release 下載模型壓縮包,將模型解壓到對應的 models 文件夾中。

第三步:啓動服務

依次運行:

start_server.exe

start_client.exe

服務端啓動後會自動最小化到托盤菜單,客戶端啓動後同樣會進入托盤運行狀態。

第四步:開始語音輸入

打開任意可以輸入文字的軟件

瀏覽器;Word;聊天窗口;Markdown 編輯器。

將光標放在輸入位置,然後:

按住 CapsLock;或者按住鼠標側鍵 X 2;

開始講話。鬆開按鍵後,文字會自動出現。

我的使用感受

體驗 CapsWriter-Offline 後,我認爲它最大的特點是把語音輸入真正變成了電腦輸入方式的一部分。

很多語音工具的問題在於,它們需要打開專門窗口,完成識別後再複製文本,而 CapsWriter-Offline 的交互更加直接:哪裏需要輸入,就在哪裏說。

這種設計尤其適合長文本創作。

例如寫文章時,很多想法來自即時表達,鍵盤輸入容易打斷思路,而語音輸入可以讓創作過程更加自然。

另外,完全離線也是我比較看重的一點。對於一些包含個人資料、工作內容或者敏感信息的輸入場景,本地處理能夠減少數據上傳帶來的顧慮。

它目前主要面向 Windows 用戶,macOS 由於底層 keyboard 庫以及系統限制暫時無法支持。

如果你的主要設備是 Windows,並且經常需要輸入大量文字,CapsWriter-Offline 是一個非常值得嘗試的效率工具。(本文來自 Jamecling.vip/ge-wu-zhi-4/)

汁源見評論

近期熱門

我彙總了一篇從始至今發佈過的200+軟件及各類資源(每日更新)

溫故知新!近期發佈過的100+熱門資源,肯定能幫到你(持續更新)

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com