你還在花錢用AI上字幕? 立即使用
不收集個人資料 · 不做追蹤 · 檔案留在你的裝置

你還在 花錢
用 AI 上字幕?

純本機處理的影片上字幕工具:免費語音辨識、多語系翻譯、領域詞庫校正、智慧斷句排版,資料完全留在你的電腦。

不收集個人資料,不做追蹤,不會主動把你的影片、聲音或專案上傳到任何地方——它們都留在你的裝置上。

使用字幕工具的 3D 插畫角色,坐在電腦前,畫面上顯示影片字幕軟體
$0 月費/年費
會員/廣告/追蹤 通通都沒有
雲端+本地 模型來源隨你切換
100% 帳單由你自己繳

功能介紹

零後端伺服器:
影片不上傳,AI 來源隨你切換

免安裝網頁版

免安裝網頁版

不用下載程式,PC 和 Mac 打開網頁瀏覽器就能用!

講得很好聽,但說穿了,你用手機、平板 Safari 就幾乎不能用,而且你還是得乖乖花時間把影片傳到電腦上才能操作。

支援多國語言

支援多國語言

能聽懂、翻譯多少語言、品質如何,很大程度取決於選用的 AI 模型能力。

不要把供應商或開源模型的強大技術力,講得好像是我們做這些語音轉文字工具的人的功勞一樣。

完全免費,因為帳單是你自己繳 - 自備金鑰與零訂閱費透明計費插畫

完全免費,AI 帳單你自己繳

這裡不收訂閱月費,因為使用本地模型,買設備、電費成本、設定調校的時間成本全在你身上。

你也可以自己申請 Groq 或 ElevenLabs 的 API Key,你有什麼料,影片轉文字跟翻譯的時候它就跑多快。

最極致的隱私保護 - 本機安全金庫與資料完全留置設備插畫

最極致的隱私保護

不收集個人資料,不做追蹤。網站沒有會員機制,你的資料通通存在瀏覽器裡。壞處是沒有「跨裝置雲端同步」,換台電腦或手滑清掉快取,資料就跟著灰飛煙滅。

註:可以匯出srt字幕或影片,也可以匯出專案資料,轉移到其他瀏覽器。

沒有素材範本可以套

沒有素材範本

沒有提供一堆素材範本。字體、顏色、描邊、背景色等樣式請自己慢慢調,調好儲存成預設集後,也只有你自己看得到。

反正設計業都那麼低薪了,拉一拉參數被大家講得很簡單一樣。

樸實無華的字幕

樸實無華的字幕

抱歉這裡沒有講到哪、亮到哪的逐字級動態字幕。

我們有提供字幕翻譯、尋找取代、詞彙庫等實用功能,還有亮暗介面可以選。這工具本來是拿來處理會議紀錄、訪談紀錄、做筆記這種正經事的,沒有花俏的短影音特效。

我們沒能成為百萬 YouTuber,絕對不只是字幕樣式問題。

實用的匯出選項

實用的匯出選項

支援標準 SRT 字幕格式匯出,也可以匯出 VTT 或文字檔案。

如果你想在剪輯軟體裡保留樣式,請直接匯出「字幕綠幕片」,丟進剪輯軟體裡面把背景 Key 掉。

Final Cut Pro 的 FCPXML?沒做,沒實測過的功能不隨便給承諾。

沒有煩人的推播與電子報 - 零垃圾信與平靜的收件匣插畫

沒有煩人的推播與電子報

既然沒有會員系統,連你的 Email 都不會有。你不用擔心信箱被促銷信塞爆,不用擔心 LINE 訊息推播收到飽,也不用怕被推銷升級方案。

這就是個單純的影片字幕工具,打開就用,用完就關掉,互不相欠。

git log --recent-updates
持續發布中
v.20260903 增加辨識不同說話者功能
c64461c · 2026-09-03

支援微軟 VibeVoice、ElevenLabs 與 Gemini 多方對話/Podcast 聲紋分離,自動標註「說話者 A、B」與強制換人斷句。

v.20260902 增加字幕直接儲存至本機指定資料夾
35f1ef0 · 2026-09-02

支援 File System Access API 本機檔案同步,輸出時直接存入自選目錄,免去反覆手動下載確認。

v.20260902 升級 WebCodecs API 影片硬體編碼輸出
2fdf260 · 2026-09-02

導入 mp4-muxer 關鍵影格加速壓製,解決傳統 MediaRecorder 拖曳播放進度條時破圖花屏的問題。

v.20260831 整合 LLM 字幕多國語言翻譯與文字修飾
f87b784 · 2026-08-31

支援 Groq / Gemini 批次翻譯與台灣繁體風格校正,嚴格遵循一行對一行的時間軸不脫鉤。

v.20260830 新增批次多影片上傳與排程處理
bad2148 · 2026-08-30

一次拖入多支影音連續排程抽音辨識,辨識完成自動分別存入本機專案庫。

分支 main · 程式庫開箱即用 5 commits listed
最新進度

真實的近況更新日誌

沒有公關行銷話術,只有每天真實推進的程式碼提交紀錄。

從本地資料夾存取、WebCodecs 硬體編碼影片輸出,到多方訪談的說話者聲紋分離,想到實用功能就直接動手寫進去,隨時保持最新、最實用的狀態。

打開瀏覽器就能直接用,所有升級無縫生效。

某個還沒做出來的超前部署功能 - 未來全息科技原型插畫
即將推出

某個還沒做出來的超前部署功能

根本還不存在的功能,但是我先放在網頁上,讓大家以為我有。

反正這是現代常見的行銷技巧之一。

使用案例

月費幾百塊,只能轉錄幾小時?
這些任務根本不夠用

市面上許多訂閱制語音轉錄工具,月費收了好幾百塊,卻只給你少得可憐的幾小時額度,一旦超時就要面臨昂貴的加購費。

現實生活中,我們最常需要語音轉文字的場景,往往是「一刀未剪、廢話一堆、超級冗長」的原始檔。

一場早會,燒光整月額度

馬拉松式的企業會議紀錄

你只是想把跨部門會議或客戶提案轉成逐字稿,方便會後整理待辦事項。一場會議動輒兩三小時,如果用限制額度的訂閱制,光是紀錄一兩場會議,剩下的二十幾天你就只能對著螢幕發呆。

逐字稿是拿來分析的,不該拿來算錢

深度訪談與對話紀錄

做田調、寫論文或是進行深度訪談,錄音檔隨便都是兩小時起跳。這些充滿停頓、冗言贅字、甚至互相搶話的原始音檔,如果還要一分鐘一分鐘算錢,你根本捨不得把完整檔案放進去辨識。

學習不該被徵收「轉錄稅」

聽演講與線上課程做筆記

聽線上講座、技術分享、產品教學,報名了一整天的專業論壇,或是買了幾十個小時的線上課程。一整天的演講長達六七個小時,如果還要為了語音辨識時數去買高昂的超時加購包,這筆錢拿去吃頓大餐慰勞自己或提升自己不是更好嗎?

長時間掛網錄音,算分鐘數根本不切實際

分析節目和語音客服

想分析競爭對手的直播這幾小時到底講了什麼話術?或是把好幾個月的客服語音轉文字做情緒分析?這種「錄完就丟」的大量語料,只有使用無限制的本地端模型或微量計費的底層 API,才能真正實現轉錄自由。

建議解法:無時數限制,資料只在你的瀏覽器

用我們的網頁直連 Groq API、丟進 Google Gemini,或是跑本機模型——幾小時的會議一毛錢都不用多付。無時數上限,沒有加購壓力,也沒有會員綁定。你的音檔在哪,就在哪處理,結束。

定價方案

選擇最適合您的真實成本方案

我們不收昂貴的月租費,因為我們把選擇權交還給您。以下是您打造專屬工作流的真實花費,透明、彈性,絕不割韭菜。

動力來源

台灣電費
NT$ 1.63 〜 8.46
/ 度 (kWh)
按需計費 無隱藏合約
Home Plan
  • 家庭用電,按度計費
  • 24/7 全天候無中斷供電,設備隨時在線
  • 完美兼容 110V / 220V 終端設備
  • 階梯式動態計價,用越多越能展現財力
Enterprise Plan
  • 工作室與高負載場所申請營業用電契約
  • 依台電夏月/非夏月公告浮動計價
  • 支援尖離峰時間電價
  • 深夜跑模型更划算,省下的電費都是利潤

雲端 API 方案

推薦

Google Gemini API

Token / 分鐘計費
(享有龐大免費額度)
免費額度大 官方雙模型 精確毫秒時間軸

Google 官方雲端 API,同時支援專用轉錄模型與超划算的多模態模型。

  • gemini-3.5-transcribe 專用轉錄:輸入 $2.00/1M tokens(約 ~$0.003/分)、輸出 $12.00/1M tokens,綜合費率約 ~$0.005/分(一小時僅約 NT$10)。
  • gemini-3.5-flash-lite 高效多模態:免費方案每天享 500 RPD 額度;付費輸入僅 $0.30/1M tokens、輸出 $2.50/1M tokens,每小時轉錄不到 $0.05 美金(約 NT$1.6/小時)。
  • Gemini 網頁版跟 APP 表現很差,但直接用 API 可是一頭不可忽視的猛獸。
  • 用多少付多少:完全免綁月費,沒剪片花費就是 $0。
推薦

ElevenLabs Scribe v2 API

Pay-as-you-go
(依字數/分鐘數微量計費)
用多少付多少 業界頂規之一

有免費額度,不再被月費綁架,直連世界頂級語音辨識 API。

  • 極致語音轉文字:支援多語種、高精準度的語音辨識。
  • 毫秒級 API 響應:讓你的前端應用順滑無比。
  • 無痛串接:取得金鑰貼上即可,自己的帳單自己繳。每個月還有免費額度。
  • 拒絕訂閱制綁架:這個月沒剪片?恭喜,這項花費是 $0。
推薦

Groq API

Token 計價
(目前享開發者友善額度)
地表最快 閃電推論

有免費額度,$5 美金(約 NT$160)夠轉譯超過 100 小時的音檔。

  • 地表最快 LLM 速度:每秒生成字數海放傳統 GPU。
  • 相容 OpenAI 格式:零學習成本,無縫切換模型。
  • 語音轉文字 (Whisper-large-v3-turbo):$0.04/小時,$5 夠轉 125 小時。
  • 超高速文字處理:輸入每百萬 Token 僅需 $0.05。

本地算力方案

Mac 系列

Apple 蘋果電腦

NT$ 19,900 起
(一次性買斷)
潮度滿分 M晶片威能

咖啡廳工作者與質感創作者的標配。

  • Apple Silicon 統一記憶體:無痛運行本地 Whisper 與 Apple SpeechAnalyzer,還有其他蘋果內建的各種 AI。
  • 極致能耗比:充飽電剪一天,大幅降低家庭用電帳單。
  • 不貶值資產:一次買斷,你的硬體永遠是你的。早買早享受,晚買還漲價。

NVIDIA GPU 宇宙

帶 N 卡的 Windows PC

NT$ 20,000 起
(視老黃刀法而定,撿二手礦卡也行)
CUDA 生態圈 煉丹首選

硬核玩家與 AI 開發者的最終兵器。

  • CUDA 完整支援:跑各種開源 AI 模型唯一首選。
  • 三位一體多工:打遊戲、剪大片、跑模型,一台搞定。
  • 附贈物理暖氣:運算時自帶暖爐功能,冬天幫你省下空調電費。

或者,你也可以考慮

Google AI Pro

NT$ 650 / 月
2TB 雲端空間 超大文本神獸 懶人福音

堪稱當今性價比最不可思議的方案。表面上是買 2TB 大空間,實際上是直接送你一個世界頂級的 AI 助理!

  • 買空間送大腦:升級即解鎖 Gemini 用量,享用 Google 各種頂尖 AI 模型,寫信、做文件直接搞定。
  • 百萬級上下文視窗:幾小時的冗長錄音檔、整部影片直接丟進對話框,叫它生逐字稿並整理重點。
  • 降維打擊的方便:不用串接 API,不用懂程式。檔案拖曳上傳,打幾句提示詞直接使用 Google 最強算力。
前往官網

威力導演 365

NT$ 1,980 / 年
全功能解鎖 Windows / Mac

對比某個「只有上字幕」卻要收你一年 NT$4,800 起跳的網頁工具,不到兩千塊的真・剪輯軟體能給你的多太多了。

  • 包含威力導演 2026 所有功能,無閹割。
  • 支援進階 AI & 生成式 AI,每月功能更新。
  • 1,500+ 標題範本、700+ 轉場、3,200+ 特效濾鏡。
  • 每月贈送 100 點 AI 工具點數,再送 50GB 雲端空間。
前往官網

水啦 Suila

完全免費
iOS 26+ 本機處理 無廣告無追蹤

台灣獨立開發者 Hanpo 打造的 iOS 剪輯 app,沒有廣告、不做追蹤,所有處理都在裝置上完成,影片不會上傳到任何外部伺服器。

  • 內建語音辨識自動字幕,支援 7 種語言,首次使用下載模型後完全離線。
  • 字幕可分割、合併、調整時間軸,自訂字型、描邊、陰影、間距。
  • 多達 10 個文字圖層,支援關鍵影格動畫,附 Reels / TikTok / Shorts 安全框線。
  • 內附 5 款商用授權中文字體,也可匯入自訂 .ttf / .otf。
Download on the App Store

買一套完整的全方位影片編輯工具,一年不到兩千塊。如果你願意花 NT$4,800 只為了在網頁上「產生一個字幕」,每個月只有3小時額度,感謝您支持台灣的創作者。

本機儲存

我的專案

目前本地網頁瀏覽器中記錄的專案資料。

文章專區 / BLOG

語音辨識與字幕工程實戰

不講空泛大道理,從真實影音辨識盲區、前端音訊處理到開源模型調校的深度技術分享。

常見問題

Q1.支援辨認哪些語言的影片?

取決於你接的 API 模型,Whisper large-v3 支援約 100 種語言,Gemini 也支援 80 種,ElevenLabs Scribe v2 也有廣泛的多語種支援。但支援是一回事,錯誤率又是一回事,如下圖可以看到 Whisper 的原廠放出來的各語言 WER (字詞錯誤率)和 CER (字元錯誤率)比例。

能辨識某種語言,不代表每種內容都能辨識得好,專業術語、專有名詞、流行語是否出現在模型的訓練資料與詞彙涵蓋範圍內,都會影響辨識結果。斷句是否自然、時間軸是否準確,也會受到錄音品質、說話速度與模型處理方式影響。

遇到背景噪音、多人搶話或語意不明的片段,還可能出現幻覺,也就是音檔沒有說出口、卻被模型自行補出的文字。或是明明有講話人聲,AI卻判定沒人講話。

不要把 AI 模型廠商的功勞當成語音轉字幕工具的功勞,也不要把在工具介面與後續處理流程做的調整,誤算成 AI 模型本身的功勞。

Whisper 各語言的字詞錯誤率與字元錯誤率比較圖
詳情請參閱 Whisper 官方 GitHub

Q2.這工具真的完全免費嗎?

網站本身不收費,但你需要自備 API Key(雲端的 AI 如 Groq、ElevenLabs 等),這些廠商有提供少許免費額度。或是在自己的電腦跑 AI 大模型。

說穿了,本工具只是幫你省下「套殼網站」「套殼轉文字」的軟體費用,帳單還是得自己繳。而且你必須自己處理碰到的所有問題。

Q3.我的影片資料會上傳到伺服器嗎?

不會。所有處理都在你的瀏覽器本機完成,影片檔案不會離開你的電腦,我不會知道你的影片內容。

缺點是你也別期待什麼「雲端備份」「跨裝置同步」或「用手機上傳影片在電腦上編輯」。

這種技術架構受限於瀏覽器前端技術,也無法完整復刻 Adobe Premiere 或 DaVinCi Resolve 所有的功能。

若使用 Groq Whisper 或 ElevenLabs 或其他雲端的 AI API,會在影片/語音轉字幕時,將影片的語音部份;或是字幕翻譯時,將文字上傳到別人家的雲端。

Q4.手機和平板可以用嗎?

iOS Safari 對 Web API 的限制很多,實際體驗可能很差甚至根本跑不起來。建議使用桌機或筆電的 Chrome / Edge / Firefox。

Q5.可以匯出哪些格式?

支援 SRT、VTT 等標準字幕格式,也可以匯出純段落文字,以及「字幕綠幕片」讓你在剪輯軟體裡把產生的字幕影片背景 key 掉,疊在原始影片上,這樣可以保留一些特殊字幕樣式。

Final Cut Pro 的 FCPXML 呢?沒做,因為我沒在用 FCP,沒實測過不隨便承諾。

Q6.我的專案資料存在哪裡?

存在你瀏覽器裡。換台電腦、換瀏覽器、清瀏覽器資料就不見了。這不是 bug,這是「極致隱私保護」功能。請自己把重要的字幕檔備份好。

Q7.為什麼沒有逐字動態字幕?

因為這工具的定位是處理會議紀錄、訪談逐字稿、聽演講做筆記這類正經事,不是做短影音特效。如果你需要那種「講到哪亮到哪」的逐字動態效果,請移駕其他工具。

上面是一般說法,現實的問題是:不是每個模型都有支援逐字時間戳(word-level timestamps),有支援的模型碰上中文,效果也可能廢到笑,到時候使用者又覺得「這款字幕工具」很爛?

Q8.為什麼每次都要重填 API Key?

因為本工具不用任何方式儲存您的 API Key 資料,關閉瀏覽器或重整頁面後,金鑰就會消失,下次使用請再填一次。

Q9.我的 API Key 會被盜用嗎?

本工具沒有保存您的 API Key 資料,你的 API Key 也不會經過我的伺服器。

至於您的電腦有沒有安裝會偷資料的瀏覽器擴充套件,或是碰到側錄器會抓鍵盤或剪貼簿紀錄,還是電腦沒上鎖大家都能隨便用,還是設定表單自動完成? 這些我管不著。

Q10:這個語音辨識又快又準嗎?

老實說,市面上沒有任何一套模型是裝上去就什麼內容都自動又快又準。「速度」取決於您的方案:雲端引擎看廠商的營運與調度狀況,本地模型則看顯卡與機器等級。「準確度」取決於模型對於辨識字詞、斷句等各種能力,再加上後續調校,把模型原始辨識結果調整成好像這種語音轉文字軟體隨便一個人都能做的樣子。

Q11:字幕有樣式庫可以選嗎?

字體、顏色、描邊、位置都能自訂,調整好之後可以儲存成自己的樣式預設集,以後開新專案直接套用——樣式只存在您的瀏覽器裡,只有您自己看得到。反正純設計都那麼低薪了,調個字幕樣式應該難不倒大家。

無會員機制,也根本沒有想要保留大家的字幕樣式,我也不用考慮如何避免有人亂分享字幕樣式,省得管理的功夫。

Q12:用這工具上字幕能成為百萬 YouTuber 嗎?

我也不知道。這工具的設計初衷本來就不是拿來做華麗的影片,而是語音轉文字的正事:會議紀錄、語音來電、訪談對話記錄、操作說明、聽演講做筆記、分析直播購物主持人講了什麼。

當然,如果您用了之後真的變成百萬 YouTuber,記得回來跟我說一聲,讓大家高興一下。

Q13:一分鐘內把自己電腦變成 AI 伺服器是真的嗎?

當然是假的,前提是電腦已經正常安裝好那些開源套件所需的必要程式,例如 Docker, brew, Python, Nvidia 顯卡驅動等等,還有下載好模型。不然在網路速度慢的地方,光下載模型就花了半小時。或是電腦太爛,光安裝就花了一小時。

Q14:使用這個工具有什麼瀏覽器版本或特殊 API 需求嗎?

為獲得 100% 完整功能,強烈建議使用電腦桌面版的 Google Chrome (94 以上版本,推薦最新版)Microsoft Edge (94 以上版本)。本工具使用多項現代瀏覽器底層 API,不同功能的瀏覽器相容性如下:

  • 指定電腦資料夾自動備份(File System Access API)
    Chrome 86+Edge 86+ 桌面版。Safari 與 Firefox 因安全架構未支援此 API(會自動降級為手動匯出/匯入 JSON 備份檔)。
  • 硬體加速標準 MP4 視訊編碼(WebCodecs API)
    Chrome 94+Edge 94+Safari 16.4+Firefox 130+。能以 GPU 逐幀高速輸出帶有標準 Fast-Start 索引與 1 秒關鍵影格的 MP4,解決播放器拉時間軸破圖問題(舊版瀏覽器會自動降級為 MediaRecorder 錄製)。
  • 連線本機 AI 模型(Local Whisper / Breeze-ASR / VibeVoice / Ollama)
    必須使用 ChromeEdge。Safari 與 Firefox 會因瀏覽器安全機制(Mixed Content)強制阻擋 HTTPS 網頁發送請求至 http://localhost:...http://127.0.0.1:... 的本地端點。
  • Chrome 內建 AI 模型(Gemini Nano / Built-in AI)
    若欲使用免金鑰的瀏覽器本機模型(Prompt / Translator / Summarizer),需使用 Google Chrome 128 以上版本(建議 131+) 且電腦具備 4GB 以上閒置記憶體與儲存空間。

總結:一般雲端 API 辨識與字幕編輯各家現代瀏覽器皆可運作;但若要使用「自動儲存到本機資料夾」或「連線本機模型」,請一律使用 Google Chrome 或 Microsoft Edge