免安裝網頁版
不用下載程式,PC 和 Mac 打開網頁瀏覽器就能用!
講得很好聽,但說穿了,你用手機、平板 Safari 就幾乎不能用,而且你還是得乖乖花時間把影片傳到電腦上才能操作。
純本機處理的影片上字幕工具:免費語音辨識、多語系翻譯、領域詞庫校正、智慧斷句排版,資料完全留在你的電腦。
不收集個人資料,不做追蹤,不會主動把你的影片、聲音或專案上傳到任何地方——它們都留在你的裝置上。
功能介紹
不用下載程式,PC 和 Mac 打開網頁瀏覽器就能用!
講得很好聽,但說穿了,你用手機、平板 Safari 就幾乎不能用,而且你還是得乖乖花時間把影片傳到電腦上才能操作。
能聽懂、翻譯多少語言、品質如何,很大程度取決於選用的 AI 模型能力。
不要把供應商或開源模型的強大技術力,講得好像是我們做這些語音轉文字工具的人的功勞一樣。
這裡不收訂閱月費,因為使用本地模型,買設備、電費成本、設定調校的時間成本全在你身上。
你也可以自己申請 Groq 或 ElevenLabs 的 API Key,你有什麼料,影片轉文字跟翻譯的時候它就跑多快。
不收集個人資料,不做追蹤。網站沒有會員機制,你的資料通通存在瀏覽器裡。壞處是沒有「跨裝置雲端同步」,換台電腦或手滑清掉快取,資料就跟著灰飛煙滅。
註:可以匯出srt字幕或影片,也可以匯出專案資料,轉移到其他瀏覽器。
沒有提供一堆素材範本。字體、顏色、描邊、背景色等樣式請自己慢慢調,調好儲存成預設集後,也只有你自己看得到。
反正設計業都那麼低薪了,拉一拉參數被大家講得很簡單一樣。
抱歉這裡沒有講到哪、亮到哪的逐字級動態字幕。
我們有提供字幕翻譯、尋找取代、詞彙庫等實用功能,還有亮暗介面可以選。這工具本來是拿來處理會議紀錄、訪談紀錄、做筆記這種正經事的,沒有花俏的短影音特效。
我們沒能成為百萬 YouTuber,絕對不只是字幕樣式問題。
支援標準 SRT 字幕格式匯出,也可以匯出 VTT 或文字檔案。
如果你想在剪輯軟體裡保留樣式,請直接匯出「字幕綠幕片」,丟進剪輯軟體裡面把背景 Key 掉。
Final Cut Pro 的 FCPXML?沒做,沒實測過的功能不隨便給承諾。
既然沒有會員系統,連你的 Email 都不會有。你不用擔心信箱被促銷信塞爆,不用擔心 LINE 訊息推播收到飽,也不用怕被推銷升級方案。
這就是個單純的影片字幕工具,打開就用,用完就關掉,互不相欠。
沒有公關行銷話術,只有每天真實推進的程式碼提交紀錄。
從本地資料夾存取、WebCodecs 硬體編碼影片輸出,到多方訪談的說話者聲紋分離,想到實用功能就直接動手寫進去,隨時保持最新、最實用的狀態。
打開瀏覽器就能直接用,所有升級無縫生效。
根本還不存在的功能,但是我先放在網頁上,讓大家以為我有。
反正這是現代常見的行銷技巧之一。
使用案例
市面上許多訂閱制語音轉錄工具,月費收了好幾百塊,卻只給你少得可憐的幾小時額度,一旦超時就要面臨昂貴的加購費。
現實生活中,我們最常需要語音轉文字的場景,往往是「一刀未剪、廢話一堆、超級冗長」的原始檔。
一場早會,燒光整月額度
你只是想把跨部門會議或客戶提案轉成逐字稿,方便會後整理待辦事項。一場會議動輒兩三小時,如果用限制額度的訂閱制,光是紀錄一兩場會議,剩下的二十幾天你就只能對著螢幕發呆。
逐字稿是拿來分析的,不該拿來算錢
做田調、寫論文或是進行深度訪談,錄音檔隨便都是兩小時起跳。這些充滿停頓、冗言贅字、甚至互相搶話的原始音檔,如果還要一分鐘一分鐘算錢,你根本捨不得把完整檔案放進去辨識。
學習不該被徵收「轉錄稅」
聽線上講座、技術分享、產品教學,報名了一整天的專業論壇,或是買了幾十個小時的線上課程。一整天的演講長達六七個小時,如果還要為了語音辨識時數去買高昂的超時加購包,這筆錢拿去吃頓大餐慰勞自己或提升自己不是更好嗎?
長時間掛網錄音,算分鐘數根本不切實際
想分析競爭對手的直播這幾小時到底講了什麼話術?或是把好幾個月的客服語音轉文字做情緒分析?這種「錄完就丟」的大量語料,只有使用無限制的本地端模型或微量計費的底層 API,才能真正實現轉錄自由。
建議解法:無時數限制,資料只在你的瀏覽器
用我們的網頁直連 Groq API、丟進 Google Gemini,或是跑本機模型——幾小時的會議一毛錢都不用多付。無時數上限,沒有加購壓力,也沒有會員綁定。你的音檔在哪,就在哪處理,結束。
定價方案
我們不收昂貴的月租費,因為我們把選擇權交還給您。以下是您打造專屬工作流的真實花費,透明、彈性,絕不割韭菜。
動力來源
雲端 API 方案
Google 官方雲端 API,同時支援專用轉錄模型與超划算的多模態模型。
有免費額度,不再被月費綁架,直連世界頂級語音辨識 API。
有免費額度,$5 美金(約 NT$160)夠轉譯超過 100 小時的音檔。
本地算力方案
Mac 系列
咖啡廳工作者與質感創作者的標配。
NVIDIA GPU 宇宙
硬核玩家與 AI 開發者的最終兵器。
或者,你也可以考慮
堪稱當今性價比最不可思議的方案。表面上是買 2TB 大空間,實際上是直接送你一個世界頂級的 AI 助理!
對比某個「只有上字幕」卻要收你一年 NT$4,800 起跳的網頁工具,不到兩千塊的真・剪輯軟體能給你的多太多了。
買一套完整的全方位影片編輯工具,一年不到兩千塊。如果你願意花 NT$4,800 只為了在網頁上「產生一個字幕」,每個月只有3小時額度,感謝您支持台灣的創作者。
本機儲存
目前本地網頁瀏覽器中記錄的專案資料。
文章專區 / BLOG
不講空泛大道理,從真實影音辨識盲區、前端音訊處理到開源模型調校的深度技術分享。
剪映 CapCut、What'Sub、Whisper、YouTube 與專業剪輯軟體怎麼選?如果不打算上雲端、不想被昂貴月費綁架、需要多語系翻譯與隱私安全,這篇一次拆解真實限制與適用場景。
深入解析語音辨識大模型 (Whisper) 在真實影音上字幕時常見的 30 秒靜音跳躍盲區、無人聲純音效影片的幽靈台詞、提示詞反噬、時間戳倒流與重複字句過濾等核心痛點與後處理調校實戰。
取決於你接的 API 模型,Whisper large-v3 支援約 100 種語言,Gemini 也支援 80 種,ElevenLabs Scribe v2 也有廣泛的多語種支援。但支援是一回事,錯誤率又是一回事,如下圖可以看到 Whisper 的原廠放出來的各語言 WER (字詞錯誤率)和 CER (字元錯誤率)比例。
能辨識某種語言,不代表每種內容都能辨識得好,專業術語、專有名詞、流行語是否出現在模型的訓練資料與詞彙涵蓋範圍內,都會影響辨識結果。斷句是否自然、時間軸是否準確,也會受到錄音品質、說話速度與模型處理方式影響。
遇到背景噪音、多人搶話或語意不明的片段,還可能出現幻覺,也就是音檔沒有說出口、卻被模型自行補出的文字。或是明明有講話人聲,AI卻判定沒人講話。
不要把 AI 模型廠商的功勞當成語音轉字幕工具的功勞,也不要把在工具介面與後續處理流程做的調整,誤算成 AI 模型本身的功勞。
網站本身不收費,但你需要自備 API Key(雲端的 AI 如 Groq、ElevenLabs 等),這些廠商有提供少許免費額度。或是在自己的電腦跑 AI 大模型。
說穿了,本工具只是幫你省下「套殼網站」「套殼轉文字」的軟體費用,帳單還是得自己繳。而且你必須自己處理碰到的所有問題。
不會。所有處理都在你的瀏覽器本機完成,影片檔案不會離開你的電腦,我不會知道你的影片內容。
缺點是你也別期待什麼「雲端備份」「跨裝置同步」或「用手機上傳影片在電腦上編輯」。
這種技術架構受限於瀏覽器前端技術,也無法完整復刻 Adobe Premiere 或 DaVinCi Resolve 所有的功能。
若使用 Groq Whisper 或 ElevenLabs 或其他雲端的 AI API,會在影片/語音轉字幕時,將影片的語音部份;或是字幕翻譯時,將文字上傳到別人家的雲端。
iOS Safari 對 Web API 的限制很多,實際體驗可能很差甚至根本跑不起來。建議使用桌機或筆電的 Chrome / Edge / Firefox。
支援 SRT、VTT 等標準字幕格式,也可以匯出純段落文字,以及「字幕綠幕片」讓你在剪輯軟體裡把產生的字幕影片背景 key 掉,疊在原始影片上,這樣可以保留一些特殊字幕樣式。
Final Cut Pro 的 FCPXML 呢?沒做,因為我沒在用 FCP,沒實測過不隨便承諾。
存在你瀏覽器裡。換台電腦、換瀏覽器、清瀏覽器資料就不見了。這不是 bug,這是「極致隱私保護」功能。請自己把重要的字幕檔備份好。
因為這工具的定位是處理會議紀錄、訪談逐字稿、聽演講做筆記這類正經事,不是做短影音特效。如果你需要那種「講到哪亮到哪」的逐字動態效果,請移駕其他工具。
上面是一般說法,現實的問題是:不是每個模型都有支援逐字時間戳(word-level timestamps),有支援的模型碰上中文,效果也可能廢到笑,到時候使用者又覺得「這款字幕工具」很爛?
因為本工具不用任何方式儲存您的 API Key 資料,關閉瀏覽器或重整頁面後,金鑰就會消失,下次使用請再填一次。
本工具沒有保存您的 API Key 資料,你的 API Key 也不會經過我的伺服器。
至於您的電腦有沒有安裝會偷資料的瀏覽器擴充套件,或是碰到側錄器會抓鍵盤或剪貼簿紀錄,還是電腦沒上鎖大家都能隨便用,還是設定表單自動完成? 這些我管不著。
老實說,市面上沒有任何一套模型是裝上去就什麼內容都自動又快又準。「速度」取決於您的方案:雲端引擎看廠商的營運與調度狀況,本地模型則看顯卡與機器等級。「準確度」取決於模型對於辨識字詞、斷句等各種能力,再加上後續調校,把模型原始辨識結果調整成好像這種語音轉文字軟體隨便一個人都能做的樣子。
字體、顏色、描邊、位置都能自訂,調整好之後可以儲存成自己的樣式預設集,以後開新專案直接套用——樣式只存在您的瀏覽器裡,只有您自己看得到。反正純設計都那麼低薪了,調個字幕樣式應該難不倒大家。
無會員機制,也根本沒有想要保留大家的字幕樣式,我也不用考慮如何避免有人亂分享字幕樣式,省得管理的功夫。
我也不知道。這工具的設計初衷本來就不是拿來做華麗的影片,而是語音轉文字的正事:會議紀錄、語音來電、訪談對話記錄、操作說明、聽演講做筆記、分析直播購物主持人講了什麼。
當然,如果您用了之後真的變成百萬 YouTuber,記得回來跟我說一聲,讓大家高興一下。
當然是假的,前提是電腦已經正常安裝好那些開源套件所需的必要程式,例如 Docker, brew, Python, Nvidia 顯卡驅動等等,還有下載好模型。不然在網路速度慢的地方,光下載模型就花了半小時。或是電腦太爛,光安裝就花了一小時。
為獲得 100% 完整功能,強烈建議使用電腦桌面版的 Google Chrome (94 以上版本,推薦最新版) 或 Microsoft Edge (94 以上版本)。本工具使用多項現代瀏覽器底層 API,不同功能的瀏覽器相容性如下:
http://localhost:... 或 http://127.0.0.1:... 的本地端點。
總結:一般雲端 API 辨識與字幕編輯各家現代瀏覽器皆可運作;但若要使用「自動儲存到本機資料夾」或「連線本機模型」,請一律使用 Google Chrome 或 Microsoft Edge。