逐證
返回部落格

錄音檔轉文字怎麼做?逐句時間碼的工作原理

從音訊切成短段、辨識文字到對齊時間碼——解釋帶時間點的逐字稿是怎麼產生的,以及時間碼在訪談、會議核對時的實際用途。

2026年9月13日逐證逐證

把一段一小時的錄音變成可以逐句核對的逐字稿,背後其實是三個步驟:切段、辨識、對齊。理解這個流程,你就能知道為什麼有些逐字稿有時間碼、有些沒有,以及時間碼在做訪談或會議記錄時為什麼值得在意。

第一步:把音訊切成短段

語音辨識模型不是一口氣聽完一小時的音檔。系統會先把音訊切成幾秒到十幾秒的短段,切的原則是優先在停頓處下刀——一句話講完、換氣、轉話題的地方。切得越好,後面每一小段的辨識就越乾淨。

切段的好處是容錯:某一段辨識得不好,影響的是那幾秒,不是整份稿子。

第二步:逐段辨識文字

每個短段送進語音辨識模型,輸出這一段最可能的文字。這一步的品質取決於:

  • 音訊條件:清晰的近距離收音遠勝於遠場會議室的殘響
  • 語言與口音:台灣華語、中英夾雜這類混合情境,對模型是更大的挑戰
  • 專有名詞:人名、品牌名、領域術語,模型可能猜錯——這也是為什麼支援自訂詞彙的工具會準確許多

第三步:對齊時間碼

辨識出的文字要跟原音對上位置,才會產生時間碼。有了時間碼,「這句話是幾分幾秒說的」就變成一個可以直接跳轉的座標。

時間碼的實際用途

對需要反覆核對的人來說,時間碼不是裝飾:

  • 訪談研究:受訪者說「我大概每週會用三次」,你聽到這句時想確認語氣——點時間碼直接跳回原音
  • 會議記錄:紀錄上寫的決議有爭議,回到那句話的時間點,聽當時是怎麼說的
  • 內容製作:剪輯時按時間碼找原話,不用來回拖進度條猜位置

修訂為什麼重要

沒有任何語音辨識能保證百分之百正確,尤其遇到專有名詞或嘈雜環境。所以一份可靠的逐字稿工具會把「修訂」做成一等公民:每段文字可以直接編輯,修改後保存新版本而不覆寫原始轉寫。這樣你永遠可以回到機器給的第一版,也能追蹤自己改過什麼。

小結

錄音轉文字的核心價值不只是「把話變成字」,而是讓每個字都可以被核對。切段、辨識、對齊三步產生帶時間碼的逐字稿,時間碼讓文字回到原音,修訂讓結果變成可信的工作成品。挑選工具時,與其只看宣稱的準確率,不如看它給不給你時間碼、修訂與版本記錄。