LRC與AI字幕生成)
一條命令把1小時播客變雙語字幕OpenLRC簡單快速的音頻轉(zhuǎn)LRC與AI字幕生成【免費(fèi)下載鏈接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)來轉(zhuǎn)錄、翻譯你的音頻為字幕文件。項目地址: https://gitcode.com/gh_mirrors/op/openlrc給播客配字幕你還在逐句聽寫到凌晨OpenLRC 是一個開源的音頻轉(zhuǎn)LRC工具把錄音丟進(jìn)去AI 字幕生成自動完成——Whisper 識別出文字LLM 翻譯時間軸對齊同步歌詞到手全程一條命令。不管是播客、課程還是會議錄音流程都一樣耗時從天縮到幾十分鐘。工具本身 MIT 開源免費(fèi)只有翻譯環(huán)節(jié)走 LLM API 計費(fèi)。一小時的錄音你打算逐句聽寫多久咱們有更短的路。一條命令從音頻到 LRC 文件git clone https://gitcode.com/gh_mirrors/op/openlrc # 把倉庫拉下來 pip install . # 本地裝上 openlrc run -i 演講錄音.mp3 -t zh-cn # 音頻進(jìn)LRC 出-t是目標(biāo)語言換成什么就翻什么想留原文就加--bilingual雙語字幕一起給你。產(chǎn)出的就是帶精確時間戳的標(biāo)準(zhǔn) LRC 文件播放器直接能放。更多參數(shù)看倉庫根目錄的 README.md不想碰命令行也沒關(guān)系下文有網(wǎng)頁版。它到底做了什么30 秒看懂鏈路主鏈路比想象中短。ffmpeg 先對音頻做預(yù)處理響度歸一化可選降噪然后 Faster-Whisper——比普通 Whisper 快約 4 倍——把語音識別成帶時間戳的文本。接著進(jìn)入多智能體翻譯系統(tǒng)Context Reviewer 先審查上下文Validator 校驗翻譯請求最后 Translator 調(diào)用 LLM 完成翻譯時間軸還會按目標(biāo)語言的閱讀速度自動調(diào)整。一次丟多個文件時翻譯端是并行的不用排隊。想要深挖提示詞設(shè)計可以看 openlrc/prompter.py。誰會用幫你對號入座 這個 AI 聽寫工具基本覆蓋三類人場景原來怎么做現(xiàn)在多久音樂人做雙語歌詞找聽寫、再找翻譯、手動調(diào)時間軸3-5 天上傳一次30 分鐘出雙語 LRC省 80%在線課程做多語言字幕50 節(jié)課人工處理約兩周批量 2 小時跑完提速 95%跨國公司會議紀(jì)要會后再人工整理錄音實時生成字幕并導(dǎo)出 LRC整理時間少 60%一個人做創(chuàng)作還是帶課的團(tuán)隊都能對號入座對不上號的話拿手頭的音頻試一把也行。選翻譯模型1 小時音頻成本不到 1 毛錢模型百萬 token 成本輸入/輸出1 小時音頻預(yù)估成本gpt-4o-mini$0.5 / $1.5$0.01claude-3-haiku$0.25 / $1.25$0.015gemini-1.5-flash$0.175 / $2.1$0.01deepseek-chat$0.18 / $2.2$0.01怎么選英語音頻、要便宜快deepseek-chat、gpt-4o-mini、gemini-1.5-flash 夠用非英語、要精度claude-3-5-sonnet 更穩(wěn)。識別端另算先用 base 或 small 跑通流程就行高精度再上 large-v3識別準(zhǔn)確率提升 15-20%。文件攢一批一起處理還能省 API 調(diào)用費(fèi)。成本按 token 數(shù)估算實際會隨語言和語速略有浮動。雙語、降噪、自定義路由各給一條命令不解釋原理直接抄openlrc run -i 英語聽力.mp3 -t zh-cn --bilingual # 雙語字幕lrcer.run(./data/test.mp3, target_langzh-cn, noise_suppressTrue) # 低音質(zhì)音頻降噪ModelConfig(providerModelProvider.OPENAI, nameanthropic/claude-3.5-haiku, base_url你的OpenAI兼容網(wǎng)關(guān)地址, api_keysk-xxx)最后這條是給翻譯走任意 OpenAI 兼容的服務(wù)比如 OpenRouter用的。非技術(shù)用戶打開瀏覽器就能用不想碰命令行還有 Web 版openlrc gui跑完會打印一個本地地址瀏覽器打開就行。左邊側(cè)欄填 API 密鑰、選 Whisper 模型、計算類型、翻譯模型全是下拉框右邊拖拽上傳支持 MP3、WAV、FLAC、M4A、MP4 等格式單文件最大 200MB。選好點一下LRC 文件生成的整個過程都在瀏覽器里完成。先試一把拿 5 分鐘音頻跑一遍別一上來就扔長音頻。先截一段 5 分鐘的播客片段用開頭那條命令跑一遍檢查生成的播客字幕時間戳偏不偏、翻譯腔重不重。跑順手了再去看源碼——三個 Agent 的邏輯都在 openlrc/ 目錄里。項目開源有問題或者想法歡迎提 Issue。【免費(fèi)下載鏈接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)來轉(zhuǎn)錄、翻譯你的音頻為字幕文件。項目地址: https://gitcode.com/gh_mirrors/op/openlrc創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考