)
MinerU 多語言 OCR37 種語言文檔一次搞定PP-OCRv5 指南【免費下載鏈接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.項目地址: https://gitcode.com/GitHub_Trending/mi/MinerU中英混排的 PDF 丟進 OCR中文正常、英文變亂碼換成一份俄語合同識別結果干脆沒法用。這類問題的根源在于單語模型撐不起多語場景。MinerU 多語言 OCR 從 2.1.0 版本起在 pipeline 后端換用 PP-OCRv5 文本識別模型一次解析覆蓋 37 種語言官方給出的平均精度漲幅超過 30%。? MinerU 37 種語言能力速覽這套能力可以概括為三句話。語言上覆蓋東亞、拉丁、斯拉夫、阿拉伯、印度語系等主要語系共 37 種語言其中中英、日繁混合是精度最高的組合。效果上相比上一代識別模型平均識別精度提升超過 30%。使用上命令行和 Python 接口共用同一個lang入口不需要額外部署服務也不改變原有的輸出結構。 MinerU 多語言 OCR 快速上手安裝完成后一條命令就能看到結果mineru -p demo/pdfs/demo1.pdf -o output解析完成后output目錄下會生成 Markdown、圖片和結構化 JSON。想指定文檔語言加一個--lang參數即可例如--lang korean完整的參數說明見命令行工具文檔。Python 調用同樣短from mineru.cli.common import do_parse do_parse( input_pathdemo/pdfs/demo1.pdf, output_diroutput, )需要指定語言時給do_parse追加lang參數即可。模型首次運行會自動下載之后都是本地推理。下圖是識別階段框出的文本行每種語言走的都是同一套框選流程 原理白話版從文本檢測到分語系識別整條鏈路分四步。第一步版面模型先框出頁面上的文本行第二步系統根據你傳入的lang參數、或不傳時的默認設置決定調用哪套識別模型第三步對應語系的模型把文本行逐個轉成文字第四步所有語言的結果走同一套后處理包括斷字合并、標點校正再和版面信息一起組裝成 Markdown 或 JSON。下圖展示了文本行框選之前的版面檢測環節文本、公式、圖表區域被分別框出多語言識別都建立在這些框之上 MinerU 支持的語言列表下表按語系列出主要語言及對應的語言代碼代碼與--lang/lang參數一致語系代表語言語言代碼東亞中文、英文、日文、韓文、繁體中文ch、korean拉丁法、西、葡、德等主流拉丁語言及希臘語el希臘語其余走默認模型斯拉夫俄語等東斯拉夫語言east_slavic、cyrillic阿拉伯阿拉伯語arabic印度語系泰米爾語、泰盧固語、卡納達語、天城文ta、te、ka、devanagari東南亞泰語th選型建議文檔語言明確就填對應代碼中英日繁混排用默認的ch系列拿不準語言時先跑一遍默認流程再抽查結果。場景配置默認流程與顯式指定的取舍國際化商業報告多語言混排就保持默認流程基座模型本身已覆蓋 37 種語言不要強行指定單一語言若某一語言占絕對主導再顯式指定該語言。學術論文多語言引用公式解析默認開啟無需額外配置手寫頁或外文引用較多的論文把lang指向對應語系代碼更穩。純拉丁語系文檔直接跑默認流程即可不傳--lang。取舍的標準很簡單顯式指定的作用是把識別模型收窄到目標語系字典更聚焦、小語種更穩代價是猜錯語言反而降精度所以「確定才指定不確定用默認」。?? MinerU 語言識別不準怎么辦語言誤判如把日文按中文識別出現同形字錯誤原因是混排頁面按高頻語言優先顯式--lang到正確語言即可糾正。個別語言效果差小語種訓練樣本少生僻符號仍會出錯換用該語系專用代碼或把掃描件提升到 300DPI 左右再跑一次。大文檔內存吃緊一次處理的頁數越多內存峰值越高調小環境變量MINERU_PROCESSING_WINDOW_SIZE默認 64分批處理。更細的參數含義可以對照快速上手文檔里的環境變量一節。MinerU 2.1.0 把多語言識別從「按語言挑工具」變成了同一條 pipeline 里的常規操作檢測、分語系識別、后處理共用一個流程37 種語言共享同一套輸出格式中英混合識別也不再需要前后兩套工具。[!TIP] 本文基于 2.1.0 版本的功能與參數編寫。后續版本可能調整語言代碼與默認模型使用前請以對應版本的文檔為準。【免費下載鏈接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.項目地址: https://gitcode.com/GitHub_Trending/mi/MinerU創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考