在线扫描型 PDF OCR 文字识别与编辑工具
高效、安全的在线 PDF OCR 识别工具,专为扫描件 PDF、图片型文档设计。直接在浏览器内完成文档识别与排版还原,支持在线实时编辑与校对,并一键导出双层可检索 PDF、TXT 文档及图文对比结果。

使用流程
- 上传扫描型 PDF 页面或图片(jpg、webp、png)。
- 选择文档主要文字语言及识别精度模式(快速 / 平衡 / 高精度)。
- 系统自动识别文本区域并保持正确的分栏顺序。
- 在内置编辑器中查看识别结果,可按需对文字进行修改、删除或加粗标注。
- 点击导出按钮,按需下载双层透明文本 PDF、纯 TXT 或对比图。
核心功能与特色
- 在线即时编辑与校对:OCR 识别完成后,可直接在页面中对识别出的文本进行修改、删除以及加粗处理,所见即所得,大幅提升校对效率。
- 智能多栏排版与阅读顺序还原:针对学术论文、期刊报纸等多栏(分栏)排版结构,自动分析版面版式,精准按人类阅读顺序提取文本,避免跨栏错乱串行,保持文本选取的正确逻辑顺序。
- 支持导出可搜索双层 PDF:一键生成叠加透明文本层的双层 PDF 文档,完美保留原图排版与视觉质感,同时支持文字选中、复制与全文字检索。
- 多样化结果导出:除双层 PDF 外,还支持单独导出纯文本(TXT)以及识别比对图(Comparison),便于快速核对识别精度。
- 纯浏览器端运行,隐私安全:文档处理在本地浏览器端快速计算完成,无需担忧敏感文件泄露,同时支持多页面与批量 OCR 处理。
- 多档模型精度灵活切换:提供'快速(Fast)'、'平衡(Balanced)'和'高精度(High precision)'三种识别档位,满足速度优先或极致准确度等不同场景需求。
广泛的多语言与跨文字识别支持

每种语言选项均默认内置对英文字母、数字和常见标点符号的识别支持,覆盖全球上百种主流与区域语言:
汉字、假名及拉丁字母(50+ 种语言)
简体中文、繁體中文、日本語、English、Tiếng Việt、Bahasa Indonesia、Bahasa Melayu、Tagalog、Türkçe、Azərbaycan dili、Oʻzbekcha、Deutsch、Français、Italiano、Español、Português、Nederlands、Polski、Čeština、Slovenčina、Magyar、Română、Srpski (latinica)、Hrvatski、Bosanski、Slovenščina、Shqip、Svenska、Dansk、Norsk、Suomi、Eesti、Latviešu、Lietuvių、Íslenska、Gaeilge、Cymraeg、Euskara、Català、Galego、Occitan、Rumantsch、Lëtzebuergesch、Malti、Kurdî、Latina、Kiswahili、Afrikaans、Runasimi、Te Reo Māori 等。
西里尔字母 Script(33 种语言)
Русский、Беларуская、Українська、Српски (ћирилица)、Български、Монгол хэл、Аҧсшәа、Адыгэбзэ、Адыгэбзэ (Къэбэрдей)、Авар мацӀ、Дарган мез、Гӏалгӏай мотт、Нохчийн мотт、Лакку маз、Лезги чIал、Табасаран чIал、Қазақша、Кыргызча、Тоҷикӣ、Македонски、Татарча、Чӑвашла、Башҡортса、Марий йылме、Мокшень / Эрзянь кяль、Удмурт кыл、Коми кыв、Ирон æвзаг、Буряад хэлэн、Хальмг келн、Тыва дыл、Саха тыла、Qaraqalpaqsha (Кирилл)。
阿拉伯文 Script(8 种语言)
العربية(阿拉伯语)、فارسی(波斯语)、ئۇيغۇرچە(维吾尔语)、اردو(乌尔都语)、پښتو(普什图语)、کوردی(库尔德语)、سنڌي(信德语)、بلۆچی(俾路支语)。
天城文 Script(12 种语言)
हिन्दी(印地语)、मराठी(马拉地语)、नेपाली(尼泊尔语)、संस्कृतम्(梵语)、मैथिली、भोजपुरी、मगही、सादरी、नेपाल भाषा、कोंकणी、हरियाणवी、बिहारी。
其他语系
- 한국어(韩文/朝鲜文)
- ภาษาไทย(泰文)
- Ελληνικά(希腊文)
- தமிழ்(泰米尔文)
- తెలుగు(泰卢固文)
常见问题解答 (FAQ)
- 什么是带有透明文本层的双层 PDF?
- 双层 PDF 会在扫描图片下方或上方嵌入一层完全对齐的透明文本。这样既能 100% 保持原始扫描图像的外观细节,又能让文档具备文字复制、高亮标记以及全文检索功能。
- 我的机密扫描件在识别时会被上传到云端吗?
- 不会。本工具完全在浏览器环境内通过本地引擎完成推理,所有的文字解析与文件导出均不离开您的设备,适合合同、病历、财务单据等高敏感度文档。
- 是否支持混合了英文和数字的文档?
- 支持。所有识别选项中均默认内置了对英文字母、数字和常见标点符号的识别能力,无需额外切换。
注:本工具 OCR 引擎基于 PP-OCRv5 与 PP-OCRv6 深度学习模型构建,具备更卓越的复杂排版解析力与文字识别准确率。

