1. 文档
渲染 DPI
载入
未载入文档
2. 文本框 (mask 来源)
模型后端
vlm(视觉大模型)
pipeline(传统检测管线)
强制OCR
表格
公式
OCR 语言(留空=自动,如 ch / en / japan)
MinerU OCR 识别本文档
也可在画布上直接拖拽画框;点选框后按 Delete 删除。
清空本页框
3. Mask 参数
膨胀半径 (px)
7
Mask 形状
笔画级(Otsu 提取文字像素)
矩形(整个 bbox)
4. 处理策略
方法
LaMa (Modal GPU)
OpenCV TELEA(本地基线)
背景中值填充(本地基线)
LaMa 送入方式
按区域 crop(推荐)
整页送入
crop 合并距离 (px)
40
crop 上下文边距 (px)
64
整页缩放到最长边 (0=不缩放)
运行 Inpaint
5. 文字样式重建
测量每行字号/字色并做全文档调色板吸附。框来自 OCR(含文本与段落信息)或手画框。
无文本时默认文种(OCR 行按内容自动判断)
拉丁(西文)
中日韩
拉丁 ink/em 系数
CJK ink/em 系数
字号聚类容差 (%)
5
颜色聚类 ΔE 阈值
12
段落内先取中位数(推荐,需 OCR 框)
装行(bbox 内自动换行,装不下再缩字)
换行 + 整段等比缩小(推荐,段内字号一致)
换行 + 逐行缩小
单行不换行不缩放(诊断用,可能溢出)
翻译目标语言(DeepSeek,按段落送翻)
不翻译(重建原文)
简体中文
繁體中文
English
日本語
한국어
重建背景
Inpaint 后页面(完整效果,用上方 3/4 区参数)
空白页(只看样式还原)
分析本页文字样式
载入 PDF 后在这里切换页面
适应宽度
适应整页
−
100%
+
Ctrl+滚轮缩放
▶
结果(点图放大;按住结果图可对比原图)