Add comprehensive format integrity tests for various converters

This commit is contained in:
Your Name 2026-01-23 23:15:36 +08:00
parent 47968f6c80
commit 80ab233d15
8 changed files with 1384 additions and 192 deletions

View file

@ -32,25 +32,44 @@ ConvertX-CN 完整版內建以下 OCR 語言:
1. 上傳 PDF 檔案
2. 選擇 Converter: `OCRmyPDF`
3. 選擇目標語言:
| 格式 | 說明 |
| ---- | ---- |
| `pdf-en` | English |
| `pdf-zh-TW` | 繁體中文 |
| `pdf-zh` | 簡體中文 |
| `pdf-ja` | 日本語 |
| `pdf-ko` | 한국어 |
| `pdf-de` | Deutsch |
| `pdf-fr` | Français |
3. 選擇目標格式:
| 格式 | 說明 | 推薦場景 |
| ----------- | ------------------------------ | ---------------- |
| `pdf-ocr` | **自動檢測(多語言)** ⭐ 推薦 | 通用、多語言文件 |
| `pdf-en` | 僅英文 | 純英文文件 |
| `pdf-zh-TW` | 僅繁體中文 | 純繁體中文文件 |
| `pdf-zh` | 僅簡體中文 | 純簡體中文文件 |
| `pdf-ja` | 僅日文 | 純日文文件 |
| `pdf-ko` | 僅韓文 | 純韓文文件 |
| `pdf-de` | 僅德文 | 純德文文件 |
| `pdf-fr` | 僅法文 | 純法文文件 |
4. 進行轉換
> 💡 **功能特點**
>
> - **自動多語言檢測**`pdf-ocr` 模式可處理中英混排、多語言文件
> - 自動偵測頁面方向並旋轉
> - 自動校正傾斜
> - 跳過已有文字層的頁面
> - 詳細的處理進度輸出
### 🆕 自動多語言檢測模式
選擇 `pdf-ocr` 時,系統會使用所有已安裝的語言包進行辨識:
```
eng + chi_tra + chi_sim + jpn + kor + deu + fra
```
**適用場景:**
- ✅ 中英混排文件(如學術論文)
- ✅ 日英混排文件
- ✅ 不確定文件語言時
- ✅ 包含多種語言的文件
### 圖片 → 文字
1. 上傳圖片PNG, JPG, TIFF 等)
@ -96,12 +115,17 @@ ConvertX-CN 完整版內建以下 OCR 語言:
### 處理多語言文件
Tesseract 可同時辨識多種語言,但準確度可能下降。
#### 方法一:使用自動檢測模式(推薦)
建議:
選擇 `pdf-ocr` 格式,系統會自動使用所有語言包進行辨識,無需手動指定語言。
- 單一語言文件使用單一語言包
- 中英混合使用 `chi_tra+eng`
- ✅ 無需猜測文件語言
- ✅ 支援中英混排、多語言文件
- ✅ 一鍵處理所有情況
#### 方法二:指定單一語言
如果確定文件只包含單一語言,可選擇對應的語言格式(如 `pdf-en`),可能獲得更高的辨識準確度。
---