圖片文字翻譯品質增強工具。當使用者要求翻譯圖片中的文字時使用,特別是包含圖表、信息圖、簡報截圖等需要保持高品質排版的圖片。支援多語言翻譯、品質驗證、文字提取與重新渲染。支援直接圖片檔案(PNG/JPG)、PDF 中的圖片提取、掃描圖檔的影像預處理校正。適用場景:(1) 翻譯含有圖表的圖片並保持原始排版,(2) 需要品質檢驗確保翻譯後可讀性,(3) 多語言圖片本地化任務,(4) 從 PDF...
本技能提供高品質的圖片文字翻譯流程,解決傳統 OCR 翻譯工具常見的品質問題。
執行 scripts/extract_text.py 提取圖片中的文字:
python scripts/extract_text.py <input_image> --output <text_data.json>
輸出 JSON 格式包含:
執行 scripts/translate_text.py 進行翻譯:
python scripts/translate_text.py <text_data.json> --target-lang zh-TW --output <translated_data.json>
參數說明:
--target-lang: 目標語言代碼(zh-TW/zh-CN/en/ja/ko 等)--glossary: 可選,指定專業術語對照表路徑執行 scripts/render_image.py 生成翻譯後的圖片:
python scripts/render_image.py <input_image> <translated_data.json> --output <output_image.png>
渲染處理:
references/font_guidelines.md)執行 scripts/quality_check.py 驗證輸出品質:
python scripts/quality_check.py <output_image.png> <translated_data.json> --report <quality_report.json>
驗證標準:
可讀性檢查
位置準確性
完整性檢查
輸出報告
若品質檢查 FAIL,根據報告調整:
使用 scripts/pdf_and_preprocessing.py 提取 PDF 頁面:
python scripts/pdf_and_preprocessing.py extract-pdf <input.pdf> --output <pdf_images/> --dpi 300
參數說明:
--dpi: 輸出解析度,建議 300 DPI 以獲得最佳 OCR 效果提取完成後,對每個圖片執行標準流程(步驟 2-6)
對掃描或拍攝的圖片進行預處理:
# 完整預處理(去噪 + 校正 + 增強)
python scripts/pdf_and_preprocessing.py preprocess <scanned_image.jpg> \
--output <preprocessed.png> \
--operations denoise deskew enhance
# 僅傾斜校正
python scripts/pdf_and_preprocessing.py preprocess <image.jpg> \
--output <corrected.png> \
--operations deskew
# 二值化處理(適合黑白文檔)
python scripts/pdf_and_preprocessing.py preprocess <scan.jpg> \
--output <binary.png> \
--operations denoise binarize sharpen
可用的預處理操作:
denoise: 去噪deskew: 自動傾斜校正enhance: 對比度增強(CLAHE)binarize: 二值化(適合掃描文檔)sharpen: 銳化預處理完成後,執行標準流程(步驟 2-6)
python scripts/pdf_and_preprocessing.py crop <preprocessed.png> \
--output <cropped.png> \
--margin 10
選擇字體時考慮:
詳細字體清單與範例見 references/font_guidelines.md
處理多張圖片:
python scripts/batch_translate.py <input_folder> --target-lang zh-TW --output <output_folder> --quality-check
# 1. 提取 PDF
python scripts/pdf_and_preprocessing.py extract-pdf document.pdf --output pdf_pages/
# 2. 批次翻譯
python scripts/batch_translate.py pdf_pages/ --target-lang zh-TW --output translated_pages/
# 輸出: 每頁的翻譯圖片 + 品質報告
# 1. 預處理掃描圖片
python scripts/pdf_and_preprocessing.py preprocess scan.jpg \
--output preprocessed.png \
--operations denoise deskew enhance
# 2. 翻譯
python scripts/extract_text.py preprocessed.png --output text.json
python scripts/translate_text.py text.json --target-lang zh-TW --output translated.json
python scripts/render_image.py preprocessed.png translated.json --output final.png
python scripts/quality_check.py final.png translated.json --report report.json
編輯 references/translation_rules.json:
{
"glossary": {
"Mechanization": "機械化",
"Electrification": "電氣化"
},
"preserve_terms": ["AI", "API", "CPU"],
"domain": "technical"
}
參考 references/troubleshooting.md: