从很早开始看漫画,一直追的是各种汉化组的翻译。感觉修图嵌字都是辛苦活,最近想看看用 AI 能做到哪一步。调研了一下 github ,开源项目还不少。 总体来说,翻译步骤一般包括: 文字定位(包括气泡文字+嵌在画面中的文字) OCR 翻译 擦字 重绘 文字定位感觉是最重要的一步,是否找齐所有文字段,框定的范围是否完整,直接决定后续 OCR 的质量和擦字是否干净。很多文字边缘会有振假名的情况,一开始测试总是会漏掉它们,导致擦字有残留。 OCR+翻译其实可以用视觉大模型一次完成,不过测试下来感觉成本有些高,所以还是分成两步。 试用下来效果比较好的模型: 文字检测: YOLOv8-seg 用于气泡检测, RT-DETR-v2 用于气泡外文字定位; OCR: manga-ocr 专门为漫画场景训练的 OCR 模型; 翻译:deepseek 或任何大模型,设定好 prompt 就行; 擦字:气泡有明确边界,所以气泡内直接用 OpenCV 根据阈值来擦。气泡外用 lama_large ; ...