Tech
[分享创造] 做了一个漫画翻译的工具网站,分享下实现思路
从很早开始看漫画,一直追的是各种汉化组的翻译。感觉修图嵌字都是辛苦活,最近想看看用 AI 能做到哪一步。调研了一下 github ,开源项目还不少。
总体来说,翻译步骤一般包括:
文字定位(包括气泡文字+嵌在画面中的文字)
OCR
翻译
擦字
重绘
文字定位感觉是最重要的一步,是否找齐所有文字段,框定的范围是否完整,直接决定后续 OCR 的质量和擦字是否干净。很多文字边缘会有振假名的情况,一开始测试总是会漏掉它们,导致擦字有残留。
OCR+翻译其实可以用视觉大模型一次完成,不过测试下来感觉成本有些高,所以还是分成两步。
试用下来效果比较好的模型:
文字检测: YOLOv8-seg 用于气泡检测, RT-DETR-v2 用于气泡外文字定位;
OCR: manga-ocr 专门为漫画场景训练的 OCR 模型;
翻译:deepseek 或任何大模型,设定好 prompt 就行;
擦字:气泡有明确边界,所以气泡内直接用 OpenCV 根据阈值来擦。气泡外用 lama_large ;
...
Read the full discussion on V2EX
This article was aggregated from V2EX. Click to join the conversation.
View on V2EX