ツール/フレームワーク重要度 ★9
Persian Pixel:ペルシャ語のための大規模合成OCRデータセット
Persian Pixel: A large-scale synthetic OCR dataset for Persian language
https://export.arxiv.org/api/query·2026/7/22
AI要約
ペルシア語のOCR精度向上に向け、大規模合成OCRデータセット「Persian Pixel」を開発。ペルシア文字の複雑さとデータセット不足の課題に対応し、より高度なOCR技術の発展を促進する。
AI要点
- ペルシャ語OCRの精度向上を目指し、「Persian Pixel」という大規模合成OCRデータセットを開発した。
- ペルシャ文字特有の複雑さ(連結性、字形変化、書体など)とデータ不足という課題に対応する。
- 700万語のコーパスから34万3千件以上の高品質な画像テキストペアを合成生成した。
- 文書取得時の劣化(インクのにじみ、紙の経年劣化、ぼかしなど)を再現する25以上の劣化モデルを適用した。
- TrOCRやDonutのような最新のOCRアーキテクチャの学習・ファインチューニングに利用可能である。
なぜ重要か
Persian Pixelは、これまで不足していたペルシャ語OCR用の大規模データセットを提供することで、ペルシャ語文書の認識精度を飛躍的に向上させる。これにより、ペルシャ語圏のデジタル化と情報アクセスが促進される。