자기지도 장면 텍스트 인식을 위한 마스크된 다음 스케일 예측
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition

TL;DR AI
1분핵심 요약
연구진은 장면 텍스트 인식을 위한 자기지도 학습 프레임워크인 Masked Next-Scale Prediction을 제안했다.
이 방법은 교차 스케일 특징 예측, 마스크 복원, 다중 스케일 언어 정렬을 결합해 텍스트의 계층 구조를 더 잘 모델링한다.
Union14M과 표준 벤치마크에서 최고 수준의 성능을 기록했으며, 라벨링 데이터 의존도를 줄였다.
텍스트의 크기, 배치, 이미지 구조가 달라져도 더 견고하게 인식하도록 돕는다.
