언어 바꾸기English
이전 목록

자기지도 장면 텍스트 인식을 위한 마스크된 다음 스케일 예측

Masked Next-Scale Prediction for Self-supervised Scene Text Recognition

TL;DR AI

핵심 요약

1분
  1. 연구진은 장면 텍스트 인식을 위한 자기지도 학습 프레임워크인 Masked Next-Scale Prediction을 제안했다.

  2. 이 방법은 교차 스케일 특징 예측, 마스크 복원, 다중 스케일 언어 정렬을 결합해 텍스트의 계층 구조를 더 잘 모델링한다.

  3. Union14M과 표준 벤치마크에서 최고 수준의 성능을 기록했으며, 라벨링 데이터 의존도를 줄였다.

  4. 텍스트의 크기, 배치, 이미지 구조가 달라져도 더 견고하게 인식하도록 돕는다.

원문 보기