이미지 글자 추출 (OCR)
이미지 속 인쇄 글자를 텍스트로. 전부 브라우저 안에서 처리되고 이미지가 전송되지 않습니다.
또렷하게 인쇄된 글자용입니다. 손글씨, 흐린 사진, 기울어진 글자는 인식률이 매우 낮습니다. 처음 실행할 때 인식 엔진(약 10MB)을 불러오느라 시간이 걸리며, 이미지와 결과는 이 브라우저 밖으로 나가지 않습니다.
사용 방법
이미지를 고르고 언어를 선택한 뒤 글자 추출을 누르세요. 처음 한 번은 인식 엔진과 언어 데이터(약 10MB)를 불러오느라 수십 초까지 걸릴 수 있고, 그다음부터는 빨라집니다. 결과는 아래 칸에 나오며 바로 고쳐 쓰고 복사할 수 있습니다.
잘 되는 것과 안 되는 것
인쇄물, 화면 캡처, 또렷한 표지판처럼 반듯한 활자에 맞춰져 있습니다. 손글씨는 인식률이 매우 낮고, 흐리거나 기울어졌거나 배경이 복잡한 사진도 오류가 많습니다. 추출 결과에는 틀린 글자가 섞일 수 있으니 중요한 내용은 반드시 원본과 대조하세요.
처리 방식
오픈소스 테서랙트 엔진(tesseract.js, Apache-2.0)을 이 사이트에 내장해 브라우저 안에서만 돌립니다. 이미지, 중간 데이터, 결과 어느 것도 서버로 전송하거나 저장하지 않습니다.