작동 방식
업로드부터 완료 파일까지 4단계
- 01
읽기
파일 읽기
엔진은 파일 이름을 기반으로 하는 대신 파일의 내용으로 파일 유형을 파악합니다. 텍스트 레이어가 있는 PDF, 스캔본, 사진 또는 Office 문서 등 각각의 유형은 다른 처리 경로를 거칩니다.
- 02
분리
페이지에서 단어 분리
텍스트만 추출됩니다. 이미지, 다이어그램, 차트, 사진, 서명 및 도장은 원래 위치에 그대로 유지되며 번역을 위해 전송되지 않습니다.
- 03
번역
번역 및 검증
각 구절은 수락되기 전에 번역되고 검증됩니다. 검증에 실패한 구절은 다시 번역됩니다.
- 04
재구성
페이지 재구성
번역본은 대상 언어의 문자를 포함하는 글꼴로 설정되어 원래 위치에 다시 삽입됩니다.
A · 디지털 PDF
텍스트 레이어가 있는 PDF
Word, InDesign 또는 유사한 프로그램에서 내보낸 PDF에서 엔진은 텍스트를 블록 단위, 테이블 셀 단위로 읽습니다. 번역 전에 문단의 줄을 하나의 구절로 결합하여 세 줄에 걸쳐 줄 바꿈되는 문장이 세 개의 조각이 아닌 하나의 문장으로 번역되도록 합니다. 그런 다음 페이지에서 원본 단어를 제거하고 이미지, 다이어그램 및 벡터 드로잉은 그대로 두고 번역본을 동일한 상자에 작성합니다.
번역본의 길이는 원본과 거의 같지 않습니다. 독일어와 러시아어는 일반적으로 영어보다 길고, 중국어와 일본어는 더 적은 문자를 사용합니다. 엔진은 텍스트가 원래 블록 내에서 줄 바꿈되도록 하고, 번역본이 여전히 맞지 않는 경우에만 글꼴 크기를 줄입니다. 테이블 셀은 하나씩 처리되므로 수치는 자체 행과 열에 유지됩니다.
B · 스캔 및 사진
스캔본 및 사진
스캔된 페이지는 이미지이므로 대체할 텍스트가 없습니다. 엔진은 원본 이미지를 페이지 배경으로 유지하고, OCR로 인쇄된 텍스트를 인식한 다음, 해당 글자의 잉크만 제거하고 주변 종이 색상으로 각 부분을 채웁니다. 실행 중인 텍스트가 아닌 것은 그대로 둡니다. 스탬프, 직인, 서명, 사진, 차트 및 다이어그램은 스캔된 그대로 유지되며, 이는 증명서 또는 서명된 계약서에 원하는 것입니다.
표는 인쇄된 그리드를 유지합니다. 엔진은 이미지에서 원본 표의 선을 찾아 셀 내부의 텍스트를 테두리를 건드리지 않고 지운 다음, 번역을 동일한 셀에 씁니다. 여백을 따라 옆으로 인쇄된 선은 옆으로 다시 쓰여집니다.
때로는 텍스트가 복잡한 배경 위에 있을 때처럼 선을 깨끗하게 지울 수 없는 경우가 있습니다. 이 경우 엔진은 번짐을 방지하기 위해 원본 인쇄를 그대로 두고, 페이지를 검색할 수 있도록 텍스트의 보이지 않는 복사본을 추가합니다.
C · 구조화된 파일
Word, Excel, PowerPoint, EPUB 및 HTML
Office 파일은 이미 텍스트와 레이아웃을 분리하여 보관하므로 엔진은 내부에서 번역합니다. 각 단락, 슬라이드 및 스프레드시트 셀의 단어를 대체하고 번역본이 단어 순서를 변경하더라도 해당 단어에 속한 굵게, 기울임꼴 및 기타 서식을 유지합니다.
EPUB 책과 HTML 페이지는 텍스트별로 번역되며 마크업은 그대로 유지되므로 챕터, 제목 및 링크는 번역된 복사본에서도 계속 작동합니다.
ENThe report is ready today.
↓
DEDer Bericht ist heute fertig.굵은 글씨 단어가 독일어 문장의 끝으로 이동하고 서식도 함께 이동합니다.
품질
파일이 반환되기 전 검사
AI 번역은 빠르게 읽을 때 놓치기 쉬운 방식으로 실패할 수 있으므로 엔진은 각 구절을 수락하기 전에 검사합니다:
reject번역 대신 원본을 반복하는 답변은 거부됩니다.reject잘못된 언어로 된 답변, 루프되거나 중간에 멈추는 답변, 다른 스크립트의 임의 문자가 포함된 답변도 마찬가지입니다.retry거부된 구절은 먼저 주변 줄과 함께 맥락을 위해 번역된 다음, 단독으로 다시 번역됩니다.compare숫자, 웹 주소 및 이메일 주소는 원본과 번역본 간에 비교되므로 변경된 수치는 플래그가 지정됩니다.reuse문서의 여러 페이지에 나타나는 문장은 한 번만 번역되므로 제목이나 용어는 문서 전체에서 동일하게 읽힙니다.discard문서의 상당 부분이 번역되지 않은 채로 반환되면, 엔진은 반쯤 번역된 파일을 넘겨주는 대신 해당 결과를 폐기합니다.
DocTranslator에서 구축 및 실행
당사의 자체 코드, 페이지 읽기부터 재구성까지.
엔진은 DocTranslator 팀에서 개발했습니다. 페이지 분석, 스캔 및 표 처리, 각 페이지 재구성 및 위의 검사는 저희 자체 코드입니다. 엔진을 직접 작성하기 때문에 이동된 표나 누락된 문자 같은 문제를 엔진 자체에서 수정할 수 있습니다.
중국어, 일본어, 한국어, 힌디어, 태국어 및 기타 스크립트로의 번역은 해당 문자를 포함하는 글꼴로 설정되므로 글자가 있어야 할 곳에 빈 상자가 나타나지 않습니다. 문서에서 실제로 사용하는 문자만 포함되므로 파일 크기가 줄어듭니다.
DocTranslator AI 엔진 FAQ
DocTranslator AI 엔진은 DocTranslator에서 제작했나요?
네. 엔진은 DocTranslator 팀에서 자체 개발했습니다. 페이지 분석, 스캔 처리, 레이아웃 재구성 및 품질 검사는 저희 자체 코드입니다.
스캔된 문서의 스탬프, 인감 및 서명을 유지하나요?
네. 엔진은 인식된 실행 텍스트의 잉크만 제거합니다. 스탬프, 인감, 서명, 사진, 차트 및 다이어그램은 스캔된 그대로 유지되므로, 번역 후에도 인증서에는 인감이, 계약서에는 서명이 표시됩니다.
표는 어떻게 처리되나요?
텍스트 레이어가 있는 PDF의 경우, 각 셀은 자체적으로 번역되어 동일한 셀에 다시 작성됩니다. 스캔의 경우, 엔진은 이미지에서 인쇄된 그리드를 찾아 선을 건드리지 않고 각 셀 안의 텍스트를 지우고 번역을 원래 셀에 씁니다.
번역된 파일이 원본과 정확히 동일하게 보이나요?
거의 동일하지만 항상 똑같지는 않습니다. 번역은 일반적으로 원본보다 길거나 짧기 때문에 텍스트가 다르게 줄 바꿈되거나 상자에 맞게 약간 작게 설정될 수 있습니다. 사진으로 찍은 표와 같이 밀도가 높은 페이지의 경우, 파일을 보내기 전에 결과를 잠시 살펴보세요.
DocTranslator에서 지원하는 언어는 무엇인가요?
DocTranslator는 108개 언어를 지원하며, 그중 어떤 두 언어 간에도 번역할 수 있습니다. 전체 언어 목록에서 모든 언어를 확인할 수 있습니다.
비자 또는 법원 제출 서류에 사용할 수 있나요?
이 엔진은 AI 번역을 생성합니다. 이민 사무소, 법원 및 대학에서는 일반적으로 정확하고 완전하다는 것을 확인하는 전문 번역가의 서명이 있는 인증 번역을 요청합니다. 이를 위해서는 당사의 인증 번역 서비스를 이용하십시오.
관련 도구
파일 형식
