仕組み
アップロードから完了ファイルまでの4つのステップ
- 01
読み取り
ファイルを読み取る
エンジンはファイル名ではなく、その内容からファイルの種類を判別します。テキストレイヤーを持つPDF、スキャン、写真、Office文書など、それぞれ異なる処理パスを経ます。
- 02
分離
ページから単語を分離する
テキストのみが抽出されます。画像、図、グラフ、写真、署名、スタンプは元の位置にとどまり、翻訳のために送信されることはありません。
- 03
翻訳
翻訳とチェック
各文章は、受け入れられる前に翻訳され、チェックされます。チェックに失敗した文章は再度翻訳されます。
- 04
再構築
ページを再構築する
翻訳は元の位置に戻され、ターゲット言語の文字を含むフォントで設定されます。
A · デジタルPDF
テキストレイヤー付きPDF
Word、InDesign、または類似のプログラムからエクスポートされたPDFでは、エンジンはテキストをブロックごと、テーブルセルごとに読み取ります。翻訳前に段落の行を1つの文章に結合するため、3行にまたがる文章は3つの断片ではなく、1つの文章として翻訳されます。その後、元の単語をページから削除し、画像、図、ベクター描画はそのままにして、翻訳を同じボックスに書き込みます。
翻訳はソースと同じ長さになることはめったにありません。ドイツ語やロシア語は通常英語より長くなり、中国語や日本語は文字数が少なくなります。エンジンは、元のブロック内でテキストが折り返されるようにし、翻訳がまだ収まらない場合にのみフォントサイズを縮小します。テーブルセルは1つずつ処理されるため、数値は独自の行と列にとどまります。
B · スキャンと写真
スキャンと写真
スキャンされたページは画像であり、置き換えるテキストは含まれていません。エンジンは元の画像をページの背景として保持し、OCRで印刷されたテキストを認識し、その文字のインクのみを削除して、周囲の紙の色で各スポットを埋めます。実行中のテキスト以外のものはそのまま残されます。スタンプ、印鑑、署名、写真、グラフ、図はスキャンされたとおりにそのまま保持され、証明書や署名された契約書ではそれが望ましいです。
表は印刷されたグリッドを維持します。エンジンは画像内の元の表の罫線を見つけ、セルの境界線に触れることなく各セルのテキストをクリアし、同じセルに翻訳を書き込みます。余白に沿って横向きに印刷された線は、横向きに戻されます。
テキストが複雑な背景の上にある場合など、線がきれいに消去できない場合があります。その場合、エンジンは元の印刷物をぼかすのではなくそのままにして、ページが検索可能であるように、テキストの不可視コピーを追加します。
C · 構造化ファイル
Word、Excel、PowerPoint、EPUB、HTML
Officeファイルはすでにレイアウトからテキストを分離しているため、エンジンは内部から翻訳します。各段落、スライド、スプレッドシートセルの単語を置き換え、翻訳された単語が異なる順序になっても、太字、斜体、その他の書式設定を元の単語に保持します。
EPUB書籍とHTMLページはテキストごとに翻訳され、マークアップはそのまま保持されるため、章、見出し、リンクは翻訳されたコピーでも機能し続けます。
ENThe report is ready today.
↓
DEDer Bericht ist heute fertig.太字の単語はドイツ語の文末に移動し、その書式設定も一緒に移動します。
品質
ファイルが返される前のチェック
AI翻訳は、簡単な読み取りでは見逃しやすい方法で失敗する可能性があるため、エンジンは各文章を受け入れる前にチェックします。
reject元のテキストを翻訳する代わりに繰り返す回答は拒否されます。reject間違った言語での回答、ループする回答、途中で止まる回答、別のスクリプトからの余分な文字が含まれる回答も同様です。retry拒否された文章は、まず周囲の行と合わせてコンテキストとして翻訳され、次に単独で再度翻訳されます。compare元のテキストと翻訳されたテキストの間で数値、ウェブアドレス、メールアドレスが比較されるため、変更された数値はフラグが立てられます。reuse複数のページに表示される文章は一度だけ翻訳されるため、ドキュメント全体で見出しや用語は同じように表示されます。discardドキュメントの大部分が未翻訳のまま返された場合、エンジンは半翻訳されたファイルを渡すのではなく、その結果を破棄します。
DocTranslatorによって構築および実行
独自のコードで、ページの読み取りから再構築まで。
エンジンはDocTranslatorチームによって開発されています。ページ分析、スキャンや表の処理、各ページの再構築、上記のチェックはすべて自社コードです。エンジンを自社で作成しているため、表のずれや文字抜けなどの問題はエンジン自体で修正できます。
中国語、日本語、韓国語、ヒンディー語、タイ語などのスクリプトへの翻訳は、これらの文字を含むフォントで設定されるため、文字が表示されるべき場所に空のボックスが表示されることはありません。ドキュメントが実際に使用する文字のみが埋め込まれるため、ファイルサイズが小さくなります。
DocTranslator AI Engine FAQ
DocTranslator AI EngineはDocTranslatorによって構築されていますか?
はい。エンジンはDocTranslatorチームが社内で開発しています。ページ分析、スキャン処理、レイアウト再構築、品質チェックはすべて自社コードです。
スキャンされた文書のスタンプ、印鑑、署名はそのまま保持されますか?
はい。エンジンは認識されたテキストのインクのみを削除します。スタンプ、印鑑、署名、写真、図表はスキャンされたまま残るため、証明書は翻訳後も印鑑が、契約書は署名が表示されたままになります。
表はどうなりますか?
テキストレイヤーを持つPDFでは、各セルは個別に翻訳され、同じセルに書き戻されます。スキャンの場合、エンジンは画像内の印刷されたグリッドを見つけ、線の部分には触れずに各セルのテキストをクリアし、元のセルに翻訳を書き込みます。
翻訳されたファイルは元のファイルとまったく同じように見えますか?
近くなりますが、常に同一ではありません。翻訳は通常、ソースよりも長くなるか短くなるため、テキストの折り返しが異なったり、ボックスに収まるように少し小さく設定されたりすることがあります。写真のような密集したページの場合、ファイルを送信する前に結果を簡単に確認してください。
DocTranslatorはどの言語に対応していますか?
DocTranslatorは108言語をサポートしており、任意の2言語間で翻訳できます。全言語リストにすべて記載されています。
ビザや裁判所への提出書類に使用できますか?
エンジンはAI翻訳を生成します。移民局、裁判所、大学は通常、正確かつ完全であることを確認する専門翻訳家が署名した認証翻訳を要求します。その場合は、当社の認証翻訳サービスをご利用ください。
関連ツール
ファイル形式
