我們自己的文件翻譯技術

DocTranslator AI Engine

DocTranslator AI Engine 是我們自行開發的文件翻譯技術。大多數翻譯工具處理的是純文字,而我們的工具則處理整個頁面:它會找出每行文字的位置,進行翻譯,然後將翻譯結果寫回相同的位置,因此您下載的檔案將保留上傳檔案的版面配置。

由 DocTranslator 團隊設計和編寫。

運作方式

從上傳到完成檔案的四個階段

  1. 01

    讀取

    讀取檔案

    引擎會根據檔案內容而非檔名來判斷檔案類型:是含有實際文字圖層的 PDF、掃描檔、相片,還是 Office 文件。每種類型都會經過不同的處理路徑。

  2. 02

    獨立

    將文字從頁面分離

    只會擷取文字。圖像、圖表、照片、簽名和印章會保留在原地,絕不會被送去翻譯。

  3. 03

    翻譯

    翻譯與檢查

    每個段落都會經過翻譯與檢查,然後才會被接受。若有段落檢查失敗,會再次進行翻譯。

  4. 04

    重建

    重建頁面

    翻譯會回到原始位置,並使用包含目標語言字元的字體來呈現。

A · 數位 PDF

含有文字圖層的 PDF

對於從 Word、InDesign 或類似程式匯出的 PDF,引擎會逐塊讀取文字,並逐格處理表格。它會將段落中的行合併為一個段落後再進行翻譯,因此跨越多行的句子會被翻譯成一個句子,而不是三個片段。接著,它會移除頁面上的原始文字,保持圖像、圖表和向量繪圖不變,然後將翻譯寫入相同的方塊中。

翻譯後的長度很少與原文相同。德語和俄語通常比英語長,而中文和日文則需要較少的字元。引擎會讓文字在原始區塊內自動換行,並且只在翻譯內容仍無法放入時才縮小字體大小。表格儲存格會逐一處理,因此數字會保留在其各自的列和欄中。

三行換行變成一個段落,較長的翻譯會縮排在原始文字佔據的框內。

B · 掃描檔和相片

掃描檔與相片

01掃描頁面,保留為背景影像。
02僅選取文字的墨水。郵戳、線條和簽名會被排除在外。
03翻譯會寫回原地,在原始紙張上。

掃描的頁面是圖像,因此其中沒有可替換的文字。引擎會將原始圖像保留為頁面的背景,使用 OCR 辨識印刷文字,然後只移除那些字母的墨跡,並用周圍紙張的顏色填滿每個位置。任何非連續文字的內容都會被保留。印章、圖章、簽名、照片、圖表和示意圖都會保持掃描時的原貌,這正是您在證書或簽署的合約上所需要的。

表格保留其印刷網格。該引擎會在影像中尋找原始表格的線條,在不觸碰邊框的情況下清除每個儲存格內的文字,並將翻譯寫入同一個儲存格。沿著邊界橫向印刷的線條會被橫向寫回。

有時線條無法乾淨地擦除,例如當文字位於繁忙的背景上時。在這種情況下,引擎會保留原始印刷內容,而不是將其塗抹,並添加文字的隱藏副本,以便頁面仍可搜尋。

C · 結構化檔案

Word、Excel、PowerPoint、EPUB 和 HTML

Office 檔案已將文字與版面配置分開,因此引擎會從內部進行翻譯。它會替換每個段落、投影片和試算表儲存格中的文字,並將粗體、斜體和其他格式保留在原本所屬的文字上,即使翻譯後的文字順序有所不同。

EPUB 書籍和 HTML 頁面會逐一翻譯文字,其標記會保持不變,因此章節、標題和連結在翻譯後的副本中仍可正常運作。

ENThe report is ready today.
↓
DEDer Bericht ist heute fertig.

粗體字會移到德文句子的結尾,其格式也會隨之移動。

品質

檔案退回前的檢查

AI 翻譯可能會出現一些容易在快速閱讀時忽略的錯誤,因此引擎會在接受每個段落之前進行檢查:

  1. reject 會拒絕將原文重複的答案。
  2. reject 錯誤語言、循環翻譯、翻譯到一半或包含其他字元的亂碼答案也會被拒絕。
  3. retry 被拒絕的段落會再次翻譯,首先會與周圍的行一起進行,以提供上下文,然後單獨翻譯。
  4. compare 原文和翻譯後的數字、網址和電子郵件地址會進行比較,因此任何變更的數字都會被標記出來。
  5. reuse 出現在多個頁面上的句子只會翻譯一次,因此文件中的標題或術語在任何地方都會保持一致。
  6. discard 如果文件的大部分內容未被翻譯,該引擎會捨棄該結果,而不是交出半翻譯的文件。

由 DocTranslator 建置與運行

我們自己的程式碼,從讀取頁面到重建頁面。

該引擎由 DocTranslator 團隊開發。頁面分析、掃描和表格處理、每個頁面的重建以及上述檢查均為我們自行編寫的程式碼。由於我們自行編寫引擎,因此諸如表格移位或遺失字元等問題可以在引擎本身中得到修復。

翻譯成中文、日文、韓文、印度文、泰文及其他語言的文字會使用包含這些字元的字體來呈現,因此不會出現應有字母的地方卻是空白方塊。只有文件中實際使用的字元才會被嵌入,這有助於降低檔案大小。

DocTranslator AI 引擎常見問題

DocTranslator AI 引擎是由 DocTranslator 開發的嗎?

是的。該引擎由 DocTranslator 團隊內部開發。頁面分析、掃描處理、版面重構和品質檢查均為我們自行編寫的程式碼。

掃描文件上的圖章、印鑑和簽名會保留嗎?

是的。該引擎僅移除辨識出的運行文字的墨跡。圖章、印鑑、簽名、相片、圖表和示意圖會保持掃描時的原樣,因此證書在翻譯後仍會顯示其印鑑,合約也會顯示其簽名。

表格會如何處理?

在具有文字層的 PDF 中,每個儲存格都會獨立翻譯,並寫回相同的儲存格。在掃描檔中,引擎會在影像中尋找列印的網格線,在不觸及線條的情況下清除每個儲存格內的文字,並將翻譯寫入其原來的儲存格。

翻譯後的檔案看起來會和原始檔案一模一樣嗎?

很接近,但未必完全相同。翻譯後的文字通常比原文長或短,因此文字可能會換行方式不同,或以較小的字體顯示以符合框格。對於像拍攝的表格這類密集的頁面,在寄出檔案前請快速檢查一下結果。

DocTranslator 支援哪些語言?

DocTranslator 支援 108 種語言,您可以在其中任何兩種語言之間進行翻譯。完整的語言列表顯示所有支援的語言。

我可以用它來處理簽證或法院文件嗎?

本引擎產生 AI 翻譯。移民局、法院和大學通常會要求提供認證翻譯,由專業翻譯員簽署,確認其準確且完整。為此,請使用我們的認證翻譯服務。

翻譯文件並自行檢查版面配置

上傳 PDF、掃描檔或 Office 檔案,選擇 108 種語言中的兩種,並將結果與您的原始檔案進行比較。翻譯費用每份文件最低 $0.99。