我们自己的文档翻译技术

DocTranslator AI 引擎

DocTranslator AI Engine 是我们自己开发的文档翻译技术。大多数翻译工具处理的是纯文本,而这款工具则处理页面:它能找到每行文本的位置,进行翻译,然后将翻译后的文本写回同一位置,因此您下载的文件将保留上传文件的布局。

由 DocTranslator 团队设计和编写。

工作原理

从上传到完成文件的四个阶段

  1. 01

    读取

    读取文件

    引擎根据文件内容而非文件名来识别文件类型:是带有真实文本图层的PDF、扫描件、照片还是Office文档。每种类型都有不同的处理路径。

  2. 02

    分离

    将文字从页面中分离

    只提取文本。图像、图表、照片、签名和印章会保留在原位,绝不会被发送进行翻译。

  3. 03

    翻译

    翻译与检查

    每个段落都会被翻译并检查,然后才被接受。如果段落检查失败,则会重新翻译。

  4. 04

    重建

    重建页面

    翻译会回到原来的位置,并使用包含目标语言字符的字体进行排版。

A · 数字 PDF

带文本图层的PDF

对于从Word、InDesign或类似程序导出的PDF,引擎会逐个文本块和表格单元格地读取文本。它会在翻译前将段落中的行合并为一个段落,因此跨三行换行的句子会被翻译成一个句子,而不是三个片段。然后,它会从页面上移除原始文字,保持图像、图表和矢量图不变,并将翻译写入同一个框内。

翻译后的文本长度很少与原文相同。德语和俄语通常比英语长,而中文和日文则需要更少的字符。引擎允许文本在其原始块内换行,并且仅在翻译仍不适合时才减小字体大小。表格单元格是逐个处理的,因此数字会保留在其各自的行和列中。

三行合并为一段,较长的翻译会包裹在原始文本所占的框内。

B · 扫描件和照片

扫描件和照片

01扫描的页面,保留为背景图像。
02仅选择文字的墨迹。印章、线条和签名被排除在外。
03翻译被写回原处,在原始纸张上。

扫描的页面是一张图片,因此其中没有可替换的文本。引擎将原始图像保留为页面背景,使用OCR识别打印的文本,然后仅移除那些字母的墨迹,用周围纸张的颜色填充每个空白处。任何非连续文本的内容都会被保留。印章、图章、签名、照片、图表和示意图将保持扫描时的原样,这正是您在证书或签合同上所需要的。

表格保留其打印的网格。该引擎会在图像中找到原始表格的规则线,在不接触边框的情况下清除每个单元格内的文本,并将译文写入同一个单元格。沿着页边距横向打印的线条会横向写回。

有时,线条无法被干净地擦除,例如当文本位于繁忙的背景上时。在这种情况下,引擎会保留原始打印内容而不是将其涂抹,并添加文本的不可见副本,以便页面仍然可以被搜索。

C · 结构化文件

Word、Excel、PowerPoint、EPUB和HTML

Office文件已将文本与其布局分开,因此引擎可以从内部进行翻译。它会替换每个段落、幻灯片和电子表格单元格中的文字,并保留粗体、斜体和其他格式,即使翻译后的文字顺序发生变化。

EPUB书籍和HTML页面是逐个文本进行翻译的,它们的标记保持不变,因此章节、标题和链接在翻译后的副本中仍然有效。

ENThe report is ready today.
↓
DEDer Bericht ist heute fertig.

粗体单词移到德语句子的末尾,其格式也随之移动。

质量

文件返回前的检查

AI翻译可能会出现容易被忽略的错误,因此引擎在接受每个段落之前都会对其进行检查:

  1. reject 会拒绝将原文重复而不是翻译的答案。
  2. reject 也会拒绝语言错误、循环翻译、翻译到一半或包含其他脚本的杂乱字符的答案。
  3. retry 被拒绝的段落会再次翻译,首先会结合周围的行以获取上下文,然后单独翻译。
  4. compare 数字、网址和电子邮件地址会在原文和译文中进行比较,因此任何更改的数字都会被标记出来。
  5. reuse 出现在多个页面上的句子只翻译一次,因此文档中的标题或术语在任何地方都保持一致。
  6. discard 如果文档的大部分内容未被翻译,该引擎会丢弃该结果,而不是交出半翻译的文件。

由DocTranslator构建和运行

我们自己的代码,从读取页面到重建页面。

该引擎由 DocTranslator 团队开发。页面分析、扫描和表格处理、每页的重建以及上述检查都是我们自己的代码。因为我们自己编写引擎,所以像表格移位或字符丢失这样的问题可以在引擎本身中得到修复。

翻译成中文、日文、韩文、印地文、泰文和其他脚本的文本会使用包含这些字符的字体进行设置,因此您不会看到应有字母的地方出现空白框。只有文档实际使用的字符才会被嵌入,这可以减小文件大小。

DocTranslator AI引擎常见问题解答

DocTranslator AI引擎是DocTranslator开发的吗?

是的。该引擎由 DocTranslator 团队内部开发。页面分析、扫描处理、布局重建和质量检查都是我们自己的代码。

它会保留扫描文档上的印章、图章和签名吗?

是的。该引擎仅移除识别出的运行文本的墨迹。印章、图章、签名、照片、图表和示意图将保持扫描时的原样,因此证书翻译后仍会显示其图章,合同也会显示其签名。

表格会怎样处理?

在具有文本层的PDF中,每个单元格都会单独翻译,并写回同一单元格。在扫描件中,引擎会找到图像中的打印网格,清除每个单元格内的文本而不触碰线条,并将翻译写回其原始单元格。

翻译后的文件看起来会和原件一模一样吗?

很接近,但不总是完全相同。翻译通常比原文长或短,因此文本可能会换行不同,或者设置得稍小以适应其框。对于密集页面,例如照片中的表格,在发送文件之前请快速查看结果。

DocTranslator 支持哪些语言?

DocTranslator支持108种语言,您可以在任意两种语言之间进行翻译。完整语言列表显示了所有支持的语言。

我可以用它来办理签证或法院文件吗?

该引擎生成AI翻译。移民局、法院和大学通常会要求提供认证翻译,由专业翻译人员签署,确认其准确性和完整性。为此,请使用我们的认证翻译服务。

翻译文档并自行检查布局

上传PDF、扫描件或Office文件,选择108种语言中的两种,并将结果与您的原件进行比较。翻译起价为每份文档0.99美元。