上传或拖放文件进行翻译
最大文件大小 1 GB

几乎所有的大小都集中在几个对象上
PDF 的文件大小分布从不是均匀分布在页面上的。文本非常小。一页散文的成本只有几 KB,因为它存储为字符和位置列表。使文件变重的东西几乎总是来自一小部分内容,了解您拥有哪一种决定了压缩能为您做什么。
- 以全相机分辨率放置的照片,然后缩小到页面大小。整个原始文件仍在文件中,即使只有一小部分细节在此尺寸下可见。
- 扫描的页面,其中每一张纸都是一个大图像。扫描件是迄今为止最重的 PDF 类型,其大小与扫描仪的设置分辨率成正比。
- 嵌入了整个字体,而不是子集。携带其家族所有字形的字体比携带文档实际使用的几百个字符的字体成本高得多。
- 增量保存的残留物。反复编辑和保存 PDF 可能会附加每次修订,而不是重写文件,因此您已删除页面的旧版本可能仍保留在其中。
- 每页只存储一次相同的徽标或信头图像,而不是每份文档存储一次。
上传前快速估算的方法:将文件大小除以页数。文本文档每页几十千字节。每页几兆字节的都是图像,这才是压缩的来源。
一个按钮背后的两种截然不同的操作
压缩工具将两种工作捆绑在一起。一种操作无损,另一种操作永久性,结果在不同文件之间差异如此之大,是因为不同的文档可用的这两种操作量不同。
无损:不丢弃任何内容
文件内的流被重新打包成更高效的编码器,嵌入的字体被削减到实际使用的字符,不再被引用的对象被删除,多次存储的相同图像被合并成一个,以及早期保存中被覆盖的修订被丢弃。
输出中的每个像素和每个字母都与输入相同。对于经过多次编辑的、文本量大的文档,这本身就可以节省大量空间。对于干净、新导出的文件,它可能几乎节省不了什么,因为没有多余的东西可以移除。
有损:为减小尺寸而牺牲细节
图像被降低到较低的分辨率,并以选定的质量设置重新编码。在此阶段丢弃的信息将永久丢失,再次压缩结果只会使文件变得更糟,而不是更有用地变小。
这是产生显著减小尺寸的地方,也是唯一可能损坏文档的阶段。主要由文本组成的文件几乎没有有损压缩的空间。扫描页面的文件几乎完全是图像,因此响应强烈,这正是扫描件需要最谨慎处理的原因。

重度压缩对您仍需阅读的扫描件造成的代价
字符识别通过匹配字母形状来工作,因此它依赖于清晰的边缘。有损图像压缩正是攻击这些边缘:它以块状工作,并在深浅之间的锐利过渡周围留下微弱的涟漪。在照片上这是看不见的。在一页小字印刷品上,每个字母都是深浅之间的锐利过渡,这使得单词被正确读取与被读取成其他东西的区别。
分辨率同样重要。大约 300 dpi 是正文可靠识别的常用最低推荐值,而小字印刷品、脚注和盖章细节需要更高的分辨率而不是更低。将 300 dpi 的扫描件降采样以适应尺寸限制是软件无法读取文档的最常见原因,尽管在屏幕上看起来仍然可以接受。
操作顺序解决了这个问题。先识别文本,在页面仍处于完整质量时进行识别,这样单词最终会以文本形式存储在文件中。之后再进行压缩。然后可以大力压缩图像,因为可搜索和可翻译的内容不再依赖于它们。DocTranslator 读取 扫描文档 和图像文件中的文本,因此上传好的副本而不是压缩后的副本会产生明显更好的结果。
当 PDF 文件无法大幅减小时
它已经被压缩过了
现代软件导出的文件通常已经高效地编码了图像,并且字体已经子集化。没有多余的空间可以利用,因此第二次处理会返回一个大小大致相同,或者看起来稍差但大小相同的文件。
它主要是文本
一份没有照片的长合同或手册本身就很小。如果一个文本文档出乎意料地大,原因通常是嵌入的字体或累积的保存历史,而不是页面内容,无损压缩是起作用的部分。
它是矢量图
工程图纸、地图和详细图表可以包含数十万条单独的线和形状。那是数据,不是像素,所以没有可以降采样的。减小它意味着简化绘图,这会改变它所显示的内容。
它已加密或签名
密码保护的文件必须先解锁才能重写其内容。数字签名文件可以被压缩,但重写会改变签名覆盖的字节,因此签名将不再有效。请在签名后再压缩,而不是在签名后压缩。

您要达到的目标决定了压缩的力度
没有人会为了压缩而压缩文件。总有一个数字在另一端:邮件服务器的附件上限、政府或法院门户网站的上传字段、拒绝任何高于设定大小的文件供应商系统、存储配额。在开始之前找到那个数字,因为它决定了无损压缩是否足够,还是必须牺牲图像质量。
当目标远低于单次压缩即可达到的程度时,停止降低质量,而是改变工作的形状。使用 Split PDF 将文档分成几部分并单独发送,可以使每页都可读,而强行将一个文件压缩到极限则不行。
上传文件大小很少是我们的限制因素。DocTranslator 在 Pro 和 Enterprise 套餐中接受高达 1,000 MB 或 5,000 页的文件,因此文档通常只需要压缩以适应其后续去向,而不是为了翻译。

从好的副本翻译,发送小的副本
如果文档既要被翻译又要发送到有大小限制的地方,请从原始文件进行翻译。源文件的质量是识别步骤必须处理的内容,而一个图像已经被裁剪过的文件会给它留下更少的内容来读取。
翻译后的输出往往比原始扫描件更轻,因为原始文件中的像素化单词在结果中变成了文本。扫描的页面保存了每个字母的图像,而翻译的页面保存了字母本身,这本身就改变了计算方式。
无论如何都要保留一份未修改的原始文件。压缩后的副本无法恢复到之前的质量,而当有人需要证书或签名页面的干净版本时,您就会发现自己是否保留了一份。

检查最小的文字
根据文件中最难的部分来判断压缩后的文件,而不是根据第一页。放大脚注、图章、手写签名或数字表格。如果这些仍然清晰可辨,则压缩是安全的;如果数字变得模糊,则在质量设置上退一步。以读者实际使用的缩放级别进行审查,而不是以适合屏幕的页面进行审查,这才能告诉您区别。
如何正确压缩 PDF
确定目标尺寸是多少
首先确定您需要清除的大小限制,无论是邮件附件大小限制还是门户网站上的上传字段。这决定了是需要安全无损的传输,还是可以牺牲一些图像质量。
在压缩任何内容之前,请先识别文本
如果页面是扫描件,请在图像仍处于完整质量时将文字提取出来。一旦文本被存储为文本,就可以大力压缩图像,而不会损失任何您需要的东西。
上传并让文件被重写
创建免费帐户并上传文档。未使用的对象、重复的图像和过大的字体集将首先被移除,这对于编辑过的文件来说通常就足够了。
检查最难处理的页面,然后保留原件
放大脚注、图章或数字列,以确认结果仍然清晰可辨,并存档未压缩的源文件。有损压缩中放弃的细节以后将无法恢复。
压缩 PDF:常见问题解答
为什么我的文件几乎没有变小?
因为可移除的内容很少。文本存储成本很低,因此不含图片的文档已接近其最小值,并且由现代软件导出的文件通常已高效编码其图像并已缩减其字体。大幅缩减来自图像数据,这意味着扫描件和照片。
压缩会损坏我的文档吗?
无损压缩不会,因为它只移除冗余内容并保持每个像素不变。有损压缩会永久降低图像分辨率和质量,其影响程度取决于图像内容。照片可以轻松容忍,但一页小字则不行。
在对扫描件运行 OCR 之前,我应该压缩它吗?
不,应该反过来操作。识别匹配字母形状,而有损压缩会模糊它所依赖的清晰边缘,同时降采样会移除小字所需的细节。先以全质量识别文本,然后再压缩,因为那时文字已作为文本存储,不再依赖图像。
扫描页面的分辨率应该是多少?
通常建议的最小值为每英寸 300 个点,以可靠地读取正文,而任何包含小字、脚注或印章细节的内容都受益于更高的分辨率。为了达到文件大小限制而低于此值是最常见的文件保持可读性(在屏幕上对人而言)但对软件而言不可读的方式。
我可以将同一个文件压缩两次以使其更小吗?
很少有帮助,而且经常有害。无损压缩已在第一次完成,因此第二次运行主要重新编码已丢失细节的图像,这会进一步降低其质量而没有有意义的缩减。如果一次未达到目标,请拆分文档而不是再次压缩。
为什么我的 PDF 只有几页却很大?
将大小除以页数。每页兆字节意味着图像数据:照片以相机全分辨率保存但显示很小,或扫描页面以高设置捕获。文本页面的大小在几十千字节,因此繁重的文本文档通常表明嵌入了完整的字体或重复保存留下的修订。
我需要先压缩才能上传翻译吗?
通常不会。Storage套餐支持高达100 MB和100页的文件,Pro和Enterprise套餐支持高达1,000 MB和5,000页的文件,因此大小很少是限制因素,而且当页面需要从图像读取时,更高质量的源文件会产生更好的结果。Free套餐限制为20 MB和20页,这时先缩小扫描文件可能会有帮助,尽管压缩不会改变页数。否则,请为文档后续的去向进行压缩,而不是为翻译本身。
已签名或受密码保护的 PDF 会怎样?
受保护的文件必须先解锁才能重写其内容。已签名的文件可以被压缩,但重写它会更改签名应用的字节,因此签名将失效。如果文档需要两者,请先压缩它,然后再签名较小的版本。
让您的 PDF 文件符合大小限制
清除大型文件中的冗余内容,保持小字清晰可辨,并将文件翻译成 120 多种语言,一旦文件大小合适。
