PDF 翻译成博杰普尔语
Bhojpuri输出的Devanagari字体正确渲染了连字簇、元音符号和nukta点,词汇保留了Bhojpuri特色,而不是滑向印地语。文件大小高达1 GB。
上传或拖放文件进行翻译
最大文件大小 1 GB
使用Devanagari时,渲染在翻译开始前就失败了
Bhojpuri使用Devanagari书写,与印地语、马拉地语和尼泊尔语使用的脚本相同。Devanagari是一种元音附标文字:每个辅音字母都带有一个固有的元音,任何其他元音都写成附加在辅音上的标记。这些标记根据元音的不同,位于字母的上方、下方、右侧或左侧。短i符号比较棘手。在文件中,它存储在它所属的辅音之后,但绘制在该辅音的前面,因此逐个从PDF中提取字符并假定视觉顺序等于存储顺序的软件会产生乱码。
两个没有元音分隔的辅音组合成一个连字。क和ष变成क्ष,三个辅音的组合在正式词汇中很常见。缺少连字的字体不会优雅地回退:它会单独打印halant标记,或者显示一个圆圈,其中组合标记没有基础字符可以附加。七个字母带有一个nukta,一个写在辅音下方的点,这个点改变了发音。在字体替换过程中删除nukta会静默地改变单词。文本顶部的水平线,即shirorekha,将字母连接成一个视觉单词单元,任何将每个字形视为独立框的布局引擎都会在错误的地方断开这条线。
还有一个特定于印度办公文档的陷阱。许多旧的PDF文件使用遗留字体(如Kruti Dev、Chanakya或DevLys)排版,这些字体根本不是Unicode字体。它们存储拉丁字节值,并依赖字体本身为每个字节绘制Devanagari形状。在没有安装该确切字体的情况下打开此类文件,您将看到拉丁文乱码;复制文本出来,您也会得到乱码,因为文件中没有Devanagari,只有映射。任何此类内容都必须在翻译前转换为Unicode,在上传长文档之前检查源PDF是否属于此类情况是值得的。
向印地语的倾斜,以及如何识别何时发生
在2011年的人口普查中,印度约有五千万人将Bhojpuri作为他们的语言,主要分布在比哈尔邦西部和北方邦东部地区,在尼泊尔南部的Terai地区也有大量人口。它与印地语共享一种书写系统和大量词汇,由于印地语文本的训练数据压倒性地更多,翻译系统在不确定时会倾向于印地语。输出在页面上看起来很合理,并且对于该地区的任何人来说都读起来像印地语。
几个标记可以轻松识别差异。Bhojpuri使用 बा及其相关词表示“是”动词的现在时,而印地语使用 है。人称代词 हम 在Bhojpuri中是第一人称单数,意为“我”,而在印地语中,同一个词意为“我们”,这在任何涉及责任或所有权的文档中都可能导致误译。尊称第二人称 रउआ 在印地语中没有对应词,并且在印地语输出中根本不存在。如果在翻译文本页面中找不到这些形式中的任何一种,那么您看到的就是印地语。
Bhojpuri不在印度宪法第八附表所列语言之列,并且已要求将其列入数十年。对于文档来说,实际后果是,Bhojpuri地区的官方文件以印地语、英语或两者兼有发布,而不是以Bhojpuri发布。Bhojpuri出现在普通读者接触到的材料中:选举和公共卫生宣传、农业建议、广播和电影剧本、民间歌曲集和社区出版物,以及大量由侨民创作的作品。
Kaithi,仍然支撑着比哈尔邦土地记录的古老文字
在Devanagari成为标准之前,Bhojpuri、Magahi、Maithili和Awadhi的日常书写都使用Kaithi,这是一种没有连接顶线的草书,由文书和抄写员用于契约、账目、请愿书和通信。在十九世纪,它是孟加拉以西的印度北部最广泛使用的文字。它于1913年被取消官方地位,但Kaithi在地区法院和税务部门继续使用了几十年,并且是20世纪50年代初比哈尔邦地区法院的法定文字。
这段历史是一个现实问题,而不是一个古董问题。比哈尔邦1980年以前的大量土地记录是Kaithi文,而任何给定地区能够阅读它的人数现在非常少,这减缓了州土地调查和收入记录的数字化。如果您的文档是Kaithi土地记录,自动翻译不是合适的工具:该文字需要一位专家读者先将其音译成Devanagari。一旦存在Devanagari或Unicode转录本,翻译它就很容易了。
人们用这种语言对发送给我们的内容
需求分为两类。一类来自Bhojpuri语区本身,那里的英语或印地语材料需要触达更熟悉Bhojpuri语的读者。另一类来自19世纪契约移民的后裔社区,分布在毛里求斯、斐济、特立尼达、圭亚那、苏里南和南非,这些家庭追溯记录到比哈尔邦和北方邦东部。常见的工作包括:
- 关于非政府组织在比哈尔邦和普尔瓦纳尔农村地区分发的公共卫生、疫苗接种、卫生和营养材料
- 以英语写成的农业推广说明、作物保险传单和政府计划解释材料,需要翻译成本地语言
- 比哈尔邦学校考试委员会证书、居住证和种姓证书以及在印度境内或境外其他地方提交申请时所需的 पंचायत记录
- 毛里求斯、斐济和苏里南的研究人员用于重建契约时代的祖先的移民证、种植园登记册和家庭文件
- 来自巴特那和勒克瑙的博杰普尔电影业的电影对白、歌词和字幕文件
- 来自特莱地区(Bhojpuri 是家庭语言)的尼泊尔公民身份和土地文件
- 用于出版的宗教文学、民间歌曲集和口述历史笔录
用于阅读、起草和内部传阅,机器输出就足够了。提交给法院、领事馆或移民局的证书需要认证翻译,并附有签名的准确性声明。扫描的证书应通过扫描文档工作流程进行处理,以便页面被读取为图像而不是空白文本。
如何将 PDF 翻译成博杰普尔语
创建免费帐户
使用您的电子邮件注册以访问在线翻译仪表板。
先检查源文件
打开 PDF 并尝试选择一行天城文。如果您复制的内容显示为拉丁文乱码,则文件使用了旧的非 Unicode 字体,需要先进行转换才能翻译。
上传并选择博杰普尔语
将文件拖入,设置源语言,然后选择比印地语更偏门的博杰普尔语作为目标语言。Pro 和 Enterprise 套餐支持高达 1,000 MB 的文件。
翻译并下载
运行作业并下载完成的 PDF。连字组合、元音符号和 nukta 点以 Unicode 天城文书写,并保留页面布局。
博杰普尔语 PDF 翻译定价
在提交长文档之前,先翻译一个样本页面。
Free
注册无需信用卡
- 0.005 美元/词 AI 翻译
- 扫描件和图片 PDF 每页 $1
- 120+ 种语言
- 文件大小最高 20 MB,页数最高 20 页
- DOCX、PDF、XLSX、PPTX、IDML、TXT、JPG、PNG 和 CSV
- 仅 24 小时文件存储
- PDF 编辑器和 PDF 转 DOCX 转换器
- 随时取消
- 不包含:邮件支持
- 不包含:团队访问权限
- 不包含:无限免费 PDF 预览
- 不包含:术语表
Storage
或每年 $149
- 0.005 美元/词 AI 翻译
- 扫描件和图片 PDF 每页 $1
- 120+ 种语言
- 文件大小最高 100 MB,页数最高 100 页
- DOCX、PDF、XLSX、PPTX、IDML、TXT、JPG、PNG 和 CSV
- 无限文件存储
- PDF 编辑器和 PDF 转 DOCX 转换器
- 邮件支持
- 随时取消
- 不包含:团队访问权限
- 不包含:无限免费 PDF 预览
- 不包含:术语表
Pro
或每年 $499
- 每字 $0.004 AI 翻译
- 扫描件和图片 PDF 每页 $0.80
- 120+ 种语言
- 文件大小最高 1,000 MB,页数最高 5,000 页
- DOCX、PDF、XLSX、PPTX、IDML、TXT、JPG、PNG 和 CSV
- 无限文件存储
- PDF 编辑器和 PDF 转 DOCX 转换器
- 邮件支持
- 最多 5 名成员的团队访问权限
- 无限免费 PDF 预览
- 术语表
- 随时取消
企业
$149.99/月,按需提供。AI 翻译每字 $0.003(每页 $0.60),文件大小最高 1,000 MB,页数最高 5,000 页,无限文件存储,最多 15 名成员的团队访问权限。
博杰普尔语 PDF 翻译解答
我从 PDF 中复制了文本,得到了乱码的拉丁文。文件坏了吗?
文件没问题,只是不是 Unicode。许多印度办公室文档使用 Kruti Dev、Chanakya 或 DevLys 等旧字体排版,这些字体存储普通的拉丁字节值,并依赖字体为每个字节绘制一个梵文形状。没有该字体,文本看起来就像随机的罗马字母,复制出来也是如此。此类文件必须先转换为 Unicode 梵文,方法是从原始应用程序重新导出,或运行字体转换器,然后任何翻译工具才能读取它。
我如何知道输出是博杰普尔语而不是印地语?
在现在时句子中寻找动词 बा 而不是 है,并检查代词。在博杰普尔语中,हम 表示“我”,而相同的印地语词表示“我们”,尊称第二人称 रउआ 在印地语中没有对应词。一页翻译文本中如果没有这些形式,就说明它偏向印地语了。选择博杰普尔语作为目标语言而不是将其留空为印地语是首先要检查的事情。
连字和元音符号会正确显示吗?
是的。输出是 Unicode 梵文,应用了连字和重排规则,因此 क्ष 和 त्र 等组合会渲染成单个连接的形状,短 i 符号绘制在其辅音的左侧,并且 nukta 点保持附着在带有点的七个字母上。PDF 中的虚线圆圈是丢失了基础字符的组合标记的标志,这是渲染错误而不是翻译错误。
我的文件是比哈尔邦的一份旧的 Kaithi 脚本土地记录。你能处理吗?
不能自动处理,也没有诚实的工具会声称可以。Kaithi 是一种独立的草书脚本,在 20 世纪一直用于比哈尔邦和北方邦东部的税收和法律文件,阅读它是一项专业技能,掌握的人越来越少。通常的做法是让 Kaithi 阅读者将记录音译成梵文,然后就可以正常翻译抄本了。
我也可以从博杰普尔语翻译成英语吗?
是的,这对语言可以双向翻译。博杰普尔语到英语常用于口述历史记录、民间歌曲集、电影和字幕工作,以及毛里求斯、斐济、特立尼达、圭亚那和苏里南的印度劳工后裔持有的家庭文件。英语到博杰普尔语主要是外展材料:健康宣传活动、农业建议和政府计划的解释,面向比哈尔邦和普尔瓦纳尔地区的读者。
存在哪些官方博杰普尔语文件?
很少,因为博杰普尔语未列入印度宪法第八附表,也不是比哈尔邦或北方邦的行政语言。该地区的证书、土地记录和法院文件以印地语或英语发布。如果您被要求提供官方文件的博杰普尔语翻译,该请求通常是为了让内容能被家庭成员或社区受众理解,而不是为了在任何地方提交。
博杰普尔语文本在页面上占用的空间比英语多吗?
水平方向的差异不大,但垂直空间比人们预期的更重要。梵文将元音符号放在行的上方和下方,并将 shirorekha 放在顶部,因此一行博杰普尔语比相同字号的拉丁文本需要更多的行距。在行间距很紧的密集格式和表格中,这就是重叠出现的地方,布局过程会增加行高,而不是让标记发生碰撞。
它能读取印刷的博杰普尔语书籍的拍照页面吗?
支持图像 PDF 和 JPG、JPEG 和 PNG 上传,清晰的印刷梵文以合理的 D 密度可以很好地读取。有两件事会严重降低其质量:薄纸背面严重的透印,这会与 shirorekha 混合并混淆字母边界,以及手写。如果第一次尝试出现空白,请尽可能将页面弄平并以更高的 D 密度扫描。
相关工具
按语言翻译 PDF
