翻譯 PDF 成博傑普爾語
Bhojpuri 的梵文數字輸出,正確渲染連字、元音符號和 nukta 點,並且詞彙保留 Bhojpuri 而非滑向印地語。文件高達 1 GB。
上傳或拖放文件進行翻譯
最大檔案大小 1 GB
使用梵文數字時,渲染在翻譯開始前就失敗了
Bhojpuri 使用梵文數字書寫,這與印地語、馬拉地語和尼泊爾語使用的腳本相同。梵文數字是一種元音附標文字:每個輔音字母都帶有一個固有的元音,任何其他元音都寫成附加在輔音上的標記。這些標記根據不同的元音,位於字母的上方、下方、右側或左側。短 i 符號比較麻煩。在文件中,它存儲在它所屬的輔音之後,但它繪製在該輔音的前面,因此逐個提取 PDF 中字符並假設視覺順序等於存儲順序的軟件會產生亂碼單詞。
兩個沒有元音分隔的輔音合併成一個單獨的連字。 क 和 ष 變成 क्ष,而三個輔音的組合在正式詞彙中很常見。缺少連字的字體無法優雅地回退:它會單獨打印 halant 標記,或者在組合標記沒有基礎字符可附加的地方顯示一個圓點。七個字母帶有一個 nukta,一個寫在輔音下方的點,該點改變了發音。在字體替換過程中丟失 nukta 會靜默地更改單詞。文本頂部的水平線,shirorekha,將字母連接成一個視覺單詞單元,任何將每個字形視為獨立框的佈局引擎都會在錯誤的位置斷開該線。
還有一個陷阱專門針對印度辦公文件。許多舊 PDF 使用 Kruti Dev、Chanakya 或 DevLys 等舊字體排版,這些字體根本不是 Unicode 字體。它們存儲拉丁字節值,並依賴字體本身為每個字節繪製梵文數字形狀。在沒有安裝該確切字體的情況下打開此類文件,您會看到拉丁語亂碼;複製文本出來也會得到亂碼,因為文件中沒有梵文數字,只有映射。任何此類內容都必須在翻譯前轉換為 Unicode,並且在您上傳長文件之前,值得檢查源 PDF 是否存在此類問題。
轉向印地語的趨勢,以及如何判斷何時發生了這種情況
在 2011 年的人口普查中,印度約有五千萬人報告說 Bhojpuri 是他們的語言,主要分佈在比哈爾邦西部和北方邦東部地區,尼泊爾南部泰萊地帶也有大量人口。它與印地語共享相同的腳本和大量詞彙,由於用於訓練的印地語文本壓倒性地更多,因此翻譯系統在不確定時會傾向於印地語。輸出在頁面上看起來很合理,並且對於該地區的任何人來說都讀起來像印地語。
一些標記可以輕鬆識別差異。Bhojpuri 在現在時態中使用 बा 及其相關詞,而印地語使用 है 作為動詞“是”的現在時態。人稱代詞 हम 在 Bhojpuri 中是第一人稱單數,意為“我”,而在印地語中,同一個詞意為“我們”,這在任何涉及責任或所有權的文件中都可能導致誤譯。尊稱第二人稱 रउआ 在印地語中沒有對應詞,並且在印地語輸出中根本不存在。如果在任何頁面的翻譯文本中都沒有出現這些形式,那麼您看到的就是印地語。
Bhojpuri 不在印度憲法第八附表所列語言之列,並且已被列入數十年。對文件而言,實際後果是,Bhojpuri 地區的官方文件以印地語、英語或兩者兼有發布,而不是以 Bhojpuri 發布。Bhojpuri 出現在普通讀者接觸到的材料中:選舉和公共衛生信息、農業建議、廣播和電影劇本、民間歌曲集和社區出版物,以及僑民創作的大量文字。
Kaithi,仍然記錄著比哈爾邦土地記錄的舊腳本
在梵文數字成為標準之前,Bhojpuri、Magahi、Maithili 和 Awadhi 的日常書寫都是用 Kaithi 完成的,這是一種沒有連接標題的草書,由書記員和抄寫員用於契據、賬目、請願書和通信。在 19 世紀,它是印度東部孟加拉邦以西最廣泛使用的腳本。它的官方地位於 1913 年被撤銷,但 Kaithi 在縣法院和稅務辦公室使用了幾十年,並且在 1950 年代初期是比哈爾邦縣法院的法定腳本。
這段歷史是一個現實問題,而不是一個古董問題。比哈爾邦 1980 年之前的很大一部分土地記錄是用 Kaithi 寫成的,而任何給定地區能讀懂它的人數現在非常少,這減緩了州土地調查和稅務記錄的數字化。如果您的文件是 Kaithi 土地記錄,自動翻譯不是正確的工具:該腳本需要一個專業讀者,他可以先將其音譯成梵文數字。一旦存在梵文數字或 Unicode 轉錄本,翻譯它就很簡單。
人們在這個語言對中發送給我們什麼
需求分為兩類。一類來自 Bhojpuri 本身的使用地區,那裡的英語或印地語材料需要傳達給更習慣 Bhojpuri 的讀者。另一類來自 19 世紀契約移民的後裔社區,他們分佈在毛里求斯、斐濟、特立尼達、圭亞那、蘇里南和南非,那裡的家庭追溯記錄到比哈爾邦和北方邦東部。常見的任務包括:
- 關於非政府組織在比哈爾邦和普爾萬查爾農村地區分發的公共衛生、疫苗接種、衛生和營養材料
- 以英語撰寫的農業推廣筆記、農作物保險傳單和政府計劃說明,需要翻譯成當地語言
- 比哈爾邦學校考試委員會證書、居住證和種姓證書,以及在印度國內或國外申請時提交的潘查亞特記錄
- 移民證、種植園登記冊和家庭文件,供模里西斯、斐濟和蘇利南的研究人員用來重建契約時代的祖先
- 來自巴特那和勒克瑙的博傑普爾電影產業的電影對白、歌詞和字幕文件
- 來自博傑普爾語為家庭語言的特萊地區的尼泊爾公民身份和土地文件
- 用於出版的宗教文學、民間歌曲集和口述歷史記錄稿
用於閱讀、起草和內部傳閱,機器翻譯的輸出就足夠了。提交給法院、領事館或移民局的證書需要認證翻譯,並附有簽名的準確性聲明。掃描的證書應通過掃描文件工作流程處理,以便頁面被讀取為圖像而不是空白文本。
如何將 PDF 翻譯成博傑普爾語
建立免費帳戶
註冊並輸入您的電子郵件,即可存取線上翻譯儀表板。
首先檢查源文件
打開 PDF 並嘗試選擇一行梵文。如果您複製的內容顯示為拉丁字母亂碼,則該文件使用了舊的非 Unicode 字體,需要先轉換才能翻譯。
上傳並選擇博傑普爾語
拖曳檔案進來,設定來源語言,並選擇爪哇語而非印尼語。Pro 和 Enterprise 方案支援高達 1,000 MB 的檔案。
翻譯並下載
運行作業並下載完成的 PDF。連字、元音符號和 nukta 點以 Unicode 梵文書寫,頁面佈局保持不變。
博傑普爾語 PDF 翻譯定價
在提交長文件之前,先翻譯單頁範例。
Free
註冊無需信用卡
- $0.005/字 AI 翻譯
- 掃描檔和圖片 PDF 每頁 $1
- 120+ 種語言
- 檔案上限 20 MB 和 20 頁
- DOCX、PDF、XLSX、PPTX、IDML、TXT、JPG、PNG 和 CSV
- 僅 24 小時檔案儲存
- PDF 編輯器和 PDF 轉 DOCX 轉換器
- 隨時取消
- 不包含:電子郵件支援
- 不包含:團隊存取權
- 不包含:無限免費 PDF 預覽
- 不包含:詞彙表
Storage
或每年 $149
- $0.005/字 AI 翻譯
- 掃描檔和圖片 PDF 每頁 $1
- 120+ 種語言
- 檔案上限 100 MB 和 100 頁
- DOCX、PDF、XLSX、PPTX、IDML、TXT、JPG、PNG 和 CSV
- 無限檔案儲存
- PDF 編輯器和 PDF 轉 DOCX 轉換器
- 電子郵件支援
- 隨時取消
- 不包含:團隊存取權
- 不包含:無限免費 PDF 預覽
- 不包含:詞彙表
Pro
或每年 $499
- 每字 $0.004 的 AI 翻譯
- 掃描檔和圖片 PDF 每頁 $0.80
- 120+ 種語言
- 檔案上限 1,000 MB 和 5,000 頁
- DOCX、PDF、XLSX、PPTX、IDML、TXT、JPG、PNG 和 CSV
- 無限檔案儲存
- PDF 編輯器和 PDF 轉 DOCX 轉換器
- 電子郵件支援
- 團隊存取權,最多 5 位成員
- 無限免費 PDF 預覽
- 詞彙表
- 隨時取消
企業方案
$149.99/月,依要求提供。AI 翻譯每字 $0.003(每頁 $0.60),檔案上限 1,000 MB 和 5,000 頁,無限檔案儲存空間和最多 15 位成員的團隊存取權。
博傑普爾語 PDF 翻譯,解答
我從 PDF 複製了文字,得到亂碼。檔案壞了嗎?
檔案沒壞,只是不是 Unicode。許多印度辦公室文件使用 Kruti Dev、Chanakya 或 DevLys 等舊字體排版,這些字體儲存普通的拉丁字節值,並依賴字體為每個字元繪製天城文形狀。沒有該字體,文字看起來就像隨機的羅馬字母,複製出來也是如此。這類檔案必須先轉換為 Unicode 天城文,方法是從原始應用程式重新匯出,或運行字體轉換器,然後任何翻譯工具才能讀取它。
我如何知道輸出的確是博傑普爾語而不是印地語?
尋找動詞 बा 而不是 है 來表示現在時態的句子,並檢查代名詞。在博傑普爾語中,हम 意為「我」,而相同的印地語詞意為「我們」,尊稱的第二人稱 रउआ 在印地語中沒有對應詞。一段翻譯文本如果沒有這些形式,就表示偏向印地語了。選擇博傑普爾語作為目標語言,而不是將該欄位保留為印地語,是首先要檢查的事項。
連字和母音符號會正確顯示嗎?
是的。輸出是 Unicode 天城文,並應用了連字和重排規則,因此像 क्ष 和 त्र 這樣的組合會顯示為單一連接的形狀,短 i 符號畫在輔音的左側,而 nukta 點則附著在七個帶有它的字母上。PDF 中的圓點圓圈是組合標記失去其基本字元的標誌,這是渲染錯誤而不是翻譯錯誤。
我的文件是一本舊的比哈爾邦土地記錄,使用 Kaithi 腳本。你們能處理嗎?
無法自動處理,任何誠實的工具都不會聲稱可以。Kaithi 是一種獨立的草書腳本,在二十世紀初之前一直用於比哈爾邦和北方邦東部的稅務和法律文件,閱讀它是一項專業技能,越來越少人掌握。通常的方法是讓 Kaithi 閱讀者將記錄音譯成天城文,然後就可以正常翻譯該抄本了。
我也可以從博傑普爾語翻譯成英語嗎?
是的,這對語言組合可以雙向翻譯。博傑普爾語翻成英語常見於口述歷史記錄、民間歌曲集、電影和字幕工作,以及毛里求斯、斐濟、千里達、蓋亞那和蘇利南的印度勞工後裔所持有的家庭文件。英語翻成博傑普爾語主要是外展材料:針對比哈爾邦和普爾瓦蘭地區讀者的健康宣傳、農業建議和政府計劃解釋。
存在哪些官方博傑普爾語文件?
很少,因為博傑普爾語未列入印度憲法第八附表,也不是比哈爾邦或北方邦的行政語言。該地區的證書、土地記錄和法院文件均以印地語或英語發佈。如果您被要求提供官方文件的博傑普爾語翻譯,通常是為了讓家庭成員或社群讀者能夠理解內容,而不是為了在任何地方提交。
博傑普爾語文字佔用的頁面空間比英語多嗎?
水平方向差異不大,但垂直空間比人們預期的更重要。天城文將母音符號放在線上方的上方和下方,並將 shirorekha 放在頂部,因此一行博傑普爾語比相同字號的拉丁文字需要更多的行距。在行距緊湊的密集格式和表格中,就會出現重疊,版面配置會增加行高,而不是讓標記重疊。
它能讀取印刷博傑普爾語書籍的照片頁面嗎?
支援圖像 PDF 和 JPG、JPEG 和 PNG 上傳,清晰的印刷天城文以適當的解析度讀取效果良好。有兩件事會嚴重影響其品質:薄紙背面嚴重的透印,這會與 shirorekha 混合並混淆字母邊界,以及手寫。如果第一次嘗試出現空白,請盡可能將頁面弄平並以更高的解析度掃描。
相關工具
翻譯 PDF 語言
