PDFをサンスクリット語に翻訳
PDFをインドの古典言語であるサンスクリット語に翻訳します。デーヴァナーガリー文字で、積み重ねられた合字とともに、ページレイアウトはそのまま維持されます。ファイルサイズは最大1GBです。
翻訳するドキュメントをアップロードまたはドロップしてください
最大ファイルサイズ 1 GB
独自の文字を持たなかった言語
サンスクリット語は2000年以上前から書き留められており、その間、その地域で使われていた文字で記録されてきました。タミル地方ではグランタ文字、カシミールではシャラダ文字、ベンガル文字、オリヤー文字、テルグ文字、カンナダ文字、マラヤーラム文字、カトマンズ盆地ではネワール文字、ヒマラヤを越えてチベット文字で写本が残っています。デーヴァナーガリー文字が標準となったのは近代になってからで、主に印刷機が標準化したためであり、現在ほとんどの版で使用されている文字です。そのため、サンスクリット語のテキストは現代の国民言語のように一つの文字に縛られることはなく、写本を扱う学者はおそらく同じ文章を複数の文字で必要とするでしょう。
サンスクリット語の自動翻訳は、現代語の翻訳よりも実際に難しく、そのことを率直に述べる価値があります。学習に使用できる並列テキストは、ヒンディー語やスペイン語のそれのほんの一部であり、残っているコーパスのほとんどは日常的な散文ではなく、詩、哲学、専門的な論文であり、言語自体の習慣が分割に反しています。サンスクリット語の文章の機械翻訳は研究の補助であり、完成した翻訳ではありません。引用、出版、朗読されるものはすべて、その言語を読む人が確認する必要があります。
もう一方の方向はより簡単で、実際にはより一般的です。英語のテキストをサンスクリット語にレンダリングすることが、ほとんどのリクエストの実際の内容です。モットー、碑文、タイトルページ、詩の見出し、儀式の言葉などです。それらの場合、問題となるのは解釈の問題ではなく、タイポグラフィと正書法に関するものであり、このページで扱っているのはそれらです。
自動処理を妨げる4つの特徴
- 子音のスタックが3つまたは4つ深くなります。デーヴァナーガリー文字は隣接する子音を1つの合字に融合させ、サンスクリット語は現代のインドの言語にはないクラスターを生成します。縦に3つ、時には4つ積み重ねられた子音が、1つの連動した形状として描かれます。ヒンディー語用に構築されたフォントは一般的なペアを運び、残りは見える線で区切られた形式にフォールバックします。それは判読可能ですが、正しいタイポグラフィではなく、印刷版では言語を読む人には間違って見えます。
- 単語の境界が融合します。サンスクリット語は、単語が次に来る単語と接する場所で音の変化を適用し、古典的な書記伝統では、結果の連なりはスペースなしで印刷されることがよくあります。したがって、単語の区切りを決定することは、空白文字で分割する問題ではなく、実際の分析問題であり、言語のテキスト認識と機械翻訳の両方にとって最大の障害です。
- 英語の節ほどの長さの複合語。サンスクリット語は、語幹を連鎖させることによって複合名詞を構築し、1つの複合語は数十音節に達し、英語でレンダリングするには完全な従属節が必要になる場合があります。ページ上では、これは行分割アルゴリズムが安全に分割できない、分割不可能なトークンであり、間違った場所で分割すると、どの語幹が互いに関連しているかが変わってしまいます。
- メインブロックの外側にあるアクセント記号。ヴェーダの朗読記号は、通常のデーヴァナーガリー文字から離れたUnicodeの別の部分に配置され、ほとんどのフォントはそれらをカバーしていません。それらは変換中に定期的に失われ、朗読者が必要とする情報が、完全に見えるテキストから静かに削除されます。
サンスクリット語翻訳の料金
まず短い文章で試してみて、デーヴァナーガリー文字がどのように設定されるかを確認してから、先に進んでください。
7日間トライアル
最も人気トライアル終了後、月額$14.99
- 7日間の全機能アクセス試用
- トライアル制限:10ページまたは3,000語
- $0.005/単語 AI翻訳
- 120以上の言語
- PDF, DOCX, XLSX, PPTX, IDML, TXT, JPG, PNG, CSV, JSON
- チームアクセス&カスタム用語集
- メールサポート
月額
POPULAR通常価格$29.99、今なら50%オフ
- 月100ページまたは30,000語
- $0.005/単語 AI翻訳
- 120以上の言語
- 無制限のファイルストレージ
- PDF, DOCX, XLSX, PPTX, IDML, TXT, JPG, PNG, CSV, JSON
- チームアクセス&カスタム用語集
- プライオリティメールサポート
年額
25%オフ月額約$11.25、月額プランより25%お得
- 月100ページまたは30,000語
- $0.005/単語 AI翻訳
- 120以上の言語
- 無制限のファイルストレージ
- PDF, DOCX, XLSX, PPTX, IDML, TXT, JPG, PNG, CSV, JSON
- チームアクセス&カスタム用語集
- プライオリティメールサポート
サンスクリット語翻訳の実行
アカウントを作成する
サインアップしてメールアドレスを登録すると、ダッシュボードにアクセスできます。
ドキュメントをアップロード
PDFをドロップするか、参照してアップロードしてください。最大1GBのファイルは有料プランで処理され、完全な版またはスキャンされた写本カタログが含まれます。
ターゲットをサンスクリット語に設定する
まずファイルのソース言語を選択します。ソースが英語ではなく、ローマ字化されたサンスクリット語の転写である場合は、別のジョブであり、その旨を伝える必要があります。
合字を拡大表示する
完成したPDFを高倍率で開きます。正しく積み重ねられた合字は、形状が正しく処理されたことを意味します。線で区切られた文字や空のボックスは、フォントが対応できなかったことを意味します。
ラテン文字で作業している場合は、スキームを選択し、どちらを使用するかを指定してください
サンスクリット語はラテン文字で多く流通しており、その方法は一つではありません。スキームは相互に交換可能ではなく、それらのうち2つを混在させるファイルは、見つけにくく修正が面倒な方法で破損しています。ドキュメントが使用しているスキームを、何かを翻訳する前に決定し、その選択をファイル内のどこかに記録してください。
ダイアクリティカルマークのスキーム
学術出版で使用される標準は、長母音をバーで、そり舌子音を下に点を付けてマークします。それは曖昧さがなく読みやすいですが、完全なラテン文字拡張追加のカバー範囲を持つフォントが必要です。その密接な関係である、インド文字の転写のための国際標準は、数文字で異なりますが、それらが同じであると仮定すると問題を引き起こすのに十分です。
プレーンASCIIスキーム
いくつかの規則は、大文字を使用したり、文字を二重にしたり、句読点を追加したりするなど、通常のキーボード文字のみを使用して同じ区別をエンコードします。それらは、電子メール、ファイル名、古いシステムでそのまま機能するため存在します。また、相互に互換性がなく、同じ文字列が異なるスキームの下で異なる意味を持ちます。
一般的なスペル
ヨガや宗教出版では、通常、マークを完全に省略し、英語話者が発音するであろう言葉を近似的に書き留めます。一般的な読者には問題ありませんが、逆参照が必要なものには役に立ちません。なぜなら、いくつかの異なる音を区別する情報が失われているからです。
人々が実際に翻訳しているもの
サンスクリット語は行政言語ではありません。サンスクリット語の出生証明書を持つ人はいません。届くリクエストは、狭くかなり予測可能なセットに分類され、自分がどのセットにいるかを知ることで、ジョブに必要な人間のレビューの量がわかります。
- 儀式および典礼資料:朗読用の小冊子、儀式の順序、賛美歌集、寺院の出版物。これらは、声に出して読まれるため、タイポグラフィ的に正確である必要があります。
- ヨガや瞑想の指導者養成マニュアル。古典的な詩が、ローマ字化された転写と、同じページに英語の注釈とともに掲載されています。
- アーユルヴェーダや伝統医学のテキスト、処方集、注釈文献
- 哲学・文学作品とその現代的な学術研究(複数のスクリプトによる注釈付き版を含む)
- デジタル化プロジェクトからの写本目録およびアーカイブ記述
- それを教える機関の学校や大学のコース教材、シラバス、試験問題
- 碑文、碑文転写、博物館のラベル
- 機関のモットー、儀式用テキスト、招待状、タイトルページ(短い一節を正確にする必要がある場合)
これらは移民書類のような認証ケースではありませんが、いくつか間違えるとより深刻なものになります。誤訳された儀式の順序や、印刷版での連結語の破損は公に目に触れ、永続するため、権威が要求していなくても、ここでの校正ステップは重要です。
サンスクリット語翻訳に関する質問
古典サンスクリット語の機械翻訳の精度はどのくらいですか?
現代語よりも精度が低く、それを事前に知っておくのが最善です。学習するための並列テキストがはるかに少なく、現存するコーパスは普通の散文よりも詩や技術的な論文がほとんどであり、言語は境界で単語を結合するため、どこで単語が終わるかを見つけることさえ問題になります。出力を、言語を知っている人のための作業をスピードアップする読書補助として扱い、完成した翻訳として扱わないでください。
出力はどのスクリプトを使用しますか?
デーヴァナーガリー、これは事実上すべての現代サンスクリット語の出版物で使用されています。歴史的には、言語は、その地域で使用されていたどんなスクリプトでも書かれていました。グランタやシャラダからベンガル語、テルグ語、マラヤーラム語、チベット語まで、そしてそれらのすべてに写本が現存しています。プロジェクトでそれらのいずれかが必要な場合は、それは一般的な翻訳ツールがカバーするものではなく、専門的な組版作業です。
なぜ一部の連結文字は、積み重ねられるのではなく、分離されているように見えるのですか?
使用中のフォントにその特定の合字が含まれていないためです。サンスクリット語は、現代のインド諸語が決して生成しない3つ、時には4つの深さの 子音スタックを生成します。ヒンディー語用に構築されたフォントは一般的な組み合わせをカバーし、残りは小さなストロークで結合された別々の文字として書き出すことにフォールバックします。読めますが、印刷版では不自然に見えるため、高倍率で密集した箇所を確認してください。
ヴェーダのアクセント記号は維持されますか?
しばしばそうではありません。これは具体的に確認する価値があります。朗唱記号は、通常のデーヴァナーガリーとは別のUnicode領域にエンコードされており、ほとんどのフォントにはそれらのグリフがないため、変換でそれらをドロップしても、テキストの残りは完璧に見えます。朗唱されることを意図した資料については、記号が通過したと仮定せずに、出力とソースを1行ずつ比較してください。
デーヴァナーガリーではなく、ローマ字転写でサンスクリット語を得ることはできますか?
いくつかのローマ字表記法が存在し、それらは相互に置き換えることはできません。学術的な標準では長母音の上にバーを、そり舌子音の下に点を打ちますが、国際的な転写標準ではいくつかの文字でこれと異なります。また、大文字や二重文字で同じ区別をエンコードするプレーンキーボード方式もあります。プロジェクトでどれを使用するかを決定し、明記してください。なぜなら、2つの方式が混在した文書は修正が面倒な形で破損しているからです。
スキャンされたヤシの葉や古い印刷された写本を読むことはできますか?
過去1世紀の印刷物は、きれいにスキャンされていれば、現実的なケースです。写本はそうではありません。文字は単語の区切りなく続き、文字の形は地域や書記によって異なり、物理的な媒体はしばしば損傷しています。写本作業には専門的なツールと学者が必要です。印刷物を高解像度でアップロードし、結果を修正することを期待してください。
短いサンスクリット語のモットーまたは碑文が必要です。これは適していますか?
それは妥当な出発点であり、悪い終着点です。短い儀式的なテキストは人々が注目するもので、しばしば永久に刻印、印刷、または刺繍され、格語尾や複合語形成の小さなエラーは、言語を読む人なら誰にでも見えるものです。下書きを生成し、石や印刷物にコミットする前に、サンスクリット語の学者に確認してもらってください。
制限と費用は?
月額プランと年間プランでは、最大1 GBまたは5,000ページまでのファイルに対応しています。月額プランは月額14.99ドルで100ページまたは30,000語、年間プランは年間135ドル(月額約11.25ドル)で、AI翻訳は1語あたり0.005ドルです。2ドルの7日間トライアルは10ページまたは3,000語に対応しており、文書内のデーヴァナーガリー書体の確認に最適な方法です。
関連ツール
言語別PDF翻訳
