Översätt PDF till bhojpuri
Bhojpuri-utdata i Devanagari med korrekt återgivna konjunktkluster, vokaltecken och nukta-prickar, och vokabulär som förblir bhojpuri istället för att glida över till hindi. Filer upp till 1 GB.
Ladda upp eller släpp dokument för översättning
Max filstorlek 1 GB
Med Devanagari misslyckas återgivningen innan översättningen ens börjar
Bhojpuri skrivs i Devanagari, samma skriftsystem som används för hindi, marathi och nepali. Devanagari är en abugida: varje konsonantbokstav bär en inneboende vokal, och alla andra vokaler skrivs som ett märke fäst vid konsonanten. Dessa märken sitter ovanför bokstaven, under den, till höger om den eller till vänster om den beroende på vilken vokal det är. Kort i-tecknet är det besvärliga. I filen lagras det efter den konsonant det tillhör, men det ritas framför den konsonanten, så programvara som hämtar tecken från en PDF ett i taget och antar att visuell ordning är lika med lagringsordning producerar ett förvrängt ord.
Två konsonanter utan vokal mellan dem kombineras till en enda ligatur. क och ष blir क्ष, och kluster av tre är vanliga i formellt vokabulär. Ett teckensnitt som saknar ligaturen faller inte tillbaka graciöst: det skriver ut halant-märket ensamt, eller visar en prickad cirkel där ett kombinerande märke inte hade någon bas-tecken att fästa vid. Sju bokstäver tar en nukta, en prick skriven under konsonanten, och pricken ändrar ljudet. Att tappa nukta under en teckensnitts-substitution ändrar tyst ord. Den horisontella linjen överst på texten, shirorekha, binder samman bokstäver till en visuell ord-enhet, och alla layoutmotorer som behandlar varje glyf som en oberoende ruta bryter den linjen på fel ställe.
Det finns en fälla till som är specifik för indiska kontorsdokument. Ett stort antal äldre PDF-filer har satts med äldre teckensnitt som Kruti Dev, Chanakya eller DevLys, som inte alls är Unicode-teckensnitt. De lagrar latinska byte-värden och förlitar sig på själva teckensnittet för att rita en Devanagari-form för varje byte. Öppna en sådan fil utan det exakta teckensnittet installerat och du ser latinska nonsens; kopiera ut texten och du får också nonsens, eftersom det inte finns någon Devanagari i filen, bara en mappning. Allt av den här typen måste konverteras till Unicode innan det kan översättas, och det är värt att kontrollera din käll-PDF för detta innan du laddar upp ett långt dokument.
Dragningen mot hindi, och hur man ser när det har hänt
Cirka femtio miljoner människor i Indien rapporterade bhojpuri som sitt språk i folkräkningen 2011, främst i västra Bihar och de östra distrikten i Uttar Pradesh, med en ytterligare stor befolkning i Terai-bältet i södra Nepal. Det delar skriftsystem och en stor del av vokabulären med hindi, och eftersom hinditext är överväldigande mer tillgängligt för träning, tenderar översättningssystem att driva mot hindi när de är osäkra. Utdata ser då trovärdig ut på sidan och läses som hindi för alla från regionen.
Några få markörer gör skillnaden lätt att upptäcka. Bhojpuri använder बा och dess släktingar där hindi använder है för presens av verbet att vara. Pronomenet हम är första person singular i bhojpuri, vilket betyder jag, medan samma ord i hindi betyder vi, vilket är en felöversättning som väntar på att hända i alla dokument där ansvar eller ägande spelar roll. Den artiga andra personen रउआ har ingen hindi-motsvarighet och saknas helt i hindi-utdata. Om ingen av dessa former förekommer någonstans på en sida med översatt text, är det du tittar på hindi.
Bhojpuri är inte ett av de språk som listas i den åttonde bilagan till den indiska konstitutionen, och inkludering har begärts i årtionden. Den praktiska konsekvensen för dokument är att officiella pappersarbeten i bhojpuri-bältet utfärdas på hindi, på engelska eller på båda, snarare än på bhojpuri. Bhojpuri förekommer i material som når vanliga läsare: val- och folkhälsomeddelanden, jordbruksråd, radio- och filmmanus, samlingar av folksånger och samhällspublikationer, tillsammans med en stor mängd skrifter producerade av diasporan.
Kaithi, det äldre skriftsystemet som fortfarande håller upp Bihars markregister
Innan Devanagari blev standard, gjordes det vardagliga skrivandet av bhojpuri, magahi, maithili och awadhi på kaithi, ett kursivt skriftsystem utan den sammanbindande rubriken, som användes av skrivbiträden och skrivare för handlingar, konton, petition och korrespondens. Under artonhundratalet var det det mest använda skriftsystemet i norra Indien väster om Bengalen. Dess officiella status drogs tillbaka 1913, men kaithi fortsatte att användas i distriktsdomstolar och skattekontor i årtionden därefter, och det var det lagliga skriftsystemet i Bihars distriktsdomstolar i början av 1950-talet.
Den historien är ett levande problem snarare än ett antikvariskt. En stor del av markregistren i Bihar före 1980 finns i kaithi, och antalet personer i ett givet distrikt som kan läsa det är nu mycket litet, vilket har saktat ner statens markundersökning och digitaliseringen av skatteregister. Om ditt dokument är ett kaithi-markregister, är automatisk översättning inte rätt verktyg: skriftsystemet kräver en specialistläsare som kan translitterera det till Devanagari först. När en Devanagari- eller Unicode-transkription finns, är översättningen enkel.
Vad folk skickar till oss i detta språkpar
Efterfrågan delas upp i två strömmar. En kommer från själva den bhojpuri-talande regionen, där material på engelska eller hindi måste nå läsare som är mer bekväma med bhojpuri. Den andra kommer från samhällen som härstammar från artonhundratalets kontraktsanställning, i Mauritius, Fiji, Trinidad, Guyana, Surinam och Sydafrika, där familjer spårar sina register tillbaka till Bihar och östra Uttar Pradesh. Vanliga jobb inkluderar:
- Material om folkhälsa, vaccination, sanitet och näring som icke-statliga organisationer distribuerar i landsbygden Bihar och Purvanchal
- Jordbruksinformation, information om grödförsäkringar och förklaringar av statliga program skrivna på engelska och behövda på det lokala språket
- Bihar School Examination Board-certifikat, bostads- och kastcertifikat samt panchayatregister som lämnats in med ansökningar någon annanstans i Indien eller utomlands
- Emigrationspass, plantageregister och familjedokument som används av forskare i Mauritius, Fiji och Surinam för att rekonstruera förfäder från tiden för livegenskap
- Filmmanus, sångtexter och undertextfiler från den Bhojpuri-baserade filmindustrin i Patna och Lucknow
- Nepalesiska medborgarskaps- och markdokument från Terai-distrikten där Bhojpuri är hushållsspråket
- Andaktslitteratur, samlingar av folkliga sånger och transkriptioner av muntlig historia förberedda för publicering
För läsning, utkast och intern cirkulation räcker maskinöversättning. Ett certifikat som ska till en domstol, ett konsulat eller en immigrationsmyndighet behöver en certifierad översättning med en signerad noggrannhetsförklaring bifogad. Skannade certifikat bör gå igenom arbetsflödet för skannade dokument så att sidan läses som en bild snarare än som tom text.
Hur man översätter en PDF till Bhojpuri
Skapa ett gratis konto
Registrera dig med din e-postadress för att komma åt online-översättningsinstrumentpanelen.
Kontrollera källfilen först
Öppna PDF-filen och försök markera en rad med Devanagari. Om det du kopierar kommer ut som latinsk nonsens, använder filen ett äldre icke-Unicode-typsnitt och behöver konverteras innan den kan översättas.
Ladda upp och välj Bhojpuri
Dra in filen, ställ in källspråket och välj Bhojpuri istället för Hindi som mål. Filer upp till 1 000 MB stöds på Pro- och Enterprise-planerna.
Översätt och ladda ner
Kör jobbet och ladda ner den färdiga PDF-filen. Sammansatta kluster, vokaltecken och nukta-prickar skrivs som Unicode Devanagari, och sidlayouten behålls.
Prissättning för översättning av Bhojpuri PDF
Översätt först en enskild provsida innan du åtar dig ett långt dokument.
Free
Inget kort behövs för att registrera dig
- 0,005 $/ord AI-översättning
- 1 USD per sida för skanningar och bild-PDF:er
- 120+ språk
- Filer upp till 20 MB och 20 sidor
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG och CSV
- Endast 24-timmars fillagring
- PDF-redigerare och PDF till DOCX-konverterare
- Avbryt när som helst
- Ej inkluderat: E-postsupport
- Ej inkluderat: Teamåtkomst
- Ej inkluderat: Obegränsade gratis PDF-förhandsgranskningar
- Ej inkluderat: Ordlista
Storage
eller 149 USD/år
- 0,005 $/ord AI-översättning
- 1 USD per sida för skanningar och bild-PDF:er
- 120+ språk
- Filer upp till 100 MB och 100 sidor
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG och CSV
- Obegränsad fillagring
- PDF-redigerare och PDF till DOCX-konverterare
- E-postsupport
- Avbryt när som helst
- Ej inkluderat: Teamåtkomst
- Ej inkluderat: Obegränsade gratis PDF-förhandsgranskningar
- Ej inkluderat: Ordlista
Pro
eller 499 USD/år
- 0,004 USD per ord för AI-översättning
- 0,80 USD per sida för skanningar och bild-PDF:er
- 120+ språk
- Filer upp till 1 000 MB och 5 000 sidor
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG och CSV
- Obegränsad fillagring
- PDF-redigerare och PDF till DOCX-konverterare
- E-postsupport
- Teamåtkomst för upp till 5 medlemmar
- Obegränsade gratis PDF-förhandsgranskningar
- Ordlista
- Avbryt när som helst
Företag
149,99 USD/månad, på begäran. AI-översättning för 0,003 USD/ord (0,60 USD per sida), filer upp till 1 000 MB och 5 000 sidor, obegränsad fillagring och teamåtkomst för upp till 15 medlemmar.
Bhojpuri PDF-översättning, besvarad
Jag kopierade text ur min PDF och fick latinskt nonsens. Är filen trasig?
Filen är okej, den är bara inte Unicode. Många indiska kontorsdokument sattes med äldre teckensnitt som Kruti Dev, Chanakya eller DevLys, som lagrar vanliga latinska byte-värden och förlitar sig på teckensnittet för att rita en devanagari-form för var och en. Utan det teckensnittet ser texten ut som slumpmässiga romerska bokstäver, och den kopieras ut på det sättet också. En sådan fil måste konverteras till Unicode Devanagari först, antingen genom att exportera den igen från den ursprungliga applikationen eller genom att köra en teckensnittskonverterare, innan något översättningsverktyg kan läsa den.
Hur vet jag att utdata verkligen är bhojpuri och inte hindi?
Leta efter verbet बा snarare än है i nutida satser, och kontrollera pronomenen. På bhojpuri betyder हम jag, medan samma ord på hindi betyder vi, och den respektfulla andra personen रउआ har ingen hindi-motsvarighet alls. En sida med översatt text utan någon av dessa former har glidit över till hindi. Att välja bhojpuri explicit som målspråk istället för att lämna fältet på hindi är det första att kontrollera.
Kommer konsonantkluster och vokaltecken att komma ut korrekt?
Ja. Utdata är Unicode Devanagari med ligatur- och omordningsreglerna tillämpade, så kombinationer som क्ष och त्र renderas som enskilda sammanslagna former, det korta i-tecknet ritas till vänster om sin konsonant, och nukta-prickar förblir fästa vid de sju bokstäver som tar dem. Prickade cirklar i en PDF är tecknet på en kombinerande markör som förlorat sin basbokstav, vilket är ett renderingfel snarare än ett översättningsfel.
Mitt dokument är ett gammalt Bihar-markregister i Kaithi-skrift. Kan ni hantera det?
Inte automatiskt, och inget ärligt verktyg kommer att påstå något annat. Kaithi är en separat kursiv skrift som användes för skatte- och juridiska pappersarbeten i Bihar och östra Uttar Pradesh fram till en bra bit in på 1900-talet, och att läsa den är en specialistkunskap som färre och färre har. Den vanliga vägen är att låta en Kaithi-läsare transkribera registret till Devanagari, varefter transkriptionen kan översättas normalt.
Kan jag översätta från bhojpuri till engelska också?
Ja, paret fungerar åt båda hållen. Bhojpuri till engelska är vanligt för transkriptioner av muntlig historia, samlingar av folksånger, film- och undertextarbete, och familjedokument som innehas av ättlingar till kontraktsanställda arbetare i Mauritius, Fiji, Trinidad, Guyana och Surinam. Engelska till bhojpuri är mestadels uppsökningsmaterial: hälsokampanjer, jordbruksråd och förklaringar av statliga program riktade till läsare i Bihar och Purvanchal.
Vilka officiella bhojpuri-dokument finns?
Mycket få, eftersom bhojpuri inte är listat i den åttonde bilagan till den indiska konstitutionen och inte är ett administrativt språk i varken Bihar eller Uttar Pradesh. Intyg, markregister och domstolspapper från regionen utfärdas på hindi eller engelska. Om du har blivit ombedd om en bhojpuri-översättning av ett officiellt dokument, handlar begäran vanligtvis om att göra innehållet begripligt för en familjemedlem eller en publik i samhället snarare än om att lämna in det någonstans.
Tar bhojpuri-text mer plats på sidan än engelska?
Horisontellt är skillnaden blygsam, men det vertikala utrymmet är viktigare än folk förväntar sig. Devanagari placerar vokaltecken ovanför och under linjen och shirorekha längs toppen, så en rad bhojpuri behöver mer radavstånd än en rad latinsk text i samma punktstorlek. I täta formulär och tabeller med snävt radavstånd är det där överlappningen uppstår, och layoutpasset öppnar upp radhöjden snarare än att låta tecken kollidera.
Kan den läsa en fotograferad sida från en tryckt bhojpuri-bok?
Bild-PDF:er och JPG-, JPEG- och PNG-uppladdningar stöds, och ren tryckt devanagari med en anständig upplösning läses bra. Två saker försämrar den skarpt: kraftigt genomslag från baksidan av tunt papper, som smälter samman med shirorekha och förvirrar bokstavsgränser, och handstil. Platta ut sidan så gott du kan och skanna med högre upplösning om det första försöket kommer tillbaka med luckor.
Få ditt dokument till Bhojpuri
Hälsblad, förklaringar av program, manus och familjedokument, översatta till korrekt Unicode Devanagari med ordförrådet behållet på Bhojpuri snarare än Hindi. Filer upp till 1 GB.
Relaterade verktyg
Översätt PDF efter språk
Dokumenttyper
