AI-drevet · 120+ sprog

CSV Oversætter

Produktkataloger, eksport og datasæt oversat kolonne for kolonne, med skilletegnene, anførselstegnene og identifikationskolonnerne efterladt præcis som din parser forventer at finde dem.

Maks. filstørrelse 1 GB Bevarer original formatering
Tilmeld dig gratis

Upload eller træk dokumentet hertil for oversættelse

Maks. filstørrelse 1 GB

.PDF .DOCX .PPTX .XLSX .TXT .JPG .PNG .IDML .EPUB .HTML
Afrikaans (Afrikaans)
Shqip (Albanian)
አማርኛ (Amharisk)
العربية (Arabic)
Հայերեն (Armensk)
Azərbaycan dili (Aserbajdsjansk)
Euskara (Baskisk)
Беларуская (Hviderussisk)
বাংলা (Bengali)
Bosanski (Bosnian)
Български (Bulgarian)
မြန်မာဘာသာ (Burmesisk)
Català (Catalansk)
Cebuano (Cebuano)
Chichewa (Chichewa)
中文 简体 (Kinesisk forenklet)
中文 繁體 (Kinesisk traditionel)
Corsu (Korsikansk)
Hrvatski (Croatian)
Čeština (Czech)
Dansk (Danish)
Nederlands (Dutch)
English (English)
Esperanto (Esperanto)
Eesti (Estonian)
Suomi (Finnish)
Français (French)
Frisisk (Frysk)
Galicisk (Galego)
Georgisk (ქართული)
Deutsch (German)
Ελληνικά (Greek)
ગુજરાતી (Gujarati)
Haitiansk (Kreyòl Ayisyen)
Hausa (Hausa)
Hawaiiansk (ʻŌlelo Hawaiʻi)
עברית (Hebrew)
Hindi (हिंदी)
Hmong (Hmoob)
Magyar (Hungarian)
Islandsk (Íslenska)
Igbo (Igbo)
Indonesisk (Bahasa Indonesia)
Irsk (Gaeilge)
Italiano (Italian)
日本語 (Japanese)
Basa Jawa (Javanese)
Kannada (ಕನ್ನಡ)
Kasakhisk (Қазақ тілі)
Khmer (ខ្មែរ)
Kinyarwanda (Ikinyarwanda)
한국어 (Korean)
Kurdî (Kurdish)
Kirgisisk (Кыргызча)
Laotisk (ລາວ)
Latin (Latina)
Lettisk (Latviešu)
Litauisk (Lietuvių)
Luxembourgsk (Lëtzebuergesch)
Makedonsk (Македонски)
Malagasy (Malagasy)
Bahasa Melayu (Malay)
Malayalam (മലയാളം)
Maltesisk (Malti)
Maori (Te Reo Māori)
मराठी (Marathi)
Mongolsk (Монгол хэл)
Nepalesisk (नेपाली)
Norsk (Norwegian)
Odia (ଓଡ଼ିଆ)
فارسی (Persian)
Polski (Polish)
Portugisisk (Português)
ਪੰਜਾਬੀ (Punjabi)
Română (Romanian)
Русский (Russian)
Samoansk (Gagana Samoa)
Skotsk (Gàidhlig)
Српски (Serbian)
Sesotho (Sesotho)
Shona (Shona)
Sindhi (سنڌي)
Singalesisk (සිංහල)
Slovenčina (Slovakian)
Slovenščina (Slovenian)
Somali (Soomaali)
Español (Spanish)
Sundanesisk (Basa Sunda)
Kiswahili (Swahili)
Svenska (Swedish)
Tagalog (Tagalog)
Tadsjikisk (Tajik)
தமிழ் (Tamil)
Tatarisk (Tatar)
తెలుగు (Telugu)
Thai (Thai)
Türkçe (Turkish)
Turkmensk (Turkmen)
Українська (Ukrainian)
اردو (Urdu)
Uighur (Uyghur)
Usbekisk (Uzbek)
Tiếng Việt (Vietnamese)
Walisisk (Welsh)
Xhosa (Xhosa)
Jiddisch (Yiddish)
Yoruba (Yoruba)
Zulu (Zulu)
Afrikaans (Afrikaans)
Shqip (Albanian)
አማርኛ (Amharisk)
العربية (Arabic)
Հայերեն (Armensk)
Azərbaycan dili (Aserbajdsjansk)
Euskara (Baskisk)
Беларуская (Hviderussisk)
বাংলা (Bengali)
Bosanski (Bosnian)
Български (Bulgarian)
မြန်မာဘာသာ (Burmesisk)
Català (Catalansk)
Cebuano (Cebuano)
Chichewa (Chichewa)
中文 简体 (Kinesisk forenklet)
中文 繁體 (Kinesisk traditionel)
Corsu (Korsikansk)
Hrvatski (Croatian)
Čeština (Czech)
Dansk (Danish)
Nederlands (Dutch)
English (English)
Esperanto (Esperanto)
Eesti (Estonian)
Suomi (Finnish)
Français (French)
Frisisk (Frysk)
Galicisk (Galego)
Georgisk (ქართული)
Deutsch (German)
Ελληνικά (Greek)
ગુજરાતી (Gujarati)
Haitiansk (Kreyòl Ayisyen)
Hausa (Hausa)
Hawaiiansk (ʻŌlelo Hawaiʻi)
עברית (Hebrew)
Hindi (हिंदी)
Hmong (Hmoob)
Magyar (Hungarian)
Islandsk (Íslenska)
Igbo (Igbo)
Indonesisk (Bahasa Indonesia)
Irsk (Gaeilge)
Italiano (Italian)
日本語 (Japanese)
Basa Jawa (Javanese)
Kannada (ಕನ್ನಡ)
Kasakhisk (Қазақ тілі)
Khmer (ខ្មែរ)
Kinyarwanda (Ikinyarwanda)
한국어 (Korean)
Kurdî (Kurdish)
Kirgisisk (Кыргызча)
Laotisk (ລາວ)
Latin (Latina)
Lettisk (Latviešu)
Litauisk (Lietuvių)
Luxembourgsk (Lëtzebuergesch)
Makedonsk (Македонски)
Malagasy (Malagasy)
Bahasa Melayu (Malay)
Malayalam (മലയാളം)
Maltesisk (Malti)
Maori (Te Reo Māori)
मराठी (Marathi)
Mongolsk (Монгол хэл)
Nepalesisk (नेपाली)
Norsk (Norwegian)
Odia (ଓଡ଼ିଆ)
فارسی (Persian)
Polski (Polish)
Portugisisk (Português)
ਪੰਜਾਬੀ (Punjabi)
Română (Romanian)
Русский (Russian)
Samoansk (Gagana Samoa)
Skotsk (Gàidhlig)
Српски (Serbian)
Sesotho (Sesotho)
Shona (Shona)
Sindhi (سنڌي)
Singalesisk (සිංහල)
Slovenčina (Slovakian)
Slovenščina (Slovenian)
Somali (Soomaali)
Español (Spanish)
Sundanesisk (Basa Sunda)
Kiswahili (Swahili)
Svenska (Swedish)
Tagalog (Tagalog)
Tadsjikisk (Tajik)
தமிழ் (Tamil)
Tatarisk (Tatar)
తెలుగు (Telugu)
Thai (Thai)
Türkçe (Turkish)
Turkmensk (Turkmen)
Українська (Ukrainian)
اردو (Urdu)
Uighur (Uyghur)
Usbekisk (Uzbek)
Tiếng Việt (Vietnamese)
Walisisk (Welsh)
Xhosa (Xhosa)
Jiddisch (Yiddish)
Yoruba (Yoruba)
Zulu (Zulu)
ARABISK PORTUGISISK RUSISK ITALIENSK KOREANSK HOLLANDSK POLSK TYRKISK SVENSK ENGELSK SPANSK FRANSK TYSK KINESISK JAPANSK HINDI BENGALI VIETNAMESISK THAI GRÆSK HEBRAISK ARABISK PORTUGISISK RUSISK ITALIENSK KOREANSK HOLLANDSK POLSK TYRKISK SVENSK ENGELSK SPANSK FRANSK TYSK KINESISK JAPANSK HINDI BENGALI VIETNAMESISK THAI GRÆSK HEBRAISK

Strukturen understøttes af to tegn

Komma-separerede værdier er knap nok et format. Der er en bredt fulgt beskrivelse af den almindelige dialekt, men ingen autoritet håndhæver den, så hvad du faktisk modtager, er en af flere konventioner. Hele gitteret hviler på to beslutninger: hvilket tegn adskiller felterne i en registrering, og hvilken sekvens afslutter en registrering. Gør enten forkert, og en pæn tabel bliver til en enkelt ujævn kolonne.

Skilletegnet er ikke altid et komma. Regnearksoftware i lande, der skriver decimaler med komma, bruger som standard semikolon i stedet, hvilket er grunden til, at en eksport fra en tysk eller fransk maskine ofte nægter at åbne rent andre steder. Tabs og lodrette streger bruges begge almindeligt, normalt valgt netop fordi indholdet er fuld af kommaer.

Hver registrering skal have det samme antal felter som headeren, fordi den optælling er, hvordan en parser ved, hvilken værdi der hører til hvilken kolonne. Intet i dataene annoncerer dette. Det er en invariant, der enten holder eller lydløst holder op med at holde midt i en stor eksport, hvorefter alt nedenunder forskydes en kolonne til venstre og ser plausibelt ud.

Fire måder oversat tekst bryder en registrering

Dette er de fejl, der ikke annoncerer sig selv. Eksporten åbner stadig, rækkeantallet ser stadig nogenlunde rigtigt ud, og skaden viser sig senere i det, der forbruger dataene.

  1. Et nyt skilletegn vises inde i en værdi. En engelsk produktbeskrivelse uden kommaer bliver til en fransk med to. Hvis feltet ikke var citeret før, skal det nu være det, ellers læser parseren én værdi som tre og forskubber hver kolonne efter den.
  2. Et anførselstegn lander inde i en citeret værdi. Inde i et lukket felt skal et bogstaveligt anførselstegn skrives to gange for at undslippe sig selv. Sprog, der citerer med forskellige tegn, og enhver proces, der konverterer lige tegn til typografiske, kan efterlade et uundsluppet tegn midt i en værdi, hvor det afslutter feltet tidligt.
  3. Et linjeskift sniger sig ind i en celle. En registrering slutter ved en ny linje, medmindre den nye linje sidder inde i anførselstegn. Oversat marketingtekst, der får et afsnitskift, vil opdele én registrering i to, og den anden halvdel vil have det forkerte antal felter.
  4. En pladsholder bliver oversat. Streng, der er bestemt til software, indeholder ofte substitutions-tokens, et procenttegn efterfulgt af et bogstav, et nummereret slot i parenteser, en navngivet variabel. De er adresser på værdier, der indsættes ved kørsel, ikke ord, og oversættelse af en betyder, at værdien aldrig vises.

Halvdelen af dine kolonner er ikke sprog

Et datasæt blander prosa beregnet til mennesker med nøgler beregnet til maskiner, og de sidder side om side uden noget til at skelne dem udover kolonneoverskriften. Find ud af, hvilken der er hvilken, før du starter, for en oversat identifikator er værre end en uoversat beskrivelse.

Lad disse være i fred

  • Selve header-rækken, hvor overskrifterne er feltnavne brugt af kode snarere end etiketter vist til en person
  • Varenumre, katalognumre, unikke identifikatorer og alt, der bruges som nøgle til at forbinde to datasæt
  • Webadresser og slug-delen af en, da ændring af den bryder linket og dets rangering
  • Statusværdier, som software sammenligner med en fast liste, såsom en ordrestatus eller et ja-og-nej-flag
  • Landekoder, sprogkoder og valutakoder, som allerede er standardiserede forkortelser
  • Datoer skrevet i år-måned-dag-rækkefølge, tal og alt, der vil blive parset frem for læst

Det er dem, du kom efter

  • Produktnavne og lange beskrivelser, hvilket normalt udgør størstedelen af ordantallet
  • Kategori- og kollektionsnavne, som kunderne ser dem
  • Attributværdier med betydning, såsom en farve, et materiale eller et størrelsesord
  • Grænsefladestreng, der er trukket ud til lokalisering, minus deres pladsholdere
  • Supportartiklers brødtekst, standardbeskeder og e-mailskabeloner gemt som rækker
  • Kolonneoverskrifter, hvor eksporten er beregnet til at blive åbnet af en person snarere end et program

To ting, der beskadiger data, før oversættelsen overhovedet starter

Åbning i et regneark

Dobbeltklik på en eksport og gem den igen er den mest pålidelige måde at ødelægge et katalog på. Regnearksprogrammer gætter typen af hver værdi, de ser, og deres gæt er selvsikre og forkerte:

  • Et tretten-cifret artikelnummer bliver til videnskabelig notation og mister sine sidste cifre for altid
  • Et postnummer, der starter med et nul, mister nullet
  • Alt, der ligner en dag og en måned, omskrives til en dato i det lokale format
  • Lange identifikatorer ud over femten cifre afrundes, lydløst

Hvis du absolut skal inspicere dataene først, skal du bruge importdialogen og indstille identifikationskolonnerne til tekst i stedet for at lade programmet bestemme. Endnu bedre, upload eksporten præcis som dit system producerede den.

Byte Order Mark-spørgsmålet

Intet inde i dataene siger, hvilken tegnkodning den bruger, så en markør på tre bytes placeres nogle gange helt i starten for at signalere en. Den markør hjælper og skader afhængigt af, hvad der åbner dataene næste gang.

Regnearksprogrammer på Windows bruger den til at genkende Unicode-indhold, og uden den kommer accenterte og ikke-latinske tegn ud som strenge af symboler. Mange programmeringsbiblioteker stripper den derimod ikke, så den første kolonneoverskrift ankommer med tre usynlige tegn klistret til fronten, og alle opslag mod den pågældende overskrift fejler.

Beslut ud fra destinationen: behold markøren, hvis en person vil åbne resultatet i et regneark, fjern den, hvis et program vil læse den. Svaret på næsten alle spørgsmål om beskadigede accenterte tegn findes et sted i dette afsnit.

Hvad et datasæt koster at behandle

Prissat efter tekstvolumen, så et bredt katalog med korte værdier er billigere end et smalt med lange beskrivelser.

Free

$0

Intet kort kræves for at tilmelde sig

  • 0,005 $/ord AI-oversættelse
  • 1 USD pr. side for scanninger og billed-PDF'er
  • 120+ sprog
  • Filer op til 20 MB og 20 sider
  • DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG og CSV
  • Kun 24-timers fillagring
  • PDF-editor og PDF til DOCX-konverter
  • Annuller når som helst
  • Ikke inkluderet: E-mailsupport
  • Ikke inkluderet: Teamadgang
  • Ikke inkluderet: Ubegrænsede gratis PDF-forhåndsvisninger
  • Ikke inkluderet: Ordliste

Storage

14,99 USD/måned

eller 149 USD/år

  • 0,005 $/ord AI-oversættelse
  • 1 USD pr. side for scanninger og billed-PDF'er
  • 120+ sprog
  • Filer op til 100 MB og 100 sider
  • DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG og CSV
  • Ubegrænset fillagring
  • PDF-editor og PDF til DOCX-konverter
  • E-mail support
  • Annuller når som helst
  • Ikke inkluderet: Teamadgang
  • Ikke inkluderet: Ubegrænsede gratis PDF-forhåndsvisninger
  • Ikke inkluderet: Ordliste

Pro

49,99 USD/måned

eller 499 USD/år

  • 0,004 USD pr. ord AI-oversættelse
  • 0,80 USD pr. side for scanninger og billed-PDF'er
  • 120+ sprog
  • Filer op til 1.000 MB og 5.000 sider
  • DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG og CSV
  • Ubegrænset fillagring
  • PDF-editor og PDF til DOCX-konverter
  • E-mail support
  • Teamadgang for op til 5 medlemmer
  • Ubegrænsede gratis PDF-forhåndsvisninger
  • Ordliste
  • Annuller når som helst

Virksomhed

149,99 USD/måned, efter anmodning. AI-oversættelse til 0,003 USD pr. ord (0,60 USD pr. side), filer op til 1.000 MB og 5.000 sider, ubegrænset fillagring og teamadgang for op til 15 medlemmer.

Kontakt Salg

Rækker ind, rækker ud

Forstør en miniature for at sammenligne en kildeside med dens resultat. Hvad parrene demonstrerer:

  • Antal kolonner pr. post er uændret fra top til bund.
  • Værdier, der var omgivet af anførselstegn, er stadig omgivet.
  • Koder, nøgler og numeriske værdier passerer uændret igennem.
  • Kun de menneskelæsbare kolonner kommer tilbage på et nyt sprog.
Tabeldata på engelsk, kildenDe samme tabeldata gengivet på spanskEt andet sæt tabeldata på engelsk, kildenDet samme andet sæt tabeldata gengivet på tysk

Intet her blev åbnet i et regneark mellem de to tilstande.

Se alle oversættelseseksempler →

En arbejdsrækkefølge, der undgår omarbejde

Lokalisering af et katalog er en pipeline, og de dyre fejl sker alle i enderne af den snarere end i midten.

  1. 1

    Eksporter rent og noter dialekten

    Tag eksporten direkte fra det system, der ejer dataene. Åbn den én gang i en almindelig teksteditor, ikke et regneark, og noter, hvilken tegn der adskiller felterne, og om værdier er omgivet af anførselstegn.

  2. 2

    Marker kolonnerne, du ikke vil have rørt

    Identifikatorer, nøgler, links, statusværdier og koder. Hvis eksporten er meget bred, er det ofte hurtigere at skære den ned til de kolonner, der indeholder prosa, og genforene på nøglen bagefter.

  3. 3

    Upload og vælg dine sprog

    Opret en konto med en e-mailadresse, slip dataen ind, og angiv kilde og mål. Uploads kører op til 1 GB, så et helt katalog køres som én opgave i stedet for at blive opdelt i batches.

  4. 4

    Genimporter først til en staging-kopi

    Indlæs resultatet i et testmiljø før produktion. Kontroller postantallet mod originalen, se på de længste oversatte værdier for layoutproblemer, og bekræft, at accenttegnene overlevede turen.

CSV-oversættelse FAQ

Spørgsmål fra folk med datasæt

Ændres skilletegnet, hvis jeg oversætter til et sprog, der bruger decimalkommaer?

Det skilletegn, du uploadede med, er det skilletegn, du får tilbage. At ændre det ville betyde at omskrive strukturen snarere end indholdet, og det ville bryde, hvad end der behandler dataene i den anden ende. Hvis du specifikt har brug for en semikolon-separeret version, fordi resultatet vil blive åbnet i et regneark på en maskine, der er konfigureret på den måde, skal du konvertere det efter oversættelsen med et værktøj, der forstår begge dialekter.

Hvordan forhindrer jeg produktkoder og identifikatorer i at blive oversat?

Hold dem i tydeligt identificerede kolonner, og send, hvor det er muligt, kun prose-kolonnerne til behandling og saml dem igen bagefter. Værdier, der tydeligvis er koder snarere end ord, efterlades som de er, men den sikreste ordning er den, hvor tvetydigheden aldrig opstår. Lad aldrig et regneark røre ved disse kolonner imens, for det vil omformaterer dem uanset enhver oversættelse.

Mine accenttegn kom tilbage som strenge af symboler. Hvad skete der?

Det er en kodningsfejl, ikke et oversættelsesproblem. Resultatet er næsten helt sikkert korrekt Unicode, der læses af noget, der forventer en ældre single-byte-kodning, eller omvendt. Åbn det i en teksteditor, der lader dig vælge kodningen eksplicit, og bekræft, hvad du faktisk har, før du antager, at noget er gået tabt. Hvis et regneark er destinationen, er byte order markeren i starten normalt det, der bestemmer det.

Hvad sker der med værdier, der indeholder kommaer eller linjeskift?

De forbliver indkapslede. Enhver værdi, der indeholder skilletegnet, et anførselstegn eller et linjeskift, skal indkapsles i anførselstegn, og et bogstaveligt anførselstegn inde i en sådan værdi skal fordobles. Fordi oversat tekst kan få tegnsætning, som originalen ikke havde, skal denne indkapsling anvendes på resultatet snarere end kopieres fra kilden.

Vil pladsholdere og variabeltokens overleve?

Det burde de, og det er værd at tjekke en prøve. Tokens som et procenttegn efterfulgt af et bogstav, et nummereret felt i krøllede parenteser eller en navngivet variabel er adresser for værdier, der indsættes under kørsel. At oversætte en af dem betyder, at værdien aldrig når skærmen, så scan en håndfuld af de længste grænsefladestreng i outputtet, før du sender.

Mine strenge bliver meget længere på tysk. Betyder det noget her?

Ikke for selve dataene, som ikke har nogen bredde. Det betyder noget for det, der viser dem. Udvidelse på en femtedel til en tredjedel over engelsk er normalt for tysk og russisk, mens kinesisk og japansk normalt trækker sig sammen. Sorter den oversatte kolonne efter længde og se på ekstremerne i forhold til dit eget layout, og tjek enhver databasekolonne med en fast tegngrænse.

Hvor stor en datasæt kan jeg sende på én gang?

Op til 1 GB, eller fem tusind sider med tilsvarende indhold, på Pro- og Enterprise-planerne. Det dækker kataloger på hundredtusindvis af rækker. At sende det hele som én opgave er også bedre for konsistens, fordi et udtryk, der optræder i række 12 og række 90.000, håndteres på samme måde.

Hvad bliver jeg opkrævet for på en bred eksport?

Teksten, ikke gitteret. Tomme celler, numeriske kolonner og identifikationskolonner er ikke prosa. Hver fil faktureres for sig selv, da ingen plan kommer med ord inkluderet: en halv cent pr. ord på Free og Storage, $0,004 på Pro og $0,003 på Enterprise, med $0,99 som gulvet. Det gør et stort katalog let at estimere ud fra et ordantal.

Send eksporten, behold strukturen

Upload dataene præcis som dit system producerede dem, vælg målsproget, og få en tabel tilbage med det samme antal kolonner i hver post, og nøglerne kan stadig sammenføjes.

Vores Partnere

Accenture
Bloomberg
Citrix
P&G
SAP