CSV Oversætter
Produktkataloger, eksport og datasæt oversat kolonne for kolonne, med skilletegnene, anførselstegnene og identifikationskolonnerne efterladt præcis som din parser forventer at finde dem.
Upload eller træk dokumentet hertil for oversættelse
Maks. filstørrelse 1 GB
Strukturen understøttes af to tegn
Komma-separerede værdier er knap nok et format. Der er en bredt fulgt beskrivelse af den almindelige dialekt, men ingen autoritet håndhæver den, så hvad du faktisk modtager, er en af flere konventioner. Hele gitteret hviler på to beslutninger: hvilket tegn adskiller felterne i en registrering, og hvilken sekvens afslutter en registrering. Gør enten forkert, og en pæn tabel bliver til en enkelt ujævn kolonne.
Skilletegnet er ikke altid et komma. Regnearksoftware i lande, der skriver decimaler med komma, bruger som standard semikolon i stedet, hvilket er grunden til, at en eksport fra en tysk eller fransk maskine ofte nægter at åbne rent andre steder. Tabs og lodrette streger bruges begge almindeligt, normalt valgt netop fordi indholdet er fuld af kommaer.
Hver registrering skal have det samme antal felter som headeren, fordi den optælling er, hvordan en parser ved, hvilken værdi der hører til hvilken kolonne. Intet i dataene annoncerer dette. Det er en invariant, der enten holder eller lydløst holder op med at holde midt i en stor eksport, hvorefter alt nedenunder forskydes en kolonne til venstre og ser plausibelt ud.
Fire måder oversat tekst bryder en registrering
Dette er de fejl, der ikke annoncerer sig selv. Eksporten åbner stadig, rækkeantallet ser stadig nogenlunde rigtigt ud, og skaden viser sig senere i det, der forbruger dataene.
- Et nyt skilletegn vises inde i en værdi. En engelsk produktbeskrivelse uden kommaer bliver til en fransk med to. Hvis feltet ikke var citeret før, skal det nu være det, ellers læser parseren én værdi som tre og forskubber hver kolonne efter den.
- Et anførselstegn lander inde i en citeret værdi. Inde i et lukket felt skal et bogstaveligt anførselstegn skrives to gange for at undslippe sig selv. Sprog, der citerer med forskellige tegn, og enhver proces, der konverterer lige tegn til typografiske, kan efterlade et uundsluppet tegn midt i en værdi, hvor det afslutter feltet tidligt.
- Et linjeskift sniger sig ind i en celle. En registrering slutter ved en ny linje, medmindre den nye linje sidder inde i anførselstegn. Oversat marketingtekst, der får et afsnitskift, vil opdele én registrering i to, og den anden halvdel vil have det forkerte antal felter.
- En pladsholder bliver oversat. Streng, der er bestemt til software, indeholder ofte substitutions-tokens, et procenttegn efterfulgt af et bogstav, et nummereret slot i parenteser, en navngivet variabel. De er adresser på værdier, der indsættes ved kørsel, ikke ord, og oversættelse af en betyder, at værdien aldrig vises.
Halvdelen af dine kolonner er ikke sprog
Et datasæt blander prosa beregnet til mennesker med nøgler beregnet til maskiner, og de sidder side om side uden noget til at skelne dem udover kolonneoverskriften. Find ud af, hvilken der er hvilken, før du starter, for en oversat identifikator er værre end en uoversat beskrivelse.
Lad disse være i fred
- Selve header-rækken, hvor overskrifterne er feltnavne brugt af kode snarere end etiketter vist til en person
- Varenumre, katalognumre, unikke identifikatorer og alt, der bruges som nøgle til at forbinde to datasæt
- Webadresser og slug-delen af en, da ændring af den bryder linket og dets rangering
- Statusværdier, som software sammenligner med en fast liste, såsom en ordrestatus eller et ja-og-nej-flag
- Landekoder, sprogkoder og valutakoder, som allerede er standardiserede forkortelser
- Datoer skrevet i år-måned-dag-rækkefølge, tal og alt, der vil blive parset frem for læst
Det er dem, du kom efter
- Produktnavne og lange beskrivelser, hvilket normalt udgør størstedelen af ordantallet
- Kategori- og kollektionsnavne, som kunderne ser dem
- Attributværdier med betydning, såsom en farve, et materiale eller et størrelsesord
- Grænsefladestreng, der er trukket ud til lokalisering, minus deres pladsholdere
- Supportartiklers brødtekst, standardbeskeder og e-mailskabeloner gemt som rækker
- Kolonneoverskrifter, hvor eksporten er beregnet til at blive åbnet af en person snarere end et program
To ting, der beskadiger data, før oversættelsen overhovedet starter
Åbning i et regneark
Dobbeltklik på en eksport og gem den igen er den mest pålidelige måde at ødelægge et katalog på. Regnearksprogrammer gætter typen af hver værdi, de ser, og deres gæt er selvsikre og forkerte:
- Et tretten-cifret artikelnummer bliver til videnskabelig notation og mister sine sidste cifre for altid
- Et postnummer, der starter med et nul, mister nullet
- Alt, der ligner en dag og en måned, omskrives til en dato i det lokale format
- Lange identifikatorer ud over femten cifre afrundes, lydløst
Hvis du absolut skal inspicere dataene først, skal du bruge importdialogen og indstille identifikationskolonnerne til tekst i stedet for at lade programmet bestemme. Endnu bedre, upload eksporten præcis som dit system producerede den.
Byte Order Mark-spørgsmålet
Intet inde i dataene siger, hvilken tegnkodning den bruger, så en markør på tre bytes placeres nogle gange helt i starten for at signalere en. Den markør hjælper og skader afhængigt af, hvad der åbner dataene næste gang.
Regnearksprogrammer på Windows bruger den til at genkende Unicode-indhold, og uden den kommer accenterte og ikke-latinske tegn ud som strenge af symboler. Mange programmeringsbiblioteker stripper den derimod ikke, så den første kolonneoverskrift ankommer med tre usynlige tegn klistret til fronten, og alle opslag mod den pågældende overskrift fejler.
Beslut ud fra destinationen: behold markøren, hvis en person vil åbne resultatet i et regneark, fjern den, hvis et program vil læse den. Svaret på næsten alle spørgsmål om beskadigede accenterte tegn findes et sted i dette afsnit.
Hvad et datasæt koster at behandle
Prissat efter tekstvolumen, så et bredt katalog med korte værdier er billigere end et smalt med lange beskrivelser.
Free
Intet kort kræves for at tilmelde sig
- 0,005 $/ord AI-oversættelse
- 1 USD pr. side for scanninger og billed-PDF'er
- 120+ sprog
- Filer op til 20 MB og 20 sider
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG og CSV
- Kun 24-timers fillagring
- PDF-editor og PDF til DOCX-konverter
- Annuller når som helst
- Ikke inkluderet: E-mailsupport
- Ikke inkluderet: Teamadgang
- Ikke inkluderet: Ubegrænsede gratis PDF-forhåndsvisninger
- Ikke inkluderet: Ordliste
Storage
eller 149 USD/år
- 0,005 $/ord AI-oversættelse
- 1 USD pr. side for scanninger og billed-PDF'er
- 120+ sprog
- Filer op til 100 MB og 100 sider
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG og CSV
- Ubegrænset fillagring
- PDF-editor og PDF til DOCX-konverter
- E-mail support
- Annuller når som helst
- Ikke inkluderet: Teamadgang
- Ikke inkluderet: Ubegrænsede gratis PDF-forhåndsvisninger
- Ikke inkluderet: Ordliste
Pro
eller 499 USD/år
- 0,004 USD pr. ord AI-oversættelse
- 0,80 USD pr. side for scanninger og billed-PDF'er
- 120+ sprog
- Filer op til 1.000 MB og 5.000 sider
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG og CSV
- Ubegrænset fillagring
- PDF-editor og PDF til DOCX-konverter
- E-mail support
- Teamadgang for op til 5 medlemmer
- Ubegrænsede gratis PDF-forhåndsvisninger
- Ordliste
- Annuller når som helst
Virksomhed
149,99 USD/måned, efter anmodning. AI-oversættelse til 0,003 USD pr. ord (0,60 USD pr. side), filer op til 1.000 MB og 5.000 sider, ubegrænset fillagring og teamadgang for op til 15 medlemmer.
Rækker ind, rækker ud
Forstør en miniature for at sammenligne en kildeside med dens resultat. Hvad parrene demonstrerer:
- Antal kolonner pr. post er uændret fra top til bund.
- Værdier, der var omgivet af anførselstegn, er stadig omgivet.
- Koder, nøgler og numeriske værdier passerer uændret igennem.
- Kun de menneskelæsbare kolonner kommer tilbage på et nyt sprog.




Intet her blev åbnet i et regneark mellem de to tilstande.
Se alle oversættelseseksempler →En arbejdsrækkefølge, der undgår omarbejde
Lokalisering af et katalog er en pipeline, og de dyre fejl sker alle i enderne af den snarere end i midten.
- 1
Eksporter rent og noter dialekten
Tag eksporten direkte fra det system, der ejer dataene. Åbn den én gang i en almindelig teksteditor, ikke et regneark, og noter, hvilken tegn der adskiller felterne, og om værdier er omgivet af anførselstegn.
- 2
Marker kolonnerne, du ikke vil have rørt
Identifikatorer, nøgler, links, statusværdier og koder. Hvis eksporten er meget bred, er det ofte hurtigere at skære den ned til de kolonner, der indeholder prosa, og genforene på nøglen bagefter.
- 3
Upload og vælg dine sprog
Opret en konto med en e-mailadresse, slip dataen ind, og angiv kilde og mål. Uploads kører op til 1 GB, så et helt katalog køres som én opgave i stedet for at blive opdelt i batches.
- 4
Genimporter først til en staging-kopi
Indlæs resultatet i et testmiljø før produktion. Kontroller postantallet mod originalen, se på de længste oversatte værdier for layoutproblemer, og bekræft, at accenttegnene overlevede turen.
Spørgsmål fra folk med datasæt
Ændres skilletegnet, hvis jeg oversætter til et sprog, der bruger decimalkommaer?
Det skilletegn, du uploadede med, er det skilletegn, du får tilbage. At ændre det ville betyde at omskrive strukturen snarere end indholdet, og det ville bryde, hvad end der behandler dataene i den anden ende. Hvis du specifikt har brug for en semikolon-separeret version, fordi resultatet vil blive åbnet i et regneark på en maskine, der er konfigureret på den måde, skal du konvertere det efter oversættelsen med et værktøj, der forstår begge dialekter.
Hvordan forhindrer jeg produktkoder og identifikatorer i at blive oversat?
Hold dem i tydeligt identificerede kolonner, og send, hvor det er muligt, kun prose-kolonnerne til behandling og saml dem igen bagefter. Værdier, der tydeligvis er koder snarere end ord, efterlades som de er, men den sikreste ordning er den, hvor tvetydigheden aldrig opstår. Lad aldrig et regneark røre ved disse kolonner imens, for det vil omformaterer dem uanset enhver oversættelse.
Mine accenttegn kom tilbage som strenge af symboler. Hvad skete der?
Det er en kodningsfejl, ikke et oversættelsesproblem. Resultatet er næsten helt sikkert korrekt Unicode, der læses af noget, der forventer en ældre single-byte-kodning, eller omvendt. Åbn det i en teksteditor, der lader dig vælge kodningen eksplicit, og bekræft, hvad du faktisk har, før du antager, at noget er gået tabt. Hvis et regneark er destinationen, er byte order markeren i starten normalt det, der bestemmer det.
Hvad sker der med værdier, der indeholder kommaer eller linjeskift?
De forbliver indkapslede. Enhver værdi, der indeholder skilletegnet, et anførselstegn eller et linjeskift, skal indkapsles i anførselstegn, og et bogstaveligt anførselstegn inde i en sådan værdi skal fordobles. Fordi oversat tekst kan få tegnsætning, som originalen ikke havde, skal denne indkapsling anvendes på resultatet snarere end kopieres fra kilden.
Vil pladsholdere og variabeltokens overleve?
Det burde de, og det er værd at tjekke en prøve. Tokens som et procenttegn efterfulgt af et bogstav, et nummereret felt i krøllede parenteser eller en navngivet variabel er adresser for værdier, der indsættes under kørsel. At oversætte en af dem betyder, at værdien aldrig når skærmen, så scan en håndfuld af de længste grænsefladestreng i outputtet, før du sender.
Mine strenge bliver meget længere på tysk. Betyder det noget her?
Ikke for selve dataene, som ikke har nogen bredde. Det betyder noget for det, der viser dem. Udvidelse på en femtedel til en tredjedel over engelsk er normalt for tysk og russisk, mens kinesisk og japansk normalt trækker sig sammen. Sorter den oversatte kolonne efter længde og se på ekstremerne i forhold til dit eget layout, og tjek enhver databasekolonne med en fast tegngrænse.
Hvor stor en datasæt kan jeg sende på én gang?
Op til 1 GB, eller fem tusind sider med tilsvarende indhold, på Pro- og Enterprise-planerne. Det dækker kataloger på hundredtusindvis af rækker. At sende det hele som én opgave er også bedre for konsistens, fordi et udtryk, der optræder i række 12 og række 90.000, håndteres på samme måde.
Hvad bliver jeg opkrævet for på en bred eksport?
Teksten, ikke gitteret. Tomme celler, numeriske kolonner og identifikationskolonner er ikke prosa. Hver fil faktureres for sig selv, da ingen plan kommer med ord inkluderet: en halv cent pr. ord på Free og Storage, $0,004 på Pro og $0,003 på Enterprise, med $0,99 som gulvet. Det gør et stort katalog let at estimere ud fra et ordantal.
Send eksporten, behold strukturen
Upload dataene præcis som dit system producerede dem, vælg målsproget, og få en tabel tilbage med det samme antal kolonner i hver post, og nøglerne kan stadig sammenføjes.
Vores Partnere
Relaterede oversættelsestjenester
Filformater
PDF-værktøjer
