Traducător CSV
Cataloage de produse, exporturi și seturi de date traduse coloană cu coloană, cu delimitatorii, ghilimelele și coloanele de identificare lăsate exact așa cum așteaptă parserul dvs. să le găsească.
Încarcă sau trage fișierul pentru traducere
Dimensiune maximă fișier 1 GB
Structura este susținută de două caractere
Valorile separate prin virgulă sunt abia un format. Există o descriere larg urmată a dialectului comun, dar nicio autoritate nu o impune, așa că ceea ce primiți de fapt este una dintre mai multe convenții. Întregul tabel se bazează pe două decizii: ce caracter separă câmpurile dintr-un rând și ce secvență încheie un rând. Greșiți una dintre ele și un tabel ordonat devine o singură coloană neregulată.
Separatorul nu este întotdeauna o virgulă. Software-ul de calcul tabelar din țările care scriu zecimale cu virgulă folosește implicit punct și virgulă în schimb, motiv pentru care un export dintr-un aparat german sau francez refuză adesea să se deschidă corect în altă parte. Tab-urile și barele verticale sunt ambele utilizate frecvent, de obicei alese tocmai pentru că conținutul este plin de virgule.
Fiecare rând trebuie să aibă același număr de câmpuri ca și antetul, deoarece acel număr este modul în care un parser știe ce valoare aparține cărei coloane. Nimic din date nu anunță acest lucru. Este un invariant care fie se menține, fie încetează în liniște să se mențină la jumătatea unui export mare, moment în care totul de dedesubt se mută o coloană la stânga și pare plauzibil.
Patru moduri în care textul tradus strică un rând
Acestea sunt eșecurile care nu se anunță. Exportul se deschide în continuare, numărul de rânduri pare în continuare aproximativ corect, iar daunele apar mai târziu în orice consumă datele.
- Un nou separator apare într-o valoare. O descriere de produs în engleză fără virgule devine una în franceză cu două. Dacă câmpul nu era ghilimele anterior, acum trebuie să fie, altfel parserul citește o valoare ca trei și mută fiecare coloană după ea.
- Un semn de ghilimele aterizează în interiorul unei valori ghilimele. În interiorul unui câmp închis, un ghilimele dublu literal trebuie scris de două ori pentru a se auto-evada. Limbile care folosesc ghilimele cu semne diferite și orice proces care convertește semnele drepte în cele tipografice pot lăsa un caracter neevadat în mijlocul unei valori unde termină câmpul devreme.
- O linie nouă apare într-o celulă. Un rând se termină la o linie nouă, cu excepția cazului în care acea linie nouă se află între ghilimele. Copia de marketing tradusă care primește o pauză de paragraf va împărți un rând în două, iar jumătatea a doua va avea numărul greșit de câmpuri.
- Un placeholder este tradus. Șirurile destinate software-ului conțin adesea token-uri de substituție, un semn procent urmat de o literă, un slot numerotat între acolade, o variabilă numită. Sunt adrese pentru valori inserate la runtime, nu cuvinte, iar traducerea unuia înseamnă că valoarea nu apare niciodată.
Jumătate din coloanele tale nu sunt limbaj
Un set de date amestecă proza destinată oamenilor cu chei destinate mașinilor, iar acestea stau una lângă alta fără nimic care să le distingă, cu excepția antetului coloanei. Stabilește care este care înainte de a începe, deoarece un identificator tradus este mai rău decât o descriere netradusă.
Lasă-le în pace
- Antetul rândului în sine, unde antetele sunt nume de câmpuri folosite de cod, mai degrabă decât etichete afișate unei persoane
- Coduri de stoc, numere de catalog, identificatori unici și orice este folosit ca cheie pentru a uni două seturi de date
- Adrese web și porțiunea slug a uneia, deoarece modificarea acesteia rupe legătura și clasamentul său
- Valori de stare pe care software-ul le compară cu o listă fixă, cum ar fi o stare a comenzii sau un indicator da-nu
- Coduri de țară, limbă și monedă, care sunt deja abrevieri standardizate
- Datele scrise în ordinea an-lună-zi, numere și orice altceva care va fi analizat mai degrabă decât citit
Acestea sunt cele pentru care ați venit
- Titlurile produselor și descrierile lungi, care reprezintă de obicei cea mai mare parte a numărului de cuvinte
- Numele categoriilor și colecțiilor așa cum le văd clienții
- Valori de atribute cu semnificație, cum ar fi o culoare, un material sau un cuvânt pentru mărime
- Șiruri de caractere din interfață extrase pentru localizare, minus placeholder-ele lor
- Corpurile articolelor de suport, răspunsurile predefinite și șabloanele de e-mail păstrate ca rânduri
- Antetele coloanelor unde exportul este destinat să fie deschis de o persoană, nu de un program
Două lucruri care deteriorează datele înainte ca traducerea să înceapă
Deschiderea într-un spreadsheet
Dublu clic pe un export și salvarea acestuia din nou este cea mai fiabilă modalitate de a corupe un catalog. Software-ul de spreadsheet ghicește tipul fiecărei valori pe care o vede, iar ghicirile sale sunt sigure și greșite:
- Un număr de articol de treisprezece cifre se transformă în notație științifică și își pierde ultimele cifre pentru totdeauna
- Un cod poștal care începe cu zero pierde zero-ul
- Orice lucru care seamănă cu o zi și o lună este rescris ca o dată în formatul local
- Identificatorii lungi peste cincisprezece cifre sunt rotunjiți, silențios
Dacă trebuie să inspectați mai întâi datele, utilizați dialogul de import și setați coloanele de identificare la text, în loc să lăsați programul să decidă. Mai bine, încărcați exportul exact așa cum l-a produs sistemul dvs.
Întrebarea despre marcajul de ordine a octeților
Nimic din interiorul datelor nu indică ce codificare de caractere folosește, așa că un marcaj de trei octeți este uneori plasat chiar la început pentru a semnala una. Acest marcaj ajută și încurcă, în funcție de ce deschide datele ulterior.
Software-ul de spreadsheet pe Windows îl folosește pentru a recunoaște conținutul Unicode, iar fără el, caracterele accentuate și cele non-latine ies ca șiruri de simboluri. Multe biblioteci de programare, în contrast, nu îl elimină, așa că antetul primei coloane ajunge cu trei caractere invizibile lipite de față și fiecare căutare împotriva acelui antet eșuează.
Decideți în funcție de destinație: păstrați marcajul dacă o persoană va deschide rezultatul într-un spreadsheet, eliminați-l dacă un program îl va citi. Răspunsul la aproape fiecare întrebare despre caractere accentuate corupte se află undeva în acest paragraf.
Cât costă procesarea unui set de date
Prețuri pe volum de text, deci un catalog larg cu valori scurte este mai ieftin decât unul îngust plin de descrieri lungi.
Free
Nu este necesar cardul pentru înregistrare
- Traducere AI de 0,005 $/cuvânt
- 1 USD per pagină pentru scanări și PDF-uri imagine
- 120+ limbi
- Fișiere de până la 20 MB și 20 de pagini
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG și CSV
- Stocare fișiere doar 24 de ore
- Editor PDF și convertor PDF în DOCX
- Anulați oricând
- Nu este inclus: Suport prin e-mail
- Nu este inclus: Acces pentru echipă
- Nu este inclus: Previzualizări PDF gratuite nelimitate
- Nu este inclus: Glosar
Storage
sau 149 USD/an
- Traducere AI de 0,005 $/cuvânt
- 1 USD per pagină pentru scanări și PDF-uri imagine
- 120+ limbi
- Fișiere de până la 100 MB și 100 de pagini
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG și CSV
- Stocare nelimitată de fișiere
- Editor PDF și convertor PDF în DOCX
- Suport prin email
- Anulați oricând
- Nu este inclus: Acces pentru echipă
- Nu este inclus: Previzualizări PDF gratuite nelimitate
- Nu este inclus: Glosar
Pro
sau 499 USD/an
- Traducere AI de 0,004 USD/cuvânt
- 0,80 USD per pagină pentru scanări și PDF-uri imagine
- 120+ limbi
- Fișiere de până la 1.000 MB și 5.000 de pagini
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG și CSV
- Stocare nelimitată de fișiere
- Editor PDF și convertor PDF în DOCX
- Suport prin email
- Acces pentru echipă pentru până la 5 membri
- Previzualizări PDF gratuite nelimitate
- Glosar
- Anulați oricând
Enterprise
149,99 USD/lună, la cerere. Traducere AI la 0,003 USD/cuvânt (0,60 USD per pagină), fișiere de până la 1.000 MB și 5.000 de pagini, stocare nelimitată de fișiere și acces pentru echipă pentru până la 15 membri.
Rânduri la intrare, rânduri la ieșire
Măriți o miniatură pentru a compara o pagină sursă cu rezultatul său. Ce demonstrează perechile:
- Numărul de coloane per înregistrare este neschimbat de sus până jos.
- Valorile care au fost încadrate în ghilimele sunt încă încadrate.
- Codurile, cheile și valorile numerice trec neatinse.
- Doar coloanele lizibile de către om revin într-o limbă nouă.




Nimic aici nu a fost deschis într-un spreadsheet între cele două stări.
Vezi toate exemplele de traducere →Un ordin de lucru care evită munca suplimentară
Localizarea unui catalog este o conductă, iar greșelile costisitoare se întâmplă toate la capetele acesteia, nu în mijloc.
- 1
Exportați curat și notați dialectul
Luați exportul direct din sistemul care deține datele. Deschideți-l o dată într-un editor de text simplu, nu într-un spreadsheet, și notați ce caracter separă câmpurile și dacă valorile sunt încadrate în ghilimele.
- 2
Marcați coloanele pe care nu doriți să le atingeți
Identificatori, chei, linkuri, valori de stare și coduri. Dacă exportul este foarte larg, este adesea mai rapid să-l reduceți la coloanele care conțin proză și să le reuniți ulterior pe baza cheii.
- 3
Încărcați și alegeți limbile
Creați un cont cu o adresă de e-mail, plasați datele și setați sursa și ținta. Încărcările ajung la 1 GB, deci un catalog complet este procesat ca un singur job, mai degrabă decât împărțit în loturi.
- 4
Reimportați mai întâi într-o copie de staging
Încărcați rezultatul într-un mediu de testare înainte de producție. Verificați numărul de înregistrări în raport cu originalul, uitați-vă la cele mai lungi valori traduse pentru probleme de aspect și confirmați că caracterele accentuate au supraviețuit transferului.
Întrebări de la persoane cu seturi de date
Se modifică delimitatorul dacă traduc într-o limbă care folosește virgule zecimale?
Separatorul cu care ați încărcat este separatorul pe care îl primiți înapoi. Modificarea acestuia ar însemna rescrierea structurii, nu a conținutului, și ar rupe orice consumator de date la celălalt capăt. Dacă aveți nevoie în mod specific de o versiune separată prin punct și virgulă, deoarece rezultatul va fi deschis într-o foaie de calcul pe un computer configurat în acest fel, convertiți-l după traducere cu un instrument care înțelege ambele dialecte.
Cum împiedic traducerea codurilor de produs și a identificatorilor?
Păstrați-le în coloane clar identificate și, acolo unde este posibil, trimiteți doar coloanele de proză pentru procesare și reuniți-le ulterior pe baza cheii. Valorile care sunt evident coduri, nu cuvinte, sunt lăsate așa cum sunt, dar cea mai sigură aranjare este cea în care ambiguitatea nu apare niciodată. Nu lăsați niciodată o foaie de calcul să atingă acele coloane între timp, deoarece le va reformata indiferent de orice traducere.
Caracterele mele accentuate au revenit ca șiruri de simboluri. Ce s-a întâmplat?
Aceasta este o nepotrivire de codificare, nu o problemă de traducere. Rezultatul este aproape sigur Unicode corect citit de ceva care așteaptă o codificare legacy pe un singur octet, sau invers. Deschideți-l într-un editor de text care vă permite să alegeți explicit codificarea și confirmați ce aveți de fapt înainte de a presupune că s-a pierdut ceva. Dacă o foaie de calcul este destinația, markerul de ordine a octeților de la început este de obicei ceea ce o decide.
Ce se întâmplă cu valorile care conțin virgule sau întreruperi de linie?
Rămân închise. Orice valoare care conține separatorul, un semn de ghilimele sau o linie nouă trebuie să fie închisă între ghilimele, iar un semn de ghilimele literal din interiorul unei astfel de valori trebuie dublat. Deoarece textul tradus poate dobândi punctuație pe care sursa nu o avea, acea închidere trebuie aplicată rezultatului, nu copiată din sursă.
Vor supraviețui placeholder-ele și token-urile variabile?
Ar trebui, și merită să verificați un eșantion. Token-uri precum un semn de procent urmat de o literă, un spațiu numerotat între acolade sau o variabilă numită sunt adrese pentru valori inserate la runtime. Traducerea unuia înseamnă că valoarea nu ajunge niciodată pe ecran, așa că scanați un număr de șiruri de interfață cele mai lungi din ieșire înainte de expediere.
Șirurile mele devin mult mai lungi în germană. Contează asta aici?
Nu pentru date în sine, care nu au lățime. Contează pentru ceea ce le afișează. Expansiunea de la o cincime la o treime peste engleză este normală pentru germană și rusă, în timp ce chineza și japoneza de obicei se contractă. Sortați coloana tradusă după lungime și priviți extremele în raport cu propriul dvs. aspect și verificați orice coloană de bază de date cu o limită fixă de caractere.
Cât de mare set de date pot trimite într-o singură tranșă?
Până la 1 GB sau cinci mii de pagini de conținut echivalent, pe planurile Pro și Enterprise. Aceasta acoperă cataloage de sute de mii de rânduri. Trimiterea întregului ca un singur job este, de asemenea, mai bună pentru consistență, deoarece un termen care apare în rândul 12 și rândul 90.000 este tratat în același mod.
Pentru ce sunt taxat la un export larg?
Textul, nu grila. Celulele goale, coloanele numerice și coloanele de identificare nu sunt proză. Fiecare fișier este facturat individual, deoarece niciun plan nu vine cu cuvinte incluse: jumătate de cent per cuvânt pe Free și Storage, 0,004 $ pe Pro și 0,003 $ pe Enterprise, cu 0,99 $ ca prag. Acest lucru face ca un catalog mare să fie ușor de estimat dintr-un număr de cuvinte.
Trimiteți exportul, păstrați structura
Încărcați datele exact așa cum le-a produs sistemul dvs., alegeți limba țintă și primiți înapoi o grilă cu același număr de coloane în fiecare înregistrare și cheile încă unibile.
Partenerii Noștri
Servicii de traducere conexe
Formate de fișiere
Instrumente PDF
