Преводач на CSV
Продуктови каталози, експорти и набори от данни, преведени колона по колона, като разделителите, кавичките и идентификационните колони остават точно както вашият парсер очаква да ги намери.
Качете или пуснете документ за превод
Макс. размер на файла 1 GB
Структурата се поддържа от два знака
Стойности, разделени със запетая, едва ли са формат. Има широко следвано описание на общия диалект, но никой не го налага, така че това, което всъщност получавате, е една от няколко конвенции. Цялата мрежа почива на две решения: кой знак разделя полетата в запис и коя последователност завършва запис. Объркайте едно от двете и спретната таблица се превръща в една назъбена колона.
Разделителят не винаги е запетая. Софтуерът за електронни таблици в страни, които пишат десетични знаци със запетая, по подразбиране използва точка и запетая, което е причината експорт от немска или френска машина често да не се отваря правилно другаде. Табулациите и вертикалните черти също са често използвани, обикновено избрани точно защото съдържанието е пълно със запетаи.
Всеки запис трябва да съдържа същия брой полета като заглавката, защото този брой е начинът, по който парсерът знае коя стойност принадлежи на коя колона. Нищо в данните не обявява това. Това е инвариант, който или се спазва, или тихо спира да се спазва по средата на голям експорт, в който момент всичко по-долу се измества с една колона наляво и изглежда правдоподобно.
Четири начина, по които преведеният текст разваля запис
Това са грешките, които не се обявяват. Експортът все още се отваря, броят на редовете все още изглежда приблизително правилен, а щетите се появяват по-късно в това, което консумира данните.
- Нов разделител се появява вътре в стойност. Английско описание на продукт без запетаи става френско с две. Ако полето не е било оградено с кавички преди, сега трябва да бъде, иначе парсерът чете една стойност като три и измества всяка колона след нея.
- Кавичка попада вътре в оградена стойност. Вътре в оградено поле, буквална двойна кавичка трябва да се напише два пъти, за да се избяга сама. Езици, които ограждат с различни знаци, и всеки процес, който преобразува прави кавички в типографски, могат да оставят неограден знак в средата на стойност, където той преждевременно завършва полето.
- Редов прекъсване се прокрадва в клетка. Записът завършва на нов ред, освен ако този нов ред не е вътре в кавички. Преведен маркетингов текст, който получава прекъсване на параграф, ще раздели един запис на два, а втората половина ще има грешен брой полета.
- Превежда се заместител. Низове, предназначени за софтуер, често съдържат заместители, процентен знак, последван от буква, номериран слот в скоби, именувана променлива. Те са адреси за стойности, вмъкнати по време на изпълнение, а не думи, и превеждането на един означава, че стойността никога не се появява.
Половината от вашите колони не са език
Набор от данни смесва проза, предназначена за хора, с ключове, предназначени за машини, и те стоят един до друг без нищо, което да ги различава, освен заглавката на колоната. Разберете кое кое е, преди да започнете, защото преведен идентификатор е по-лош от непреведен описание.
Оставете тези на мира
- Редът със заглавките, където заглавията са имена на полета, използвани от код, а не етикети, показвани на човек
- Кодове на артикули, номера на каталози, уникални идентификатори и всичко използвано като ключ за свързване на два набора от данни
- Уеб адреси и частта от slug на такъв, тъй като промяната му прекъсва връзката и нейното класиране
- Стойности на състоянието, които софтуерът сравнява с фиксиран списък, като състояние на поръчка или флаг да/не
- Кодове на държави, езици и валути, които вече са стандартизирани съкращения
- Дати, написани във формат година-месец-ден, числа и всичко, което ще бъде анализирано, а не прочетено
Това са тези, за които сте дошли
- Заглавия на продукти и дълги описания, които обикновено представляват по-голямата част от броя думи
- Имена на категории и колекции, както ги виждат клиентите
- Стойности на атрибути със значение, като цвят, материал или дума за размер
- Низoве от интерфейса, извлечени за локализация, без техните плейсхолдъри
- Тяло на статии за поддръжка, готови отговори и шаблони за имейли, съхранявани като редове
- Заглавия на колони, когато експортът е предназначен да бъде отворен от човек, а не от програма
Две неща, които увреждат данните, преди преводът дори да започне
Отваряне в електронна таблица
Двойното кликване върху експорт и повторното му записване е най-надеждният начин за повреждане на каталог. Софтуерът за електронни таблици предполага типа на всяка стойност, която вижда, и неговите предположения са уверени и грешни:
- Артикулен номер от тринадесет цифри се превръща в научна нотация и губи последните си цифри завинаги
- Пощенски код, започващ с нула, губи нулата
- Всичко, което прилича на ден и месец, се пренаписва като дата в местния формат
- Дълги идентификатори над петнадесет цифри се закръглят, без предупреждение
Ако трябва първо да инспектирате данните, използвайте диалоговия прозорец за импортиране и задайте колоните с идентификатори като текст, вместо да оставяте програмата да решава. Още по-добре, качете експорта точно както вашата система го е произвела.
Въпросът за маркера за ред на байтовете
Нищо в данните не показва кой кодиране на символи използва, така че маркер от три байта понякога се поставя в самото начало, за да сигнализира едно. Този маркер помага и вреди в зависимост от това какво отваря данните след това.
Софтуерът за електронни таблици в Windows го използва, за да разпознава Unicode съдържание, а без него акцентираните и нелатинските символи излизат като низове от символи. Много програмни библиотеки, напротив, не го премахват, така че първото заглавие на колона пристига с три невидими символа, залепени отпред, и всяко търсене спрямо това заглавие се проваля.
Решете според дестинацията: запазете маркера, ако човек ще отвори резултата в електронна таблица, премахнете го, ако програма ще го чете. Отговорът на почти всеки въпрос за повредени акцентирани символи се намира някъде в този параграф.
Колко струва обработката на набор от данни
Ценообразуване по обем на текст, така че широк каталог с кратки стойности е по-евтин от тесен такъв, пълен с дълги описания.
Free
Не е необходима карта за регистрация
- 0,005 $/дума AI превод
- $1 на страница за сканирани и изображения PDF файлове
- 120+ езика
- Файлове до 20 MB и 20 страници
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG и CSV
- Само 24-часово съхранение на файлове
- PDF редактор и PDF към DOCX конвертор
- Отказ по всяко време
- Не е включено: Имейл поддръжка
- Не е включено: Екипен достъп
- Не е включено: Неограничени безплатни PDF прегледи
- Не е включено: Речник
Storage
или $149/година
- 0,005 $/дума AI превод
- $1 на страница за сканирани и изображения PDF файлове
- 120+ езика
- Файлове до 100 MB и 100 страници
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG и CSV
- Неограничено съхранение на файлове
- PDF редактор и PDF към DOCX конвертор
- Поддръжка по имейл
- Отказ по всяко време
- Не е включено: Екипен достъп
- Не е включено: Неограничени безплатни PDF прегледи
- Не е включено: Речник
Pro
или $499/година
- $0.004 на дума AI превод
- $0.80 на страница за сканирани и изображения PDF файлове
- 120+ езика
- Файлове до 1000 MB и 5000 страници
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG и CSV
- Неограничено съхранение на файлове
- PDF редактор и PDF към DOCX конвертор
- Поддръжка по имейл
- Екипен достъп за до 5 членове
- Неограничени безплатни PDF прегледи
- Речник
- Отказ по всяко време
За бизнеса
$149.99/месец, при поискване. AI превод на цена $0.003/дума ($0.60 на страница), файлове до 1000 MB и 5000 страници, неограничено съхранение на файлове и екипен достъп за до 15 членове.
Редове вътре, редове вън
Увеличете миниатюра, за да сравните изходна страница с нейния резултат. Какво показват двойките:
- Броят колони на запис остава непроменен отгоре надолу.
- Стойностите, които бяха оградени с кавички, все още са оградени.
- Кодове, ключове и числови стойности преминават непроменени.
- Само колоните, четими от хора, се връщат на нов език.




Нищо тук не беше отворено в електронна таблица между двете състояния.
Вижте всички примерни преводи →Работен ред, който избягва преработка
Локализацията на каталог е конвейер и скъпите грешки се случват в краищата му, а не в средата.
- 1
Експортирайте чисто и отбележете диалекта
Вземете експорта директно от системата, която притежава данните. Отворете го веднъж в обикновен текстов редактор, не в електронен табличен процесор, и отбележете кой символ разделя полетата и дали стойностите са оградени с кавички.
- 2
Маркирайте колоните, които не искате да бъдат докосвани
Идентификатори, ключове, връзки, стойности на състоянието и кодове. Ако експортът е много широк, често е по-бързо да го намалите до колоните, които съдържат проза, и да ги съедините отново по ключа след това.
- 3
Качване и избор на езици
Създайте акаунт с имейл адрес, пуснете данните и задайте изходен и целеви език. Качванията са до 1 GB, така че пълен каталог се обработва като една задача, вместо да се разделя на партиди.
- 4
Преимпортиране първо в тестова версия
Заредете резултата в тестова среда преди продукция. Проверете броя на записите спрямо оригинала, разгледайте най-дългите преведени стойности за проблеми с оформлението и потвърдете, че акцентираните символи са оцелели пътуването.
Въпроси от хора с набори от данни
Променя ли се разделителят, ако превеждам на език, който използва десетични запетаи?
Разделителят, който сте използвали при качване, е разделителят, който получавате обратно. Промяната му би означавала пренаписване на структурата, а не на съдържанието, и би нарушила всичко, което консумира данните в другия край. Ако конкретно се нуждаете от версия, разделена със semicolon, защото резултатът ще бъде отворен в електронна таблица на компютър, конфигуриран по този начин, конвертирайте го след превода с инструмент, който разбира и двата диалекта.
Как да предотвратя превода на продуктови кодове и идентификатори?
Дръжте ги в ясно обозначени колони и, където е възможно, изпратете само колоните с текст за обработка и ги съединете отново по ключа след това. Стойности, които очевидно са кодове, а не думи, се оставят както са, но най-сигурната подредба е тази, при която двусмислието никога не възниква. Никога не позволявайте на електронна таблица да докосва тези колони междувременно, защото тя ще ги преформатира независимо от превода.
Моите символи с ударение се върнаха като низове от символи. Какво се случи?
Това е несъответствие в кодирането, а не проблем с превода. Резултатът е почти сигурно правилен Unicode, който се чете от нещо, очакващо старо кодиране с една байт, или обратното. Отворете го в текстов редактор, който ви позволява изрично да изберете кодирането и потвърдете какво точно имате, преди да приемете, че нещо е загубено. Ако крайната цел е електронна таблица, маркерът за ред на байтовете в началото обикновено решава това.
Какво се случва със стойности, които съдържат запетаи или нови редове?
Те остават оградени. Всяка стойност, съдържаща разделителя, кавички или нов ред, трябва да бъде оградена с кавички, а буквална кавичка в такава стойност трябва да бъде удвоена. Тъй като преведеният текст може да придобие пунктуация, която оригиналът не е имал, това ограждане трябва да се приложи към резултата, вместо да се копира от източника.
Ще оцелеят ли плейсхолдърите и променливите токени?
Трябва да оцелеят и си струва да се провери мостра. Токени като знак за процент, последван от буква, номериран слот в скоби или именувана променлива са адреси за стойности, които се поставят по време на изпълнение. Превеждането на един означава, че стойността никога не достига екрана, така че прегледайте няколко от най-дългите низове в интерфейса в изхода, преди да изпратите.
Моите низове стават много по-дълги на немски. Има ли значение това тук?
Не за самите данни, които нямат ширина. Има значение за това, което ги показва. Разширяването от една пета до една трета спрямо английския е нормално за немски и руски, докато китайският и японският обикновено се свиват. Сортирайте преведената колона по дължина и разгледайте крайностите спрямо собственото си оформление и проверете всяка колона в базата данни с фиксиран лимит на символите.
Колко голям набор от данни мога да изпратя наведнъж?
До 1 GB, или пет хиляди страници еквивалентно съдържание, при плановете Pro и Enterprise. Това покрива каталози със стотици хиляди редове. Изпращането на цялото като една задача е също по-добро за последователност, тъй като термин, който се появява в ред 12 и ред 90 000, се обработва по същия начин.
За какво се таксувам при широк експорт?
Текстът, а не таблицата. Празните клетки, числовите колони и идентификационните колони не са проза. Всеки файл се таксува самостоятелно, тъй като никой план не идва с включени думи: половин цент на дума при Free и Storage, $0.004 при Pro и $0.003 при Enterprise, с минимум $0.99. Това прави големия каталог лесен за оценка от броя на думите.
Изпратете експорта, запазете структурата
Качете данните точно както ги е произвела вашата система, изберете целевия език и получете обратно таблица със същия брой колони във всеки запис и ключове, които все още могат да бъдат свързани.
Нашите партньори
Свързани услуги за превод
Файлови формати
PDF инструменти
