מתרגם CSV
קטלוגי מוצרים, ייצוא וערכות נתונים מתורגמים עמודה אחר עמודה, כאשר המפרידים, התחימה ועמודי המזהים נשארים בדיוק כפי שמנתח הנתונים שלך מצפה למצוא אותם.
העלה או גרור ושחרר מסמך לתרגום
גודל קובץ מקסימלי 1 GB
המבנה נתמך על ידי שני תווים
ערכים מופרדים בפסיק הם בקושי פורמט. יש תיאור שעוקב אחריו באופן נרחב של הניב הנפוץ, אך אין סמכות שאוכפת אותו, כך שמה שאתה מקבל בפועל הוא אחד מכמה מוסכמות. כל הרשת נשענת על שתי החלטות: איזה תו מפריד בין השדות ברשומה, ואיזה רצף מסיים רשומה. טעה באחת מהן והטבלה המסודרת הופכת לעמודה אחת לא מסודרת.
המפריד אינו תמיד פסיק. תוכנות גיליונות אלקטרוניים במדינות שכותבות עשרונים עם פסיק, משתמשות כברירת מחדל בנקודה-פסיק במקום זאת, וזו הסיבה שייצוא ממכונה גרמנית או צרפתית לעיתים קרובות מסרב להיפתח בצורה נקייה במקומות אחרים. טאבים וקו אנכי נמצאים שניהם בשימוש נפוץ, בדרך כלל נבחרים בדיוק בגלל שהתוכן מלא בפסיקים.
כל רשומה חייבת לשאת את אותו מספר שדות כמו הכותרת, מכיוון שספירה זו היא כיצד מנתח הנתונים יודע לאיזו עמודה שייך כל ערך. שום דבר בנתונים לא מכריז על כך. זהו קבוע שאו מחזיק מעמד או מפסיק להחזיק מעמד בשקט באמצע ייצוא גדול, ובנקודה זו כל מה שמתחת מוזז עמודה אחת שמאלה ונראה סביר.
ארבע דרכים בהן טקסט מתורגם שובר רשומה
אלו הן הכשלים שאינם מודיעים על עצמם. הייצוא עדיין נפתח, ספירת השורות עדיין נראית בערך נכונה, והנזק מופיע מאוחר יותר בכל דבר שצורך את הנתונים.
- מופיע מפריד חדש בתוך ערך. תיאור מוצר באנגלית ללא פסיקים הופך לתיאור בצרפתית עם שניים. אם השדה לא היה מוקף קודם לכן, הוא חייב להיות כעת, אחרת מנתח הנתונים קורא ערך אחד כשלושה ומזיז כל עמודה שאחריו.
- סימן מרכאות נוחת בתוך ערך מוקף. בתוך שדה סגור, סימן מרכאות כפול מילולי חייב להיכתב פעמיים כדי לברוח מעצמו. שפות שמקיפות בסימנים שונים, וכל תהליך שממיר סימנים ישרים לסימנים טיפוגרפיים, יכולים להשאיר תו לא מפלט יושב באמצע ערך שבו הוא מסיים את השדה מוקדם.
- מעבר שורה זוחל לתא. רשומה מסתיימת במעבר שורה אלא אם כן מעבר שורה זה יושב בתוך מרכאות. טקסט שיווקי מתורגם שמקבל מעבר פסקאות יפצל רשומה אחת לשתיים, ולחצי השני יהיה מספר שגוי של שדות.
- מזהה מוחלף מתורגם. מחרוזות המיועדות לתוכנה מכילות לעיתים קרובות אסימוני החלפה, סימן אחוז ואחריו אות, חריץ ממוספר בסוגריים מסולסלים, משתנה בשם. הם כתובות לערכים המוחדרים בזמן ריצה, לא מילים, ותרגום אחד פירושו שהערך לעולם לא יופיע.
חצי מהעמודות שלך אינן שפה
ערכת נתונים מערבבת פרוזה המיועדת לבני אדם עם מפתחות המיועדים למכונות, והם יושבים זה לצד זה ללא שום דבר להבדיל ביניהם מלבד כותרת העמודה. קבע איזה הוא איזה לפני שתתחיל, מכיוון שמזהה מתורגם גרוע יותר מתיאור לא מתורגם.
השאר את אלה לבד
- שורה הכותרת עצמה שבה הכותרות הן שמות שדות המשמשים קוד ולא תוויות המוצגות לאדם
- קודי מלאי, מספרי קטלוג, מזהים ייחודיים וכל דבר המשמש כמפתח לצירוף שתי ערכות נתונים
- כתובות אתרים וחלק ה-slug של אחד מהם, מכיוון ששינוי שלו שובר את הקישור ואת הדירוג שלו
- ערכי סטטוס שתוכנה משווה מול רשימה קבועה, כמו מצב הזמנה או דגל של כן/לא
- קודי מדינה, שפה ומטבע, שהם כבר קיצורים סטנדרטיים
- תאריכים הכתובים בסדר שנה-חודש-יום, מספרים, וכל דבר שייקרא ולא ייקרא
אלה הדברים שבשבילם באתם
- שמות מוצרים ותיאורים ארוכים, שהם בדרך כלל עיקר כמות המילים
- שמות קטגוריות ואוספים כפי שלקוחות רואים אותם
- ערכי תכונות עם משמעות, כמו צבע, חומר או מילת גודל
- מחרוזות ממשק שנשלפו ללוקליזציה, בניכוי הפלייסהולדרים שלהם
- גופי מאמרי תמיכה, תשובות מוכנות ותבניות אימייל המוחזקים כשורות
- כותרות עמודות כאשר הייצוא מיועד להיפתח על ידי אדם ולא על ידי תוכנית
שני דברים שפוגעים בנתונים לפני שהלוקליזציה מתחילה בכלל
פתיחה בגיליון אלקטרוני
לחיצה כפולה על ייצוא ושמירה מחדש שלו היא הדרך האמינה ביותר להשחית קטלוג. תוכנת גיליונות אלקטרוניים מנחשת את סוג כל ערך שהיא רואה, והניחושים שלה בטוחים ושגויים:
- מספר מאמר בן שלוש עשרה ספרות הופך לרישום מדעי ומאבד את הספרות האחרונות שלו לצמיתות
- מיקוד שמתחיל באפס מאבד את האפס
- כל דבר הדומה ליום וחודש נכתב מחדש כתאריך בפורמט המקומי
- מזהים ארוכים מעבר לחמש עשרה ספרות מעוגלים, בשקט
אם אתם חייבים לבדוק את הנתונים תחילה, השתמשו בדיאלוג הייבוא והגדירו את עמודות המזהים כטקסט במקום לאפשר לתוכנית להחליט. עדיף אף יותר, העלו את הייצוא בדיוק כפי שמערכתכם הפיקה אותו.
שאלת ה-Byte Order Mark
שום דבר בתוך הנתונים לא אומר באיזו קידוד תווים הוא משתמש, לכן לעיתים מציבים סימן של שלושה בתים ממש בהתחלה כדי לאותת על אחד. הסימן הזה עוזר ומפריע תלוי במה פותח את הנתונים הבאים.
תוכנת גיליונות אלקטרוניים ב-Windows משתמשת בו כדי לזהות תוכן Unicode, ובלי זה תווים עם סימנים דיאקריטיים ולא לטיניים יוצאים כמחרוזות של סמלים. ספריות תכנות רבות, לעומת זאת, לא מסירות אותו, כך שכותרת העמודה הראשונה מגיעה עם שלושה תווים בלתי נראים מודבקים לחזית וכל חיפוש מול הכותרת הזו נכשל.
החליטו לפי יעד: שמרו את הסימן אם אדם יפתח את התוצאה בגיליון אלקטרוני, הסירו אותו אם תוכנית תקרא אותו. התשובה כמעט לכל שאלה לגבי תווים עם סימנים דיאקריטיים פגומים נמצאת איפשהו בפסקה זו.
כמה עולה עיבוד מערך נתונים
תמחור לפי נפח טקסט, כך שקטלוג רחב עם ערכים קצרים זול יותר מאשר קטלוג צר מלא בתיאורים ארוכים.
Free
אין צורך בכרטיס אשראי להרשמה
- תרגום AI ב-$0.005 למילה
- $1 לדף עבור סריקות וקובצי PDF מתמונות
- 120+ שפות
- קבצים עד 20 MB ו-20 עמודים
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG ו-CSV
- אחסון קבצים למשך 24 שעות בלבד
- עורך PDF וממיר PDF ל-DOCX
- בטל בכל עת
- לא כלול: תמיכה בדוא"ל
- לא כלול: גישת צוות
- לא כלול: תצוגה מקדימה חינם ללא הגבלה של קובצי PDF
- לא כלול: מילון מונחים
Storage
או 149$ לשנה
- תרגום AI ב-$0.005 למילה
- $1 לדף עבור סריקות וקובצי PDF מתמונות
- 120+ שפות
- קבצים עד 100 MB ו-100 עמודים
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG ו-CSV
- אחסון קבצים ללא הגבלה
- עורך PDF וממיר PDF ל-DOCX
- תמיכה בדוא"ל
- בטל בכל עת
- לא כלול: גישת צוות
- לא כלול: תצוגה מקדימה חינם ללא הגבלה של קובצי PDF
- לא כלול: מילון מונחים
Pro
או 499$ לשנה
- תרגום AI בעלות 0.004$ למילה
- 0.80$ לדף עבור סריקות וקובצי PDF מתמונות
- 120+ שפות
- קבצים עד 1,000 MB ו-5,000 עמודים
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG ו-CSV
- אחסון קבצים ללא הגבלה
- עורך PDF וממיר PDF ל-DOCX
- תמיכה בדוא"ל
- גישת צוות לעד 5 חברים
- תצוגה מקדימה חינם ללא הגבלה של קובצי PDF
- מילון מונחים
- בטל בכל עת
ארגוני
149.99$ לחודש, לפי דרישה. תרגום AI בעלות 0.003$ למילה (0.60$ לדף), קבצים עד 1,000 MB ו-5,000 עמודים, אחסון קבצים ללא הגבלה וגישת צוות לעד 15 חברים.
שורות פנימה, שורות החוצה
הגדל תמונה ממוזערת כדי להשוות דף מקור עם התוצאה שלו. מה שהזוגות מדגימים:
- מספר העמודות לכל רשומה ללא שינוי מלמעלה למטה.
- ערכים שהיו מוקפים במרכאות עדיין מוקפים.
- קודי, מפתחות וערכים מספריים עוברים ללא שינוי.
- רק העמודות הקריאות לאדם חוזרות בשפה חדשה.




שום דבר כאן לא נפתח בגיליון אלקטרוני בין שני המצבים.
ראו את כל דוגמאות התרגום →תהליך עבודה שמונע עבודה חוזרת
לוקליזציה של קטלוג היא צינור, והטעויות היקרות כולן קורות בקצוות שלו ולא באמצע.
- 1
ייצא בצורה נקייה וציין את הניב
קח את הייצוא ישר מהמערכת שבבעלותה הנתונים. פתח אותו פעם אחת בעורך טקסט פשוט, לא בגיליון אלקטרוני, וציין איזה תו מפריד בין השדות והאם ערכים מוקפים במרכאות.
- 2
סמן את העמודות שאתה לא רוצה שיגעו בהן
מזהים, מפתחות, קישורים, ערכי סטטוס וקודים. אם הייצוא רחב מאוד, לעיתים קרובות מהיר יותר לצמצם אותו לעמודות המכילות טקסט ולחבר מחדש לפי המפתח לאחר מכן.
- 3
העלה ובחר את השפות שלך
צור חשבון עם כתובת דוא"ל, זרוק את הנתונים פנימה, והגדר את המקור והיעד. העלאות מגיעות עד 1 GB, כך שקטלוג מלא עובר כמשימה אחת במקום להתפצל לאצוות.
- 4
יבא מחדש לסביבת בדיקה תחילה
טען את התוצאה לסביבת בדיקה לפני הייצור. בדוק את ספירת הרשומות מול המקור, הסתכל על הערכים המתורגמים הארוכים ביותר לבעיות פריסה, וודא שהתווים עם סימנים דיאקריטיים שרדו את המסע.
שאלות מאנשים עם מערכי נתונים
האם המפריד משתנה אם אני מתרגם לשפה שמשתמשת בפסיק עשרוני?
המפריד שהעלית איתו הוא המפריד שתקבל בחזרה. שינויו יגרום לכתיבה מחדש של המבנה ולא התוכן, והוא ישבור כל דבר שצורך את הנתונים בצד השני. אם אתה זקוק במיוחד לגרסה מופרדת בנקודה-פסיק מכיוון שהתוצאה תיפתח בגיליון אלקטרוני במחשב שהוגדר כך, המר אותה לאחר התרגום באמצעות כלי שמבין את שתי הניבים.
כיצד אני מונע מתרגום של קודי מוצר ומזהים?
שמור אותם בעמודות מזוהות בבירור, ובמידת האפשר, שלח רק את עמודות הפרוזה לעיבוד וחבר מחדש לפי המפתח לאחר מכן. ערכים שהם בבירור קודים ולא מילים נשארים כפי שהם, אך הסידור הבטוח ביותר הוא זה שבו אי-הבהירות לעולם אינה מתעוררת. לעולם אל תיתן לגיליון אלקטרוני לגעת בעמודות אלו בינתיים, מכיוון שהוא יעצב אותן מחדש ללא קשר לתרגום כלשהו.
התווים עם סימני הדיאקריטיים שלי חזרו כמחרוזות של סמלים. מה קרה?
זו אי-התאמה בקידוד, לא בעיית תרגום. התוצאה היא כמעט בוודאות Unicode נכון הנקרא על ידי משהו שמצפה לקידוד חד-בית מורשת, או להיפך. פתח אותו בעורך טקסט המאפשר לך לבחור את הקידוד במפורש וודא מה יש לך בפועל לפני שתניח שמשהו אבד. אם גיליון אלקטרוני הוא היעד, סמן סדר בתים בתחילת הקובץ הוא בדרך כלל מה שמחליט זאת.
מה קורה לערכים המכילים פסיקים או שורות חדשות?
הם נשארים כלואים. כל ערך המכיל את המפריד, מירכאות או שורה חדשה חייב להיות עטוף במרכאות, ומרכאות מילוליות בתוך ערך כזה חייבות להיות מוכפלות. מכיוון שטקסט מתורגם יכול לרכוש סימני פיסוק שהמקור לא היה בו, יש ליישם את הכליאה הזו על התוצאה במקום להעתיק אותה מהמקור.
האם פלייסהולדרים וטוקנים משתנים ישרדו?
הם אמורים, וכדאי לבדוק דגימה. טוקנים כמו סימן אחוז ואחריו אות, חריץ ממוספר בסוגריים מסולסלים או משתנה בשם הם כתובות לערכים שמוכנסים בזמן ריצה. תרגום אחד מהם פירושו שהערך לעולם לא יגיע למסך, אז סרוק חופן מהמחרוזות הארוכות ביותר בממשק בפלט לפני המשלוח.
המחרוזות שלי מתארכות מאוד בגרמנית. האם זה משנה כאן?
לא לנתונים עצמם, שאין להם רוחב. זה משנה לכל מה שמציג אותם. התרחבות של חמישית עד שליש מעבר לאנגלית היא נורמלית לגרמנית ורוסית, בעוד שסינית ויפנית בדרך כלל מתכווצות. מיין את העמודה המתורגמת לפי אורך והסתכל על הקיצוניים מול הפריסה שלך, ובדוק כל עמודת מסד נתונים עם מגבלת תווים קבועה.
כמה גדול מערך נתונים אני יכול לשלוח בבת אחת?
עד 1 GB, או חמשת אלפים עמודים של תוכן שווה ערך, בתוכניות Pro ו-Enterprise. זה מכסה קטלוגים במאות אלפי שורות. שליחת כל הדבר כמשימה אחת טובה יותר גם לעקביות, מכיוון שמונח המופיע בשורה 12 ובשורה 90,000 מטופל באותה צורה.
על מה אני מחויב בייצוא רחב?
הטקסט, לא הרשת. תאים ריקים, עמודות מספריות ועמודות מזהה אינם פרוזה. כל קובץ מחויב בפני עצמו, מכיוון שאף תוכנית אינה מגיעה עם מילים ארוזות: חצי סנט למילה ב-Free ו-Storage, 0.004$ ב-Pro ו-0.003$ ב-Enterprise, עם 0.99$ כרצפה. זה הופך קטלוג גדול לקל לאומדן מספירת מילים.
שלח את הייצוא, שמור על המבנה
העלה את הנתונים בדיוק כפי שהמערכת שלך הפיקה אותם, בחר את שפת היעד, וקבל בחזרה טבלה עם אותו מספר עמודות בכל רשומה והמפתחות עדיין ניתנים לחיבור.
השותפים שלנו
שירותי תרגום קשורים
פורמטים של קבצים
כלי PDF
