Dịch giả CSV
Danh mục sản phẩm, tệp xuất và tập dữ liệu được dịch từng cột, với các dấu phân cách, dấu ngoặc kép và các cột định danh được giữ nguyên như trình phân tích của bạn mong đợi.
Tải lên hoặc kéo thả tài liệu để dịch
Dung lượng tệp tối đa 1 GB
Cấu trúc được giữ vững bởi hai ký tự
Dữ liệu phân tách bằng dấu phẩy hầu như không phải là một định dạng. Có một mô tả được tuân theo rộng rãi về phương ngữ phổ biến, nhưng không có cơ quan nào thực thi nó, vì vậy những gì bạn thực sự nhận được là một trong nhiều quy ước. Toàn bộ lưới dựa trên hai quyết định: ký tự nào phân tách các trường trong một bản ghi và chuỗi nào kết thúc một bản ghi. Sai một trong hai điều này sẽ biến một bảng gọn gàng thành một cột duy nhất bị lỗi.
Dấu phân cách không phải lúc nào cũng là dấu phẩy. Phần mềm bảng tính ở các quốc gia sử dụng dấu phẩy để viết số thập phân mặc định sử dụng dấu chấm phẩy thay thế, đó là lý do tại sao tệp xuất từ máy Đức hoặc Pháp thường không mở được một cách rõ ràng ở những nơi khác. Dấu tab và dấu gạch đứng đều được sử dụng phổ biến, thường được chọn chính xác vì nội dung chứa đầy dấu phẩy.
Mỗi bản ghi phải có cùng số trường với tiêu đề, vì số lượng đó là cách trình phân tích biết giá trị nào thuộc về cột nào. Không có gì trong dữ liệu thông báo điều này. Đó là một bất biến hoặc là đúng hoặc là im lặng dừng lại ở giữa một tệp xuất lớn, tại thời điểm đó mọi thứ bên dưới sẽ dịch sang trái một cột và trông có vẻ hợp lý.
Bốn cách văn bản dịch làm hỏng một bản ghi
Đây là những lỗi không tự thông báo. Tệp xuất vẫn mở, số lượng dòng vẫn trông tương đối đúng và lỗi sẽ xuất hiện sau đó trong bất kỳ thứ gì sử dụng dữ liệu.
- Một dấu phân cách mới xuất hiện bên trong một giá trị. Một mô tả sản phẩm tiếng Anh không có dấu phẩy sẽ trở thành một mô tả tiếng Pháp có hai dấu phẩy. Nếu trường không được đặt trong dấu ngoặc kép trước đó, thì bây giờ nó phải được đặt trong dấu ngoặc kép, nếu không trình phân tích sẽ đọc một giá trị thành ba và dịch chuyển mọi cột sau nó.
- Một dấu ngoặc kép xuất hiện bên trong một giá trị được đặt trong dấu ngoặc kép. Bên trong một trường được bao quanh, dấu ngoặc kép kép thực tế phải được viết hai lần để tự thoát. Các ngôn ngữ sử dụng dấu ngoặc kép khác nhau và bất kỳ quy trình nào chuyển đổi dấu ngoặc kép thẳng thành dấu ngoặc kép kiểu chữ đều có thể để lại một ký tự không được thoát nằm ở giữa một giá trị nơi nó kết thúc trường sớm.
- Một ngắt dòng xuất hiện trong một ô. Một bản ghi kết thúc tại một dòng mới trừ khi dòng mới đó nằm trong dấu ngoặc kép. Bản sao tiếp thị được dịch mà có thêm một ngắt đoạn sẽ chia một bản ghi thành hai, và nửa sau sẽ có số trường không chính xác.
- Một trình giữ chỗ được dịch. Các chuỗi dành cho phần mềm thường chứa các mã thông báo thay thế, một dấu phần trăm theo sau là một chữ cái, một khe được đánh số trong dấu ngoặc nhọn, một biến có tên. Chúng là địa chỉ cho các giá trị được chèn tại thời điểm chạy, không phải từ ngữ, và dịch một trong số chúng có nghĩa là giá trị đó sẽ không bao giờ xuất hiện.
Một nửa số cột của bạn không phải là ngôn ngữ
Một tập dữ liệu trộn lẫn văn xuôi dành cho con người với các khóa dành cho máy móc, và chúng nằm cạnh nhau mà không có gì phân biệt chúng ngoài tiêu đề cột. Hãy xác định cái nào là cái nào trước khi bạn bắt đầu, vì một mã định danh được dịch còn tệ hơn một mô tả không được dịch.
Để nguyên những thứ này
- Hàng tiêu đề nơi các tiêu đề là tên trường được mã sử dụng thay vì nhãn hiển thị cho người dùng
- Mã chứng khoán, số danh mục, mã định danh duy nhất và bất kỳ thứ gì được sử dụng làm khóa để nối hai tập dữ liệu
- Địa chỉ web và phần slug của nó, vì thay đổi nó sẽ làm hỏng liên kết và thứ hạng của nó
- Các giá trị trạng thái mà phần mềm so sánh với một danh sách cố định, chẳng hạn như trạng thái đơn hàng hoặc cờ có-không
- Mã quốc gia, ngôn ngữ và tiền tệ, vốn đã là các chữ viết tắt được tiêu chuẩn hóa
- Ngày tháng viết theo thứ tự năm-tháng-ngày, số và bất cứ thứ gì sẽ được phân tích thay vì đọc
Đây là những thứ bạn tìm kiếm
- Tiêu đề sản phẩm và mô tả dài, thường chiếm phần lớn số lượng từ
- Tên danh mục và bộ sưu tập khi khách hàng nhìn thấy
- Giá trị thuộc tính có ý nghĩa, chẳng hạn như màu sắc, chất liệu hoặc kích thước
- Chuỗi giao diện được trích xuất để bản địa hóa, không bao gồm các trình giữ chỗ của chúng
- Nội dung bài viết hỗ trợ, phản hồi mẫu và mẫu email được lưu trữ dưới dạng hàng
- Tiêu đề cột khi xuất được mở bởi người thay vì chương trình
Hai điều làm hỏng dữ liệu trước khi bản địa hóa bắt đầu
Mở nó trong bảng tính
Nhấp đúp vào một tệp xuất và lưu lại là cách đáng tin cậy nhất để làm hỏng danh mục. Phần mềm bảng tính đoán loại của mọi giá trị mà nó thấy, và những phỏng đoán của nó rất tự tin và sai lầm:
- Một mã bài viết mười ba chữ số biến thành ký hiệu khoa học và mất đi các chữ số cuối cùng vĩnh viễn
- Mã bưu chính bắt đầu bằng số không sẽ mất đi số không
- Bất cứ thứ gì giống như ngày và tháng đều được viết lại thành ngày theo định dạng địa phương
- Mã định danh dài hơn mười lăm chữ số sẽ bị làm tròn, một cách thầm lặng
Nếu bạn phải kiểm tra dữ liệu trước, hãy sử dụng hộp thoại nhập và đặt các cột mã định danh thành văn bản thay vì để chương trình quyết định. Tốt hơn nữa, hãy tải tệp xuất lên chính xác như hệ thống của bạn đã tạo ra nó.
Câu hỏi về dấu hiệu thứ tự byte
Không có gì bên trong dữ liệu cho biết nó sử dụng mã hóa ký tự nào, vì vậy một dấu hiệu gồm ba byte đôi khi được đặt ở đầu để báo hiệu một mã hóa. Dấu hiệu đó vừa giúp vừa hại tùy thuộc vào những gì mở dữ liệu tiếp theo.
Phần mềm bảng tính trên Windows sử dụng nó để nhận dạng nội dung Unicode, và nếu không có nó, các ký tự có dấu và không phải Latin sẽ xuất hiện dưới dạng chuỗi ký hiệu. Ngược lại, nhiều thư viện lập trình không xóa nó, vì vậy tiêu đề cột đầu tiên xuất hiện với ba ký tự vô hình dính vào phía trước và mọi tra cứu chống lại tiêu đề đó đều thất bại.
Quyết định theo đích đến: giữ dấu hiệu nếu một người sẽ mở kết quả trong bảng tính, bỏ nó đi nếu một chương trình sẽ đọc nó. Câu trả lời cho hầu hết mọi câu hỏi về các ký tự có dấu bị hỏng đều nằm ở đâu đó trong đoạn này.
Chi phí xử lý một bộ dữ liệu
Định giá theo khối lượng văn bản, vì vậy một danh mục rộng với các giá trị ngắn sẽ rẻ hơn một danh mục hẹp chứa đầy mô tả dài.
Free
Không cần thẻ để đăng ký
- Dịch thuật AI với giá 0,005 USD/từ
- 1 đô la mỗi trang cho bản quét và PDF hình ảnh
- 120+ ngôn ngữ
- Tệp lên đến 20 MB và 20 trang
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG và CSV
- Chỉ lưu trữ tệp trong 24 giờ
- Trình chỉnh sửa PDF và công cụ chuyển đổi PDF sang DOCX
- Hủy bất kỳ lúc nào
- Không bao gồm: Hỗ trợ qua email
- Không bao gồm: Truy cập nhóm
- Không bao gồm: Xem trước PDF miễn phí không giới hạn
- Không bao gồm: Thuật ngữ
Storage
hoặc 149 đô la/năm
- Dịch thuật AI với giá 0,005 USD/từ
- 1 đô la mỗi trang cho bản quét và PDF hình ảnh
- 120+ ngôn ngữ
- Tệp lên đến 100 MB và 100 trang
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG và CSV
- Lưu trữ tệp không giới hạn
- Trình chỉnh sửa PDF và công cụ chuyển đổi PDF sang DOCX
- Hỗ trợ qua email
- Hủy bất kỳ lúc nào
- Không bao gồm: Truy cập nhóm
- Không bao gồm: Xem trước PDF miễn phí không giới hạn
- Không bao gồm: Thuật ngữ
Pro
hoặc 499 đô la/năm
- Dịch thuật AI 0,004 đô la/từ
- 0,80 đô la mỗi trang cho bản quét và PDF hình ảnh
- 120+ ngôn ngữ
- Tệp lên đến 1.000 MB và 5.000 trang
- DOCX, PDF, XLSX, PPTX, IDML, TXT, JPG, PNG và CSV
- Lưu trữ tệp không giới hạn
- Trình chỉnh sửa PDF và công cụ chuyển đổi PDF sang DOCX
- Hỗ trợ qua email
- Truy cập nhóm cho tối đa 5 thành viên
- Xem trước PDF miễn phí không giới hạn
- Thuật ngữ
- Hủy bất kỳ lúc nào
Doanh nghiệp
149,99 đô la/tháng, theo yêu cầu. Dịch thuật AI với giá 0,003 đô la/từ (0,60 đô la mỗi trang), tệp lên đến 1.000 MB và 5.000 trang, lưu trữ tệp không giới hạn và truy cập nhóm cho tối đa 15 thành viên.
Hàng vào, hàng ra
Phóng to một hình thu nhỏ để so sánh một trang nguồn với kết quả của nó. Các cặp minh họa điều gì:
- Số lượng cột trên mỗi bản ghi không thay đổi từ trên xuống dưới.
- Các giá trị được đặt trong dấu ngoặc kép vẫn được đặt trong dấu ngoặc kép.
- Mã, khóa và giá trị số được truyền qua mà không bị thay đổi.
- Chỉ các cột có thể đọc được mới được trả về bằng một ngôn ngữ mới.




Không có gì ở đây được mở trong bảng tính giữa hai trạng thái.
Xem tất cả các ví dụ dịch thuật →Một quy trình làm việc tránh làm lại
Bản địa hóa một danh mục là một quy trình, và những sai lầm tốn kém đều xảy ra ở các đầu của nó thay vì ở giữa.
- 1
Xuất sạch sẽ và ghi lại phương ngữ
Lấy tệp xuất trực tiếp từ hệ thống sở hữu dữ liệu. Mở nó một lần trong trình soạn thảo văn bản thuần túy, không phải bảng tính, và ghi lại ký tự nào phân tách các trường và liệu các giá trị có được đặt trong dấu ngoặc kép hay không.
- 2
Đánh dấu các cột bạn không muốn thay đổi
Mã định danh, khóa, liên kết, giá trị trạng thái và mã. Nếu tệp xuất rất rộng, thường sẽ nhanh hơn nếu cắt nó xuống các cột chứa văn bản và nối lại bằng khóa sau đó.
- 3
Tải lên và chọn ngôn ngữ của bạn
Tạo tài khoản bằng địa chỉ email, thả dữ liệu vào, và đặt nguồn và đích. Tệp tải lên có dung lượng lên tới 1 GB, vì vậy toàn bộ danh mục sẽ được xử lý như một tác vụ thay vì chia thành nhiều lô.
- 4
Nhập lại vào bản sao tạm thời trước
Tải kết quả vào môi trường thử nghiệm trước khi đưa vào sản xuất. Kiểm tra số lượng bản ghi so với bản gốc, xem các giá trị được dịch dài nhất để phát hiện sự cố bố cục và xác nhận các ký tự có dấu đã được giữ nguyên.
Câu hỏi từ những người có bộ dữ liệu
Dấu phân cách có thay đổi nếu tôi dịch sang ngôn ngữ sử dụng dấu phẩy thập phân không?
Dấu phân cách bạn đã tải lên là dấu phân cách bạn nhận lại. Thay đổi nó sẽ có nghĩa là viết lại cấu trúc thay vì nội dung, và nó sẽ làm hỏng bất cứ thứ gì sử dụng dữ liệu ở đầu kia. Nếu bạn đặc biệt cần phiên bản phân tách bằng dấu chấm phẩy vì kết quả sẽ được mở trong bảng tính trên máy được cấu hình theo cách đó, hãy chuyển đổi nó sau khi dịch bằng một công cụ hiểu cả hai phương ngữ.
Làm thế nào để tôi ngăn mã sản phẩm và mã định danh bị dịch?
Giữ chúng trong các cột được xác định rõ ràng và, nếu có thể, chỉ gửi các cột văn bản để xử lý và nối lại sau trên khóa. Các giá trị rõ ràng là mã chứ không phải từ sẽ được giữ nguyên, nhưng cách sắp xếp an toàn nhất là cách mà sự mơ hồ không bao giờ phát sinh. Không bao giờ để bảng tính chạm vào các cột đó trong thời gian chờ đợi, vì nó sẽ định dạng lại chúng bất kể bản dịch nào.
Các ký tự có dấu của tôi trở lại thành một chuỗi các ký hiệu. Chuyện gì đã xảy ra?
Đó là sự không khớp mã hóa, không phải là vấn đề dịch thuật. Kết quả gần như chắc chắn là Unicode chính xác đang được đọc bởi một cái gì đó mong đợi mã hóa một byte cũ, hoặc ngược lại. Mở nó trong một trình soạn thảo văn bản cho phép bạn chọn mã hóa một cách rõ ràng và xác nhận những gì bạn thực sự có trước khi giả định bất cứ điều gì đã bị mất. Nếu đích là bảng tính, dấu phân cách byte ở đầu thường là thứ quyết định nó.
Điều gì xảy ra với các giá trị chứa dấu phẩy hoặc ngắt dòng?
Chúng vẫn được bao bọc. Bất kỳ giá trị nào chứa dấu phân cách, dấu ngoặc kép hoặc ngắt dòng đều phải được đặt trong dấu ngoặc kép, và dấu ngoặc kép thực bên trong giá trị đó phải được nhân đôi. Bởi vì văn bản được dịch có thể có dấu câu mà bản gốc không có, việc bao bọc đó phải được áp dụng cho kết quả thay vì sao chép từ nguồn.
Các trình giữ chỗ và mã thông báo biến có tồn tại không?
Chúng nên có, và đáng để kiểm tra một mẫu. Các mã thông báo như dấu phần trăm theo sau là một chữ cái, một vị trí được đánh số trong dấu ngoặc nhọn hoặc một biến có tên là địa chỉ cho các giá trị được chèn vào tại thời điểm chạy. Dịch một trong số chúng có nghĩa là giá trị sẽ không bao giờ hiển thị trên màn hình, vì vậy hãy quét một vài chuỗi giao diện dài nhất trong kết quả trước khi gửi.
Các chuỗi của tôi dài hơn nhiều trong tiếng Đức. Điều đó có quan trọng ở đây không?
Không phải đối với bản thân dữ liệu, vốn không có chiều rộng. Nó quan trọng đối với bất cứ thứ gì hiển thị nó. Sự mở rộng từ một phần năm đến một phần ba so với tiếng Anh là bình thường đối với tiếng Đức và tiếng Nga, trong khi tiếng Trung và tiếng Nhật thường co lại. Sắp xếp cột đã dịch theo độ dài và xem các trường hợp ngoại lệ so với bố cục của bạn, và kiểm tra bất kỳ cột cơ sở dữ liệu nào có giới hạn ký tự cố định.
Tôi có thể gửi bao nhiêu bộ dữ liệu trong một lần?
Tối đa 1 GB, hoặc năm nghìn trang nội dung tương đương, trên các gói Pro và Enterprise. Điều đó bao gồm các danh mục với hàng trăm nghìn dòng. Gửi toàn bộ dưới dạng một tác vụ cũng tốt hơn cho tính nhất quán, vì một thuật ngữ xuất hiện ở hàng 12 và hàng 90.000 được xử lý theo cùng một cách.
Tôi bị tính phí gì cho một bản xuất lớn?
Văn bản, không phải lưới. Các ô trống, cột số và cột định danh không phải là văn xuôi. Mỗi tệp được tính phí riêng, vì không có gói nào đi kèm với các từ được đóng gói: nửa xu cho mỗi từ trên Free và Storage, 0,004 đô la trên Pro và 0,003 đô la trên Enterprise, với 0,99 đô la làm sàn. Điều đó làm cho một danh mục lớn dễ dàng ước tính từ số lượng từ.
Gửi bản xuất, giữ nguyên cấu trúc
Tải dữ liệu lên chính xác như hệ thống của bạn đã tạo ra, chọn ngôn ngữ đích và nhận lại một bảng tính với cùng số lượng cột trong mỗi bản ghi và các khóa vẫn có thể nối với nhau.
Đối tác của chúng tôi
Dịch vụ dịch thuật liên quan
Định dạng tệp
Công cụ PDF
