Nasza własna technologia tłumaczenia dokumentów
DocTranslator AI Engine
DocTranslator AI Engine to technologia tłumaczenia dokumentów, którą sami rozwijamy. Tam, gdzie większość narzędzi tłumaczeniowych pracuje z czystym tekstem, to narzędzie pracuje ze stroną: znajduje, gdzie znajduje się każda linia, tłumaczy ją i zapisuje tłumaczenie z powrotem w tym samym miejscu, dzięki czemu pobrany plik ma układ pliku, który został przesłany.
Został zaprojektowany i napisany przez zespół DocTranslator.
Jak to działa
Cztery etapy od przesłania do gotowego pliku
- 01
Odczyt
Odczytaj plik
Silnik rozpoznaje rodzaj pliku na podstawie jego zawartości, a nie nazwy: PDF z warstwą tekstową, skan, zdjęcie czy dokument Office. Każdy rodzaj przechodzi inną ścieżką.
- 02
Oddziel
Oddzielenie słów od strony
Wyodrębniany jest tylko tekst. Obrazy, schematy, wykresy, zdjęcia, podpisy i pieczęcie pozostają na swoich miejscach i nigdy nie są wysyłane do tłumaczenia.
- 03
Przetłumacz
Tłumaczenie i weryfikacja
Każdy fragment jest tłumaczony i weryfikowany przed zaakceptowaniem. Fragment, który nie przejdzie weryfikacji, jest tłumaczony ponownie.
- 04
Odbuduj
Odtworzenie strony
Tłumaczenie wraca na swoje pierwotne pozycje, ustawione czcionkami zawierającymi znaki języka docelowego.
A · Cyfrowe pliki PDF
Pliki PDF z warstwą tekstową
W pliku PDF wyeksportowanym z programu Word, InDesign lub podobnego, silnik odczytuje tekst blok po bloku i komórka tabeli po komórce. Łączy linie akapitu w jeden fragment przed tłumaczeniem, dzięki czemu zdanie, które przechodzi przez trzy linie, jest tłumaczone jako jedno zdanie, a nie trzy fragmenty. Następnie usuwa oryginalne słowa ze strony, pozostawia obrazy, schematy i rysunki wektorowe nietknięte i zapisuje tłumaczenie w tym samym polu.
Tłumaczenie rzadko ma tę samą długość co oryginał. Niemiecki i rosyjski zazwyczaj są dłuższe niż angielski, a chiński i japoński zajmują mniej znaków. Silnik pozwala tekstowi zawijać się w obrębie oryginalnego bloku i zmniejsza rozmiar czcionki tylko wtedy, gdy tłumaczenie nadal się nie mieści. Komórki tabeli są obsługiwane pojedynczo, dzięki czemu liczby pozostają w swoich wierszach i kolumnach.
B · Skanowanie i zdjęcia
Skanowanie i zdjęcia
Skanowana strona to obraz, więc nie ma w niej tekstu do zastąpienia. Silnik zachowuje oryginalny obraz jako tło strony, rozpoznaje wydrukowany tekst za pomocą OCR, a następnie usuwa tylko tusz tych liter, wypełniając każdą plamę kolorem otaczającego papieru. Wszystko, co nie jest tekstem ciągłym, pozostaje nietknięte. Pieczęcie, stemple, podpisy, zdjęcia, wykresy i schematy pozostają dokładnie takie, jak zostały zeskanowane, co jest pożądane na certyfikacie lub podpisanej umowie.
Tabele zachowują swój wydrukowany układ. Silnik odnajduje linie siatki oryginalnej tabeli na obrazie, czyści tekst w każdej komórce, nie dotykając obramowań, i zapisuje tłumaczenie w tej samej komórce. Linia wydrukowana bokiem wzdłuż marginesu jest zapisywana z powrotem bokiem.
Czasami linii nie można wymazać czysto, na przykład gdy tekst znajduje się na ruchliwym tle. W takim przypadku silnik pozostawia oryginalny druk na miejscu zamiast go rozmazywać i dodaje niewidzialną kopię tekstu, dzięki czemu strona nadal może być przeszukiwana.
C · Pliki strukturalne
Word, Excel, PowerPoint, EPUB i HTML
Pliki Office już oddzielają tekst od układu, więc silnik tłumaczy je od wewnątrz. Zastępuje słowa w każdym akapicie, slajdzie i komórce arkusza kalkulacyjnego, zachowując formatowanie pogrubione, kursywę i inne formatowanie przy słowach, do których należało, nawet gdy tłumaczenie zmienia kolejność tych słów.
Książki EPUB i strony HTML są tłumaczone tekst po tekście, a ich znaczniki pozostają takie, jakie były, dzięki czemu rozdziały, nagłówki i linki działają w przetłumaczonej kopii.
ENThe report is ready today.
↓
DEDer Bericht ist heute fertig.Pogrubione słowo przenosi się na koniec niemieckiego zdania, a jego formatowanie podąża za nim.
Jakość
Sprawdzenie przed zwróceniem pliku
Tłumaczenie AI może zawieść w sposób łatwy do przeoczenia przy szybkim czytaniu, dlatego silnik sprawdza każdy fragment przed jego zaakceptowaniem:
rejectOdpowiedź, która powtarza oryginał zamiast go tłumaczyć, jest odrzucana.rejectPodobnie jak odpowiedź w złym języku, taka, która zapętla się lub kończy w połowie, oraz taka z przypadkowymi znakami z innego skryptu.retryOdrzucony fragment jest tłumaczony ponownie, najpierw wraz z otaczającymi go liniami dla kontekstu, a następnie samodzielnie.compareLiczby, adresy internetowe i adresy e-mail są porównywane między oryginałem a tłumaczeniem, dzięki czemu zmieniona liczba jest oznaczana.reuseZdanie, które pojawia się na kilku stronach, jest tłumaczone raz, dzięki czemu nagłówek lub termin brzmi tak samo w całym dokumencie.discardJeśli duża część dokumentu wróci nieprzetłumaczona, silnik odrzuca ten wynik, zamiast oddawać częściowo przetłumaczony plik.
Zbudowane i obsługiwane przez DocTranslator
Nasz własny kod, od odczytu strony do jej odbudowy.
Silnik jest rozwijany przez zespół DocTranslator. Analiza strony, obsługa skanów i tabel, odbudowa każdej strony oraz powyższe kontrole to nasz własny kod. Ponieważ sami piszemy silnik, problem taki jak przesunięta tabela lub brakujący znak można naprawić w samym silniku.
Tłumaczenia na chiński, japoński, koreański, hindi, tajski i inne skrypty są ustawiane w czcionkach zawierających te znaki, dzięki czemu nie otrzymujesz pustych pól tam, gdzie powinny być litery. Osadzane są tylko te znaki, których dokument faktycznie używa, co zmniejsza rozmiar pliku.
Często zadawane pytania dotyczące silnika AI DocTranslator
Czy DocTranslator AI Engine jest zbudowany przez DocTranslator?
Tak. Silnik jest rozwijany wewnętrznie przez zespół DocTranslator. Analiza strony, obsługa skanów, rekonstrukcja układu i kontrole jakości to nasz własny kod.
Czy zachowuje pieczątki, stemple i podpisy na zeskanowanych dokumentach?
Tak. Silnik usuwa tylko tusz rozpoznanego bieżącego tekstu. Pieczątki, stemple, podpisy, zdjęcia, wykresy i diagramy pozostają takie, jak zostały zeskanowane, więc certyfikat nadal pokazuje swój stempel, a umowa swoje podpisy po przetłumaczeniu.
Co dzieje się z tabelami?
W pliku PDF z warstwą tekstową każda komórka jest tłumaczona osobno i zapisywana z powrotem w tej samej komórce. Na skanie silnik znajduje wydrukowaną siatkę na obrazie, czyści tekst wewnątrz każdej komórki, nie dotykając linii, i zapisuje tłumaczenie w komórce, z której pochodziło.
Czy przetłumaczony plik będzie wyglądał dokładnie jak oryginał?
Podobnie, choć nie zawsze identycznie. Tłumaczenie jest zazwyczaj dłuższe lub krótsze niż oryginał, więc tekst może się inaczej zawijać lub być ustawiony nieco mniejszy, aby zmieścić się w ramce. Na gęstej stronie, takiej jak zeskanowana tabela, szybko przejrzyj wynik przed wysłaniem pliku dalej.
Jakie języki obsługuje DocTranslator?
DocTranslator obsługuje 108 języków, a tłumaczyć można między dowolnymi dwoma z nich. Pełna lista języków pokazuje każdy z nich.
Czy mogę go używać do dokumentów wizowych lub sądowych?
Silnik generuje tłumaczenia AI. Urzędy imigracyjne, sądy i uniwersytety zazwyczaj proszą o uwierzytelnione tłumaczenie, podpisane przez profesjonalnego tłumacza, który potwierdza jego dokładność i kompletność. W tym celu skorzystaj z naszej usługi uwierzytelnionego tłumaczenia.
Przetłumacz dokument i sam sprawdź układ
Prześlij plik PDF, skan lub plik Office, wybierz dwa z 108 języków i porównaj wynik z oryginałem. Tłumaczenie zaczyna się od 0,99 USD za dokument.
Narzędzia powiązane
Formaty plików
Typy dokumentów
