Notre propre technologie de traduction de documents

DocTranslator AI Engine

Le DocTranslator AI Engine est la technologie de traduction de documents que nous développons nous-mêmes. Là où la plupart des outils de traduction fonctionnent avec du texte brut, celui-ci fonctionne avec la page : il trouve où se trouve chaque ligne, la traduit et réécrit la traduction au même endroit, de sorte que le fichier que vous téléchargez a la mise en page du fichier que vous avez téléchargé.

Il est conçu et écrit par l'équipe DocTranslator.

Comment ça marche

Quatre étapes de l'envoi au fichier final

  1. 01

    Lire

    Lire le fichier

    Le moteur détermine le type de fichier à partir de son contenu plutôt que de son nom : un PDF avec une couche de texte réelle, une numérisation, une photo ou un document Office. Chaque type suit un chemin différent.

  2. 02

    Séparer

    Séparez les mots de la page

    Seul le texte est extrait. Les images, diagrammes, graphiques, photos, signatures et tampons restent à leur place et ne sont jamais envoyés en traduction.

  3. 03

    Traduire

    Traduire et vérifier

    Chaque passage est traduit et vérifié avant d'être accepté. Un passage qui échoue à une vérification est retraduit.

  4. 04

    Reconstruire

    Reconstruire la page

    La traduction retourne à ses positions d'origine, mise dans des polices qui contiennent les caractères de la langue cible.

A · PDF numériques

PDF avec une couche de texte

Dans un PDF exporté depuis Word, InDesign ou un programme similaire, le moteur lit le texte bloc par bloc et cellule de tableau par cellule. Il joint les lignes d'un paragraphe en un seul passage avant de traduire, de sorte qu'une phrase qui s'étend sur trois lignes est traduite comme une seule phrase plutôt que comme trois fragments. Il supprime ensuite les mots d'origine de la page, laisse les images, diagrammes et dessins vectoriels intacts, et écrit la traduction dans la même boîte.

Une traduction est rarement de la même longueur que sa source. L'allemand et le russe sont généralement plus longs que l'anglais, et le chinois et le japonais utilisent moins de caractères. Le moteur laisse le texte s'adapter à son bloc d'origine et réduit la taille de la police uniquement lorsque la traduction ne rentre toujours pas. Les cellules de tableau sont traitées une par une, de sorte que les chiffres restent dans leurs propres lignes et colonnes.

Trois lignes coupées deviennent un passage, et la traduction plus longue s'insère dans la boîte qu'occupait le texte original.

B · Numérisations et photos

Numérisations et photos

01La page numérisée, conservée comme image d'arrière-plan.
02Seul l'encre des mots est sélectionnée. Les tampons, les lignes et les signatures sont laissés de côté.
03La traduction est réécrite à sa place, sur le papier original.

Une page numérisée est une image, il n'y a donc pas de texte à remplacer. Le moteur conserve l'image d'origine comme arrière-plan de la page, reconnaît le texte imprimé avec l'OCR, puis supprime uniquement l'encre de ces lettres, remplissant chaque espace avec la couleur du papier environnant. Tout ce qui n'est pas du texte courant est laissé tel quel. Les tampons, sceaux, signatures, photos, graphiques et diagrammes restent exactement tels qu'ils ont été numérisés, ce qui est ce que vous voulez sur un certificat ou un contrat signé.

Les tableaux conservent leur grille imprimée. Le moteur trouve les lignes de démarcation du tableau d'origine dans l'image, efface le texte à l'intérieur de chaque cellule sans toucher les bordures, et écrit la traduction dans la même cellule. Une ligne imprimée de côté le long d'une marge est réécrite de côté.

Parfois, une ligne ne peut pas être effacée proprement, par exemple lorsque le texte repose sur un arrière-plan chargé. Dans ce cas, le moteur laisse l'impression d'origine en place plutôt que de l'étaler, et ajoute une copie invisible du texte afin que la page reste consultable.

C · Fichiers structurés

Word, Excel, PowerPoint, EPUB et HTML

Les fichiers Office séparent déjà leur texte de leur mise en page, le moteur les traduit donc de l'intérieur. Il remplace les mots de chaque paragraphe, diapositive et cellule de feuille de calcul et conserve le gras, l'italique et d'autres mises en forme sur les mots auxquels ils appartenaient, même lorsque la traduction met ces mots dans un ordre différent.

Les livres EPUB et les pages HTML sont traduits texte par texte, et leur balisage est laissé tel quel, de sorte que les chapitres, les titres et les liens continuent de fonctionner dans la copie traduite.

ENThe report is ready today.
↓
DEDer Bericht ist heute fertig.

Le mot en gras se déplace à la fin de la phrase allemande, et sa mise en forme le suit.

Qualité

Vérifications avant le retour d'un fichier

La traduction par IA peut échouer de manière facile à manquer lors d'une lecture rapide, le moteur vérifie donc chaque passage avant de l'accepter :

  1. reject Une réponse qui répète l'original au lieu de le traduire est rejetée.
  2. reject Il en va de même pour une réponse dans la mauvaise langue, une qui boucle ou s'arrête à mi-chemin, et une avec des caractères parasites d'un autre script.
  3. retry Un passage rejeté est retraduit, d'abord avec les lignes environnantes pour le contexte, puis seul.
  4. compare Les nombres, adresses web et adresses e-mail sont comparés entre l'original et la traduction, de sorte qu'un chiffre modifié est signalé.
  5. reuse Une phrase qui apparaît sur plusieurs pages est traduite une seule fois, de sorte qu'un titre ou un terme se lit de la même manière partout dans le document.
  6. discard Si une grande partie d'un document revient non traduite, le moteur rejette ce résultat plutôt que de remettre un fichier partiellement traduit.

Construit et exploité par DocTranslator

Notre propre code, de la lecture de la page à sa reconstruction.

Le moteur est développé par l'équipe DocTranslator. L'analyse des pages, le traitement des scans et des tableaux, la reconstruction de chaque page et les contrôles ci-dessus sont notre propre code. Parce que nous écrivons le moteur nous-mêmes, un problème tel qu'un tableau décalé ou un caractère manquant peut être corrigé dans le moteur lui-même.

Les traductions vers le chinois, le japonais, le coréen, l'hindi, le thaï et d'autres scripts sont mises dans des polices qui contiennent ces caractères, vous n'obtenez donc pas de cases vides là où des lettres devraient être. Seuls les caractères réellement utilisés par un document sont intégrés, ce qui réduit la taille du fichier.

FAQ sur le moteur IA de DocTranslator

Le moteur IA DocTranslator est-il développé par DocTranslator ?

Oui. Le moteur est développé en interne par l'équipe DocTranslator. L'analyse des pages, le traitement des scans, la reconstruction de la mise en page et les contrôles qualité sont notre propre code.

Conserve-t-il les tampons, sceaux et signatures sur les documents numérisés ?

Oui. Le moteur ne supprime que l'encre du texte courant reconnu. Les tampons, sceaux, signatures, photos, graphiques et diagrammes sont laissés tels qu'ils ont été numérisés, de sorte qu'un certificat affiche toujours son sceau et un contrat ses signatures après traduction.

Qu'advient-il des tableaux ?

Dans un PDF avec une couche de texte, chaque cellule est traduite individuellement et réécrite dans la même cellule. Sur un scan, le moteur trouve la grille imprimée dans l'image, efface le texte à l'intérieur de chaque cellule sans toucher les lignes, et écrit la traduction dans la cellule d'où elle provient.

Le fichier traduit ressemblera-t-il exactement à l'original ?

Presque, mais pas toujours identique. Une traduction est généralement plus longue ou plus courte que sa source, de sorte que le texte peut passer à la ligne différemment ou être légèrement réduit pour tenir dans sa boîte. Sur une page dense, comme un tableau photographié, jetez un coup d'œil rapide au résultat avant d'envoyer le fichier.

Quelles langues DocTranslator prend-il en charge ?

DocTranslator prend en charge 108 langues, et vous pouvez traduire entre deux d'entre elles. La liste complète des langues en montre chacune.

Puis-je l'utiliser pour un dépôt de visa ou de tribunal ?

Le moteur produit des traductions par IA. Les bureaux d'immigration, les tribunaux et les universités demandent généralement une traduction certifiée, signée par un traducteur professionnel qui confirme qu'elle est exacte et complète. Pour cela, utilisez notre service de traduction certifiée.

Traduisez un document et vérifiez vous-même la mise en page

Téléchargez un PDF, une numérisation ou un fichier Office, choisissez deux des 108 langues et comparez le résultat avec votre original. La traduction commence à 0,99 $ par document.