reCapcha, ça marche comment ?
Les scans des livres anciens sont lus par deux logiciels de reconnaissance de caractères différents. Dès qu'un mot est lu différemment par les deux logiciels, il est noté comme suspicieux et ajouté à la base de reCapcha.
Quand on vous demande de prouver le fait que vous êtes un être humain et non une machine via un reCapcha, il y a toujours 2 termes, l'un plus déformé que les autres. L'un deux a déjà été identifié avec certitude avec le logiciel OCR (c'est celui qui sert effectivement à vérifier que vous êtes un humain) et l'autre non (c'est celui que vous allez aider à identifier). À partir du moment où un certain nombre d'internautes ont identifié de la même façon un mot suspicieux, il est validé. Il est intégré dans la base de données des mots validés de reCapcha et dans la base de données que le logiciel d'OCR utilise pour reconnaître les caractères des livres numérisés. Actuellement le logiciel de reconnaissance de caractère de reCapcha a atteint un niveau d'erreur semblable à celui de l'être humain.