Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

FineBooks améliore l'OCR pour l'IA générative

FineBooks améliore l'OCR pour l'IA générative

5 min de lecture · The Decoder · Matthias Bastian · 10 août 2026 IA générative 8/10 Élevé
FineBooks améliore l'OCR pour l'IA générative

FineBooks, une collaboration entre Hugging Face et EleutherAI, a évalué 14 modèles OCR sur 2165 pages de livres historiques. Le meilleur modèle (dots.mocr) atteint 97,6% de précision pour 1,94$/1000 pages. Ces résultats permettront d'améliorer les datasets d'entraînement des IA.

« a language model trained on OCR text learned at only 30 percent the efficiency of one trained on human transcriptions of the same books. » - The Decoder

Que faut-il retenir ?

  • 14 modèles OCR open-source testés sur 2165 pages de livres historiques
  • Le meilleur modèle (dots.mocr) atteint 97,6% de précision caractère
  • Coût inférieur à 2 dollars pour 1000 pages traitées
  • Objectif : retraiter 200 000 documents du Biodiversity Heritage Library

Pourquoi cette nouvelle compte-t-elle ?

La qualité des données OCR historiques impacte directement l'efficacité des modèles de langage. Une étude montre qu'un modèle entraîné sur du texte OCR n'atteint que 30% de l'efficacité d'un modèle utilisant des transcriptions humaines. L'amélioration des pipelines OCR ouvre l'accès à des millions de documents publics pour l'entraînement IA.

97,6% de précision caractère pour le modèle dots.mocr

Public concerné : développeurs

Quel est l'impact des erreurs OCR sur l'entraînement des modèles de langage ?

Une étude montre qu'un modèle entraîné sur du texte OCR n'atteint que 30% de l'efficacité d'un modèle utilisant des transcriptions humaines. Les erreurs de reconnaissance dégradent significativement les performances.

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !