Sarvam Vision 2.1 pousse l'OCR indien vers les formulaires manuscrits et les tableaux complexes
— Business
Sarvam AI ajoute l'extraction clé-valeur et la reconnaissance manuscrite à son modèle de lecture documentaire, avec un score de 87,39% sur son propre benchmark couvrant 22 langues indiennes. L'enjeu se joue sur l'administration et l'entreprise locales, loin des ateliers créatifs, mais il dessine la carte d'un marché de l'IA qui se découpe désormais langue par langue.

Un formulaire rempli à la main dans une administration indienne, avec des champs imprimés en hindi et des réponses griffonnées en marge : voilà le genre de document que Sarvam Vision 2.1 promet de digérer sans reformatage manuel. La version précédente savait déjà lire des pages multilingues et repérer des tableaux. Celle-ci ajoute l'extraction de paires clé-valeur et la reconnaissance manuscrite, deux briques qui transforment un texte scanné en données réellement exploitables dans un tableur ou une base.
Le public visé n'est pas un studio de création mais l'infrastructure documentaire des administrations, banques et entreprises qui traitent au quotidien des formulaires dans les 22 langues indiennes. Sarvam publie d'ailleurs un benchmark dédié à ces langues, un geste rare quand la plupart des évaluations OCR restent centrées sur l'anglais. Sur ce test, l'entreprise revendique une précision de 87,39% mot à mot, largement devant les scores obtenus par Gemini 3.6 Flash ou Google Cloud Vision dans la même évaluation.
Ce chiffre vaut surtout comme argument commercial face à des géants qui traitent l'Inde comme une langue parmi d'autres. Sarvam construit sa position sur une spécialisation linguistique que les modèles généralistes ne peuvent pas égaler aussi finement, faute d'avoir entraîné leurs systèmes sur des écritures manuscrites régionales ou des documents administratifs locaux.
La réserve tient dans l'aveu même de Sarvam : les benchmarks approchent la saturation et un score élevé ne garantit rien sur des documents réels, avec leurs scans abîmés et leurs écritures approximatives. C'est un rappel utile dans un secteur où les tableaux de scores circulent plus vite que les tests en conditions réelles.
Aucun métier créatif ne manipule directement ce genre d'outil. Mais la bataille que Sarvam engage annonce une fragmentation du marché de la reconnaissance documentaire par zone linguistique, avec des acteurs locaux capables de battre les géants sur leur propre terrain culturel. Ce mouvement pourrait à terme faire baisser le coût des outils multilingues qui équipent déjà les studios travaillant sur des marchés internationaux, packaging ou traduction de contenus inclus.