EN
En direct

Comment extraire des données structurées avec Claude

Par

Transformer un document désordonné en données propres est l'un des usages les plus rentables de Claude : sortir les lignes d'une facture, les coordonnées d'une série d'e-mails, ou les chiffres clés d'un rapport, sous forme de tableau ou de JSON réutilisable. La clé n'est pas la magie, mais une consigne précise sur les champs voulus et une vérification systématique. Voici comment procéder, du cas ponctuel à l'automatisation.

En bref : Donnez à Claude le document et la liste exacte des champs voulus avec leur format, puis demandez un tableau ou du JSON avec ces colonnes ou clés précises. Indiquez quoi faire des valeurs manquantes (mettre null, ne pas inventer) et vérifiez les éléments critiques à la source. Pour de gros volumes, passez par l'API.

Définir exactement les champs à extraire

Avant tout, décidez de la structure de sortie. Donnez à Claude la liste précise des champs voulus et leur format : pour une facture, par exemple, numéro, date, fournisseur, lignes (désignation, quantité, prix unitaire), total HT, TVA, total TTC. Une consigne efficace ressemble à : extrais ces informations de la facture jointe et renvoie un tableau avec exactement ces colonnes. Plus la cible est nette, plus le résultat est exploitable. Précisez aussi les conventions (format de date, séparateur décimal, devise) pour éviter les ambiguïtés et obtenir des données directement réutilisables.

Choisir le bon format de sortie

Pour un usage humain ou un copier-coller dans un tableur, demandez un tableau (ou un format CSV). Pour alimenter un autre logiciel, demandez du JSON en spécifiant les noms de champs exacts : renvoie un objet JSON avec les clés numéro, date, total_ttc. Indiquez comment traiter les valeurs manquantes (mettre null plutôt qu'inventer) et les cas particuliers (plusieurs adresses, lignes en double). Demander un format structuré strict réduit le travail de nettoyage en aval et rend la sortie prédictible, ce qui est essentiel si vous comptez la traiter automatiquement.

Fiabiliser et vérifier

L'extraction fait gagner un temps considérable, mais une erreur sur un montant ou une date peut coûter cher. Demandez à Claude de signaler explicitement quand une information est absente ou illisible, plutôt que de la deviner. Pour les éléments critiques (totaux, identifiants, dates d'échéance), vérifiez par sondage à la source, surtout au début. Sur des documents répétitifs, définissez une consigne stable et testez-la sur quelques exemples variés avant de l'appliquer en masse. Le bon réflexe : traiter la sortie comme un brouillon fiable à 90 pour cent, à contrôler sur les 10 pour cent qui comptent.

Passer à l'échelle avec l'API

Pour quelques documents, l'interface de claude.ai suffit. Pour en traiter des centaines de façon régulière, l'API d'Anthropic permet d'envoyer les documents par programme et de recevoir directement du JSON structuré, que votre application range en base. Le protocole MCP, lui, connecte Claude à vos sources de données et outils de façon standardisée. C'est ainsi que l'on industrialise l'extraction : une consigne éprouvée, un format de sortie strict, et une étape de vérification automatisée sur les champs sensibles. Voir notre guide de l'API et notre page sur le MCP.

Questions fréquentes

Comment extraire des données structurées avec Claude ?

Donnez à Claude le document et la liste exacte des champs voulus avec leur format, puis demandez un tableau ou du JSON avec ces colonnes ou clés précises. Indiquez quoi faire des valeurs manquantes (mettre null, ne pas inventer) et vérifiez les éléments critiques à la source. Pour de gros volumes, passez par l'API.

Claude peut-il sortir du JSON propre ?

Oui. Demandez explicitement un objet JSON en précisant les noms de clés attendus et le format des valeurs, et dites de mettre null pour les champs absents. Un format strict rend la sortie prédictible et réutilisable par un autre logiciel, ce qui réduit le nettoyage en aval.

L'extraction de Claude est-elle fiable à 100 % ?

Non. Elle fait gagner beaucoup de temps mais peut se tromper sur un montant, une date ou un champ ambigu. Demandez à Claude de signaler les informations absentes plutôt que de les deviner, et vérifiez par sondage les éléments critiques à la source, surtout sur des documents nouveaux.

Comment extraire des données de nombreux documents automatiquement ?

Utilisez l'API d'Anthropic pour envoyer les documents par programme et recevoir du JSON structuré que votre application stocke en base, et le protocole MCP pour connecter vos sources directement. Définissez une consigne stable, testez-la sur des exemples variés, puis automatisez la vérification des champs sensibles.

À lire aussi : le guide complet de Claude · l'actualité de Claude en temps réel

Claude News est un média indépendant, non affilié à Anthropic.