La question arrive presque toujours au même moment du rendez-vous, quand un dirigeant commence à voir ce que l'outil pourrait lui faire gagner : « et si je lui donne mon contrat de 200 pages, il le lit ? »

La réponse courte est oui. La réponse utile est plus intéressante : il le lit, mais vous n'aimerez pas attendre. Et la limite que vous allez rencontrer n'est pas celle qui figure sur la fiche technique du modèle.

Ce que nous avons mesuré

Nous avons chronométré une chose précise : le temps qui s'écoule entre le moment où l'on valide sa question et celui où le modèle émet le premier fragment de sa réponse. Les techniciens l'appellent le TTFT, pour time to first token. C'est le seul temps que l'utilisateur ressent comme de l'attente, parce qu'ensuite le texte s'écrit plus vite qu'il ne se lit. Il est mesuré à la sortie du modèle, sans le temps d'affichage de l'interface, qui s'y ajoute.

« Page » n'étant pas une unité stable, voici les deux : la taille réelle en unités de texte, telle que le serveur l'a décomptée, et sa traduction en pages sur la base d'environ 320 unités par page.

Dossier fourni Unités de texte Équivalent Attente avant le premier mot
Petit 8 040 environ 25 pages 0,53 seconde
Moyen 31 960 environ 100 pages 2,71 secondes
Grand 63 880 environ 200 pages 7,45 secondes

Chaque ligne est la moyenne de trois dossiers différents, du texte d'entreprise en français, sans image ni page scannée, avec la question posée à la fin. Les trois dossiers d'une même ligne ne partagent que leur en-tête, et les trois lignes portent sur des dossiers distincts : aucune mesure n'a donc profité du travail déjà fait pour une autre. À taille égale, les trois relevés tiennent dans moins de deux centièmes de seconde d'écart. Chaque temps du tableau est donc une première lecture, à froid : c'est le cas le plus coûteux, et nous verrons plus bas ce qu'il devient quand le dossier a déjà été lu.

Ces temps sont ceux du plus rapide des trois modèles que nous avons comparés. Les deux autres sont plus lents, l'un d'eux nettement. Le seuil de confort que nous retenons pour un usage documentaire est de 5 secondes : au-delà, un utilisateur croit que l'outil a planté et recommence sa question, ce qui aggrave tout.

Le constat tient en une phrase. Vingt-cinq pages, c'est instantané. Cent pages, c'est confortable. Deux cents pages, c'est déjà trop long, et c'est le meilleur des trois modèles qui le dit.

Avant d'en conclure qu'un service en ligne ferait forcément mieux : cette attente n'est pas une conséquence du fait que la machine soit chez vous. À modèle et à matériel comparables, prendre connaissance de 200 pages représente la même quantité de calcul dans vos locaux et dans un centre de données : il faut, dans les deux cas, avoir traité le dossier en entier avant d'écrire le premier mot. Ce temps est le prix du travail demandé, pas celui de la souveraineté.

Cela dit, un fournisseur en ligne n'est pas condamné aux mêmes chiffres, et il serait malhonnête de le laisser croire. Il aligne beaucoup plus de machines que vous, il peut servir un modèle plus gros ou au contraire un modèle taillé pour la vitesse, et il optimise une chaîne de traitement que nous n'avons pas mesurée. L'attente qu'il affiche peut donc être plus courte que la nôtre. Ce que dit notre mesure est plus modeste et suffit à la décision : ce n'est pas le fait d'héberger l'IA chez soi qui crée cette attente.

Restent deux différences de fond. La capacité du fournisseur à absorber vos pointes de charge est un avantage réel, payé par une facture à l'usage qui grandit avec le nombre de vos salariés et la taille de vos documents, là où une machine achetée a un coût fixe. Et votre contrat de 200 pages, lui, part chez le fournisseur.

La limite n'est pas celle qu'annonce la fiche technique

Voilà le point contre-intuitif, et c'est celui qui devrait guider une décision d'achat.

Techniquement, ces modèles acceptent bien davantage. Notre machine était réglée sur la fenêtre maximale de ces modèles, quatre fois ce dossier de 200 pages. Sur le papier, un contrat de 200 pages ne pose aucun problème : il entre largement dans ce que la fiche technique annonce.

Sauf que l'attente, elle, s'allonge bien avant que cette capacité ne soit atteinte. Le dossier est traité jusqu'au bout dans tous les cas et la réponse arrive : ce qui change avec le nombre de pages, c'est le temps passé devant l'écran avant de la voir commencer. La vraie limite se situe entre 100 et 200 pages, et ce n'est pas la capacité du modèle qui la fixe, c'est votre patience. Un fournisseur qui vous vend une fenêtre de contexte gigantesque vous vend une caractéristique que vous n'utiliserez jamais dans cette plage, parce que personne dans votre entreprise n'attendra trente secondes devant un écran figé.

C'est exactement le genre d'écart que l'on ne voit pas sur un tableau comparatif et que l'on découvre le premier lundi d'utilisation réelle.

Et encore, tout seul sur une machine vide

Ces chiffres décrivent un cas de figure très favorable : un utilisateur, un seul, sur une machine qui ne fait rien d'autre à cet instant. C'est le meilleur moment de la journée, pas le mardi matin.

Dès que plusieurs personnes envoient des dossiers en même temps, ces lectures s'empilent et l'attente avant la première réponse s'allonge pour tout le monde. C'est d'ailleurs exactement ce qui limite le nombre de conversations qu'une machine peut mener de front, un sujet que nous avons mesuré séparément : combien de personnes une seule machine IA peut-elle servir ?

Autrement dit, les 7,45 secondes du tableau sont une mesure de référence dans des conditions très favorables, pas une moyenne d'usage. À plusieurs sur la même machine, ce sera plus long.

Deux écarts, en sens contraire

Deux écarts séparent la machine que nous avons mesurée de celle que nous installons chez un client. Le premier allonge l'attente, le second la raccourcit, et il faut les garder tous les deux en tête sans les additionner.

Ce qui allonge l'attente : chez vous, la machine ne porte pas que le modèle. La machine que nous installons est elle aussi entièrement réservée à l'IA, sans autre application pour lui prendre des ressources : sur ce point, rien ne change. Mais elle porte en plus la recherche documentaire et son moteur de reclassement, et l'interface envoie plusieurs demandes au modèle pour une seule question posée par un salarié. Les temps relevés ici sont donc des bornes hautes, jamais des performances de déploiement.

Ce qui la raccourcit : la carte du catalogue est plus rapide que celle qui a servi aux mesures. Ce second écart ne porte plus sur ce que la machine a à faire, mais sur la vitesse de la carte de calcul qu'elle abrite, la pièce qui fait tout le travail de l'IA. Faute de disponibilité chez le loueur, nous avons mesuré sur une demi-carte : la moitié d'une carte plus grosse, découpée en deux par le fabricant. Celle de notre catalogue lui est supérieure sur les deux plans, mais très inégalement.

Ces deux avances ne se valent pas, et c'est ce qui interdit d'en tirer un coefficient unique. La bande passante, supérieure de 50 %, commande la vitesse à laquelle le modèle écrit sa réponse. Mais l'attente mesurée dans cet article est du calcul presque pur, et sur ce terrain l'écart n'est que de 17 %. Multiplier les 7,45 secondes par le rapport des bandes passantes serait donc appliquer un gain à la mauvaise grandeur, et nous ne le ferons pas. La carte livrée fera mieux, plutôt un peu que beaucoup sur ce chiffre précis, et nous n'avancerons pas de valeur avant d'avoir rejoué la mesure sur elle.

Ce qu'il faut faire à la place

Jusqu'ici, cet article n'a rapporté que des mesures. Ce qui suit en est la conséquence pratique, et il est normal qu'elle rejoigne ce que nous installons : c'est justement pour cette raison que nous l'installons.

La bonne pratique ne consiste pas à acheter une machine plus grosse pour avaler le contrat entier. Elle consiste à ne pas lui faire reprendre 200 pages pour répondre à une question qui porte sur trois d'entre elles.

C'est le rôle de la recherche documentaire. Le principe est simple : vos documents sont découpés et indexés une fois pour toutes, et quand un salarié pose une question, le système va chercher les quelques passages qui portent la réponse et ne transmet que ceux-là au modèle. L'utilisateur a l'impression d'interroger l'intégralité de votre fonds documentaire, mais le modèle, lui, ne lit à chaque fois que quelques pages.

Le gain est double. L'attente redescend dans la zone confortable du tableau ci-dessus, et la réponse est souvent meilleure, parce qu'un modèle qui reçoit trois pages pertinentes se disperse moins qu'un modèle noyé sous 200 pages dont 197 sont hors sujet.

Quand faut-il malgré tout tout donner d'un bloc ? Quand la question porte sur l'ensemble et non sur un point : résumer un rapport entier, vérifier la cohérence de bout en bout d'un contrat, comparer deux versions d'un même document. Dans ces cas-là, l'attente est justifiée et acceptée, parce que l'utilisateur sait qu'il vient de demander un gros travail. Ce qui n'est pas accepté, c'est d'attendre huit secondes pour une question de détail.

La qualité de ce découpage n'est pas un détail technique de notre côté du mur : elle dépend de la façon dont vos documents sont organisés et nommés. Nous en avons fait un article à part : l'organisation de vos documents est le vrai moteur de votre IA locale.

Bonne nouvelle : ce qui a été lu une fois n'est pas relu

Un dernier chiffre, rassurant celui-là. Nous avons mesuré une conversation de cinq échanges d'affilée sur le même sujet, comme le fait un salarié qui affine sa demande au fil des réponses. À chaque tour, la conversation s'allonge et le modèle a donc davantage à reprendre : environ 900 unités de texte au premier tour, 4 400 au cinquième.

L'attente, elle, ne bouge pas : 0,10 seconde au premier tour, 0,09 seconde au cinquième, alors que la conversation a été multipliée par près de cinq entre les deux. Le mécanisme n'a rien de mystérieux et porte un nom : le moteur d'inférence conserve en mémoire le travail déjà fait sur le début de la conversation et ne calcule que ce qui vient de s'y ajouter. Il ne s'y remet que si ce début change ou si la mémoire a été réclamée entre-temps.

Cette mesure porte sur le modèle seul, interrogé directement. Une application complète ajoute ses propres traitements entre la touche entrée et le modèle, et ils s'ajoutent à ces chiffres.

La conséquence pratique compte pour l'usage quotidien : le coût en attente se paie à l'entrée du dossier, pas à chaque question posée dessus. Une fois le document ouvert dans la conversation, enchaîner les questions est fluide.

Tout ce qui précède vaut à l'intérieur d'une même conversation, et c'est tout ce que nos mesures autorisent à dire : chaque ligne du tableau a été relevée sur des dossiers distincts, sans que rien puisse être réutilisé d'une mesure à l'autre. C'était délibéré, nous voulions le prix plein.

Sur les machines que nous livrons, ce prix plein n'est pas payé à chaque fois. Nous y installons un système de cache qui conserve le travail de lecture déjà fait et le réutilise au-delà d'une seule conversation : le lendemain, dans un autre échange, et pour un autre salarié. Vingt personnes qui interrogent la même charte interne ne la font pas relire vingt fois. Et cette réutilisation est à l'identique : la machine ne réestime rien, elle reprend un calcul déjà effectué, sans rien changer à la réponse.

Ce que ce cache ne change pas, en revanche : un dossier que la machine découvre se paie au prix du tableau. Il supprime la répétition, jamais la première lecture. Les 7,45 secondes des 200 pages restent donc le bon chiffre pour décider de ce que l'on dépose d'un bloc.

Ce qu'il faut retenir

  • Jusqu'à une centaine de pages en une fois, c'est confortable, y compris pour un utilisateur exigeant.
  • Au-delà, la limite est humaine avant d'être technique. Le modèle accepte, mais l'utilisateur décroche.
  • Le bon réflexe est de laisser la recherche documentaire trouver les bons extraits plutôt que d'injecter le dossier entier à chaque question.
  • Ces temps valent pour un utilisateur seul sur une machine qui ne fait rien d'autre. À plusieurs, ils se dégradent.
  • Le prix se paie à la première lecture, pas aux suivantes. Le cache que nous installons évite de refaire un travail déjà fait, y compris pour un autre salarié.

Trois modèles ouverts, servis dans des conditions strictement identiques sur une seule carte de calcul, chacun avec les réglages publiés par son propre éditeur, avec une fenêtre de contexte réglée à 262 144 unités de texte, soit environ 800 pages. Les dossiers sont du texte d'entreprise en français, écrit pour l'occasion, sans image ni page scannée : un dossier composé de documents numérisés y ajouterait le temps de leur déchiffrement, que nous n'avons pas mesuré ici. Les tailles annoncées sont celles que le serveur a décomptées, pas une estimation. Nous mesurons nos propres machines et nous publions les limites que nous trouvons, y compris quand elles arrivent plus tôt que ce que la fiche technique laisse espérer.

Le détail matériel, pour ceux qui veulent vérifier : la carte utilisée pour les mesures offrait environ 896 gigaoctets par seconde de bande passante mémoire et 94 unités de calcul, soit la moitié d'une carte plus grande (1 792 gigaoctets par seconde, 188 unités) découpée en deux par le fabricant. La carte de notre catalogue affiche 1 344 gigaoctets par seconde et 110 unités de calcul.

Questions fréquentes

Puis-je donner un document de 200 pages à une IA locale ?

Oui, le modèle l'accepte sans difficulté. Mais l'attente avant le premier mot atteint 7,45 secondes sur 200 pages, contre 2,71 sur 100 et un peu plus d'une demi-seconde sur 25, et c'est le plus rapide des trois modèles mesurés qui le dit. Ces temps valent pour un utilisateur seul sur une machine qui ne fait rien d'autre : à plusieurs, ils s'allongent.

La fenêtre de contexte annoncée par l'éditeur dit-elle la limite réelle ?

Non, et c'est le point contre-intuitif de nos mesures. Les modèles utilisés acceptent plusieurs fois ce dossier de 200 pages : sur le papier, il passe largement. Mais l'attente s'allonge bien avant que cette capacité soit atteinte, et la limite pratique se situe entre 100 et 200 pages. Ce n'est pas la capacité du modèle qui la fixe, c'est votre patience.

Une IA en ligne serait-elle plus rapide sur un gros dossier ?

Pas du fait d'être en ligne. À modèle et matériel comparables, prendre connaissance de 200 pages représente le même calcul dans vos locaux et dans un centre de données. Un fournisseur peut afficher une attente plus courte parce qu'il aligne davantage de machines et optimise sa chaîne, mais la facture croît avec vos usages et votre dossier part chez lui.

Comment interroger un gros dossier sans attendre ?

En laissant la recherche documentaire faire son travail. Vos documents sont découpés et indexés une fois pour toutes, et à chaque question le système ne transmet au modèle que les quelques passages qui portent la réponse. L'attente redescend dans la zone confortable et la réponse est souvent meilleure. On ne donne le dossier entier que lorsque la question porte sur l'ensemble : résumer, vérifier une cohérence, comparer deux versions.

L'IA doit-elle tout relire à chaque question ?

Non. Dans une conversation, le moteur conserve le travail déjà fait et ne calcule que ce qui vient de s'y ajouter : nous avons mesuré 0,10 seconde d'attente au premier tour et 0,09 au cinquième, alors que la conversation avait quintuplé. Sur les machines que nous livrons, un système de cache étend cette réutilisation au-delà d'une seule conversation et d'un seul utilisateur. Seule la première lecture d'un dossier se paie au prix fort.