Aller au contenu
Atlas IA
Ouvrir l'assistant

La qualité de la récupération, mesurée

Vingt questions écrites à la main contre ce corpus, chacune associée à la section qui contient la réponse. Une question compte comme réussie quand un passage de cette section figure dans les extraits transmis au modèle. Aucun jugement humain dans la boucle : la note se calcule, elle ne s'apprécie pas.

Avant et après le reclassement

MétriqueSans reclassementAvec reclassementÉcart
Rappel à 575 %95 %+20 %
MRR0.5750.777+0.202
Citations correctes45 %65 %+20 %
Latence moyenne779 ms3326 ms+2547 ms

20 questions · exécuté le 31 juillet 2026 · le reclassement coûte de la latence, ce que ce tableau montre aussi.

Méthode

Rappel à 5

Part des questions dont la section attendue apparaît parmi les cinq passages retenus. C'est la métrique qui prédit le mieux la qualité de la réponse finale.

MRR

Moyenne de l'inverse du rang du premier passage correct. Sensible à la position, pas seulement à la présence : trouver la bonne section en première place vaut mieux qu'en cinquième.

Citations correctes

Part des réponses dont toutes les citations numérotées renvoient à la section attendue. Une réponse juste appuyée sur le mauvais passage compte comme un échec.

Le jeu de questions

Volontairement déséquilibré. Les reprises littérales servent de plancher, les paraphrases mettent en défaut la recherche lexicale, les termes exacts mettent en défaut la recherche vectorielle, et deux questions n'ont pas de réponse dans le corpus : elles sont notées sur le refus, pas sur la récupération.

QuestionTypeSection attenduePourquoi elle est là
Qu'est-ce qu'un token dans un modèle de langage ?Reprise littéraleIA générativeDéfinition explicite dans le glossaire de section.
Quelles sont les trois familles d'apprentissage automatique ?Reprise littéraleMachine learningTitre de section quasi identique à la question.
Qu'est-ce que la rétropropagation ?Reprise littéraleDeep learningTerme présent dans le titre et développé dans le corps.
Comment fonctionne la tokenisation par sous-mots ?Reprise littéraleTraitement du langageCorrespondance directe.
Quelles tâches distingue-t-on en vision par ordinateur ?Reprise littéraleVision par ordinateurSection entièrement consacrée à la question.
Pourquoi une IA affirme-t-elle des choses fausses avec assurance ?ParaphraseIA générativeLe passage parle de vraisemblance et non de véracité, sans employer « faux » ni « assurance ».
Mon modèle marche très bien à l'entraînement et mal en vrai, pourquoi ?ParaphraseMachine learningFormulation familière du surapprentissage et de la fuite de données.
Comment réduire la taille d'un réseau pour le faire tourner plus vite ?ParaphraseDeep learningCible la quantification et la distillation sans les nommer.
Décrire une photo pour quelqu'un qui ne voit pas, comment s'y prendre ?ParaphraseVision par ordinateurReformulation complète de la section accessibilité.
Le système apprend de ses propres décisions et se dégrade, que faire ?ParaphraseIA décisionnelleBoucle de rétroaction décrite sans le terme.
Qu'est-ce que BM25 ?Terme exactTraitement du langageSigle rare, dilué par l'embedding dans le voisinage « recherche ».
Que fait la Reciprocal Rank Fusion ?Terme exactTraitement du langageNom propre de méthode, retrouvé par le lexical avant le vectoriel.
À quoi sert LoRA ?Terme exactDeep learningAcronyme de quatre lettres mentionné une seule fois.
Qu'est-ce que le format HEIC pose comme problème ?Terme exactVision par ordinateurTerme exact présent dans la FAQ du domaine.
Que dit le RGPD sur les décisions automatisées ?Terme exactIA décisionnelleSigle réglementaire, une seule occurrence.
RAG ou fine-tuning pour spécialiser un modèle sur ma documentation ?Multi-sectionsIA générativeLa réponse complète croise la section RAG et la section spécialisation.
Comment évaluer un système de recherche documentaire ?Multi-sectionsTraitement du langageCroise les métriques NLP et le garde-fou de pertinence côté IA générative.
Quand faut-il garder un humain dans la boucle de décision ?Multi-sectionsIA décisionnelleRéparti entre l'abstention et l'explicabilité.
Quel est le tarif de l'API Gemini au 1er janvier 2027 ?Sans réponse dans le corpusaucuneAucun tarif daté dans le corpus. Une réponse chiffrée est une hallucination, pas une réussite.
Comment configurer un cluster Kubernetes pour servir un modèle ?Sans réponse dans le corpusaucuneHors périmètre du corpus. Le refus est la bonne réponse.