La qualité de la récupération, mesurée
Vingt questions écrites à la main contre ce corpus, chacune associée à la section qui contient la réponse. Une question compte comme réussie quand un passage de cette section figure dans les extraits transmis au modèle. Aucun jugement humain dans la boucle : la note se calcule, elle ne s'apprécie pas.
Avant et après le reclassement
| Métrique | Sans reclassement | Avec reclassement | Écart |
|---|---|---|---|
| Rappel à 5 | 75 % | 95 % | +20 % |
| MRR | 0.575 | 0.777 | +0.202 |
| Citations correctes | 45 % | 65 % | +20 % |
| Latence moyenne | 779 ms | 3326 ms | +2547 ms |
20 questions · exécuté le 31 juillet 2026 · le reclassement coûte de la latence, ce que ce tableau montre aussi.
Méthode
Rappel à 5
Part des questions dont la section attendue apparaît parmi les cinq passages retenus. C'est la métrique qui prédit le mieux la qualité de la réponse finale.
MRR
Moyenne de l'inverse du rang du premier passage correct. Sensible à la position, pas seulement à la présence : trouver la bonne section en première place vaut mieux qu'en cinquième.
Citations correctes
Part des réponses dont toutes les citations numérotées renvoient à la section attendue. Une réponse juste appuyée sur le mauvais passage compte comme un échec.
Le jeu de questions
Volontairement déséquilibré. Les reprises littérales servent de plancher, les paraphrases mettent en défaut la recherche lexicale, les termes exacts mettent en défaut la recherche vectorielle, et deux questions n'ont pas de réponse dans le corpus : elles sont notées sur le refus, pas sur la récupération.
| Question | Type | Section attendue | Pourquoi elle est là |
|---|---|---|---|
| Qu'est-ce qu'un token dans un modèle de langage ? | Reprise littérale | IA générative | Définition explicite dans le glossaire de section. |
| Quelles sont les trois familles d'apprentissage automatique ? | Reprise littérale | Machine learning | Titre de section quasi identique à la question. |
| Qu'est-ce que la rétropropagation ? | Reprise littérale | Deep learning | Terme présent dans le titre et développé dans le corps. |
| Comment fonctionne la tokenisation par sous-mots ? | Reprise littérale | Traitement du langage | Correspondance directe. |
| Quelles tâches distingue-t-on en vision par ordinateur ? | Reprise littérale | Vision par ordinateur | Section entièrement consacrée à la question. |
| Pourquoi une IA affirme-t-elle des choses fausses avec assurance ? | Paraphrase | IA générative | Le passage parle de vraisemblance et non de véracité, sans employer « faux » ni « assurance ». |
| Mon modèle marche très bien à l'entraînement et mal en vrai, pourquoi ? | Paraphrase | Machine learning | Formulation familière du surapprentissage et de la fuite de données. |
| Comment réduire la taille d'un réseau pour le faire tourner plus vite ? | Paraphrase | Deep learning | Cible la quantification et la distillation sans les nommer. |
| Décrire une photo pour quelqu'un qui ne voit pas, comment s'y prendre ? | Paraphrase | Vision par ordinateur | Reformulation complète de la section accessibilité. |
| Le système apprend de ses propres décisions et se dégrade, que faire ? | Paraphrase | IA décisionnelle | Boucle de rétroaction décrite sans le terme. |
| Qu'est-ce que BM25 ? | Terme exact | Traitement du langage | Sigle rare, dilué par l'embedding dans le voisinage « recherche ». |
| Que fait la Reciprocal Rank Fusion ? | Terme exact | Traitement du langage | Nom propre de méthode, retrouvé par le lexical avant le vectoriel. |
| À quoi sert LoRA ? | Terme exact | Deep learning | Acronyme de quatre lettres mentionné une seule fois. |
| Qu'est-ce que le format HEIC pose comme problème ? | Terme exact | Vision par ordinateur | Terme exact présent dans la FAQ du domaine. |
| Que dit le RGPD sur les décisions automatisées ? | Terme exact | IA décisionnelle | Sigle réglementaire, une seule occurrence. |
| RAG ou fine-tuning pour spécialiser un modèle sur ma documentation ? | Multi-sections | IA générative | La réponse complète croise la section RAG et la section spécialisation. |
| Comment évaluer un système de recherche documentaire ? | Multi-sections | Traitement du langage | Croise les métriques NLP et le garde-fou de pertinence côté IA générative. |
| Quand faut-il garder un humain dans la boucle de décision ? | Multi-sections | IA décisionnelle | Réparti entre l'abstention et l'explicabilité. |
| Quel est le tarif de l'API Gemini au 1er janvier 2027 ? | Sans réponse dans le corpus | aucune | Aucun tarif daté dans le corpus. Une réponse chiffrée est une hallucination, pas une réussite. |
| Comment configurer un cluster Kubernetes pour servir un modèle ? | Sans réponse dans le corpus | aucune | Hors périmètre du corpus. Le refus est la bonne réponse. |