Pourquoi une plateforme d’e-discovery, plutôt qu’un tri sur place

Tôt ou tard, la partie adverse pose la question : pourquoi avez-vous emporté la boîte aux lettres complète, alors que la mission portait sur une période limitée et une poignée de mots-clés ? La question est légitime et mérite une réponse technique. Celui qui se replie sur « c’est ainsi que cela fonctionne » l’a perdue.

La réponse est qu’une sélection sur place n’est techniquement pas réalisable d’une manière qui résiste à la critique. Il y a trois raisons à cela. Elles sont indépendantes les unes des autres et chacune suffit à elle seule.

Un client de messagerie n’exporte pas de sélection partielle

La fonction de recherche intégrée d’un client de messagerie permet de chercher et de consulter les résultats, mais pas de les écrire dans un ensemble distinct. L’export se fait par boîte : tout ou rien. Il n’existe pas de voie intermédiaire par laquelle l’ensemble filtré sort et le reste demeure.

Vouloir malgré tout régler cela sur place suppose de déplacer manuellement les éléments trouvés vers un dossier séparé. C’est une opération d’écriture dans la boîte d’une personne concernée : après votre passage, le système n’est plus celui que vous avez trouvé en arrivant.

Réindexer prend plus de temps que votre visite

Chercher suppose un index, et celui-ci n’est généralement pas là au moment où vous en avez besoin. Une boîte exportée ou copiée que vous ouvrez dans un client de messagerie repart de zéro. Reconstruire cet index prend facilement douze à vingt-quatre heures, selon le volume et selon le disque en dessous. C’est plus qu’une journée de travail complète sur les lieux.

Le piège qui se cache derrière est pire que l’attente. Une recherche lancée sur un index encore en construction renvoie des résultats incomplets, sans que la fonction de recherche signale qu’elle n’a pas terminé. Le résultat a toutes les apparences de la réussite. Décider à ce moment-là de ce qui part et de ce qui reste, c’est trancher sur la moitié d’un jeu de données sans le savoir.

La recherche sur le contenu dépend du format

Aucune recherche ne regarde à la fois dans du PDF, du Word, du PowerPoint et du texte brut. Chaque format exige sa propre extraction de texte, et là où celle-ci fait défaut, la recherche se rabat silencieusement sur les noms de fichiers et les métadonnées. Un corpus composé pêle-mêle de tous ces formats (la situation normale sur un disque d’entreprise) ne peut pas être fouillé intégralement sur le contenu avec les moyens présents sur la machine elle-même.

L’alternative consiste à ouvrir chaque fichier dans l’application capable de le lire. Sur un corpus de quelques dizaines de milliers de fichiers, c’est hors de portée d’une seule visite. Ce n’est pas une question de persévérance.

Pourquoi filtrer après coup est plus précis

Sélectionner sur place, c’est prendre des décisions qui ne sont consignées nulle part : debout à côté du bureau d’autrui, sous la pression du temps, sur la base de ce que la recherche affiche à cet instant. Après coup, plus moyen d’établir pourquoi tel fichier figurait dans la sélection et tel autre non, et les fichiers laissés sur place ne peuvent plus être appréciés une seconde fois.

Dans une plateforme d’e-discovery, chaque étape de filtrage est une opération distincte, avec un nombre avant et un nombre après. Périmètre des dossiers, bornes de dates et mots-clés s’appliquent l’un après l’autre, et chaque état intermédiaire subsiste. Cet entonnoir est vérifiable : un expert-conseil qui refait les mêmes étapes aboutit aux mêmes nombres. Tout capter puis filtrer de manière motivée n’est donc pas plus négligent que sélectionner sur place. C’est plus précis, parce que le jugement devient reproductible au lieu d’être définitif.

Ce que la surcollecte vous impose

Le choix ne se défend qu’avec ce qui vient le clôturer. Sans cela, vous avez simplement emporté plus que ce qui était demandé.

Ce qui sort du cadre de la mission n’est pas produit. L’avoir eu entre les mains ne fonde en rien sa livraison. Les cas douteux, ce n’est pas à vous de les trancher : vous les soumettez au magistrat qui a confié la mission.

Les données sources sont effacées irrévocablement à la fin. De la plateforme comme de vos propres supports. Notez quand, où et selon quelle méthode, et portez-le au rapport. Tant que cette destruction n’est pas démontrée, la captation reste pour la personne concernée un risque ouvert sur lequel elle n’a aucune prise.

Avertissez toutes les parties, même quand il n’y a rien à voir

Avertissez toutes les parties par écrit d’une captation de données, même quand l’étape paraît purement technique et qu’il n’y a rien à débattre sur le fond. Le principe du contradictoire ne dépend pas de la question de savoir s’il y a matière à débat ; il vaut pour l’opération elle-même.

Une captation est en outre le seul moment de l’expertise qui ne se refait pas. L’état du système à cet instant ne revient pas. Celui qui doit expliquer après coup pourquoi une partie n’y était pas ne discute plus de sa méthode, mais de son impartialité.

Pour aller plus loin

Craig Ball, Don’t BE a Tool, GET a Tool! (22 mars 2021). Ball aborde la même question par l’argument de l’intégrité : apprécier un élément de preuve dans l’application qui ouvre normalement le fichier modifie les métadonnées et casse la valeur de hachage. Sa conclusion rejoint celle qui précède, par un autre chemin.