GoldFynch

GoldFynch est une plateforme d’e-discovery qui tourne dans le nuage. Vous y chargez un corpus, vous le ramenez par étapes à ce que couvre la mission, et vous produisez cette sélection. Cette page traite de la seconde partie : le filtrage, et les réglages qui décident si votre sélection tiendra lorsque quelqu’un la refera après vous.

Pourquoi tout capter et ne filtrer qu’après coup au lieu de sélectionner sur place est une autre question. Elle est traitée dans Pourquoi une plateforme d’e-discovery. La présente page commence une fois cette décision prise et les données rentrées.

Au préalable : le compte est le maillon faible

Configurez le compte avec une authentification à deux facteurs avant de vous rendre sur les lieux, pas après. Vous téléversez les données confidentielles d’autrui vers un service en nuage, et à partir de ce moment l’accès à ce compte est le maillon le plus faible de toute la chaîne. Plus faible que le chiffrement du service, plus faible que votre propre disque. Réglez cela quand vous avez le temps d’y réfléchir, pas dans un couloir chez une personne concernée.

Le chargement

Un PST est compressé et gonfle sensiblement à la lecture. Comptez grosso modo le double. Ce n’est pas un détail : sur une plateforme facturée au volume du case, ce chiffre détermine la tranche tarifaire dans laquelle vous tombez. Estimez donc le volume après décompression et vérifiez les tarifs en vigueur avant de créer un case. Le mode d’emploi de la création d’un case et du téléversement lui-même figure dans la documentation de GoldFynch : créer un case et téléverser des fichiers.

Une partie des fichiers ne peut pas être traitée. Fichiers vides, ou formats que la plateforme n’arrive pas à ouvrir. Ils ressortent du chargement sous forme de messages d’erreur. Ne les passez pas sous silence : notez combien il y en avait, ce que vous en avez fait, et intégrez-les à l’ensemble des données par souci d’exhaustivité plutôt que de les laisser disparaître discrètement. Un lecteur qui ne parvient pas à expliquer l’écart entre deux nombres va chercher quelque chose derrière.

Filtrer par étapes cumulatives

Filtrez par étapes, de manière cumulative, et donnez à chaque étape son propre tag. Par exemple :

  1. Périmètre des dossiers. Boîte de réception, éléments envoyés et éléments supprimés. Les éléments supprimés en font bel et bien partie ; ce que quelqu’un a jeté est souvent précisément ce que la mission recherche.
  2. Bornes de dates. La période imposée par le juge.
  3. Mots-clés. Les termes de recherche issus de la mission.

Après chaque étape, indiquez combien de fichiers subsistent. C’est cet entonnoir chiffré qui permet à un lecteur de refaire votre sélection. Sans ces nombres, il reste entre « la boîte aux lettres complète » et « les pièces produites » un trou sur lequel on vous interpellera à l’audience.

L’ordre de grandeur auquel ce type de dossier aboutit : de quelques dizaines de milliers de fichiers à quelques milliers. L’entonnoir doit surtout montrer les lignes situées entre ces deux extrêmes, chacune avec l’étape qui explique l’écart.

Entonnoir de filtrage GoldFynch Filtrage cumulatif : périmètre des dossiers, bornes de dates, mots-clés et enfin les familles. De quelques dizaines de milliers de fichiers à quelques milliers. Sans le réglage « apply tag to the whole family », les pièces jointes manquent. Dossiers visés quelques dizaines de milliers de fichiers Bornes de dates Mots-clés + familles, avec tag quelques milliers de fichiers + familles, sans tag pièces jointes absentes : comparez à la barre du dessus Barres cumulatives. La largeur donne l'ordre de grandeur, pas une échelle exacte.

Les pièces jointes : un réglage qui change tout

Activez apply tag to the whole family. À défaut, vous taguez le message sans ce qui y était attaché, et vous vous retrouvez avec une sélection dont les pièces jointes manquent, alors que ce sont généralement elles qui portent l’enjeu. Voyez le tagging des familles de fichiers dans la documentation de GoldFynch pour situer ce réglage par rapport aux deux autres options (demander à chaque fois, ou l’élément seul).

L’écart en nombre est considérable et il doit apparaître dans votre entonnoir. Placez l’étape avec et sans familles côte à côte, pour qu’un lecteur voie que vous y avez pensé.

Les mots-clés : c’est là que ça dérape le plus

La syntaxe avec AND, OR, NOT et les autres opérateurs est décrite dans la recherche par mots-clés et la recherche avancée de la documentation GoldFynch. Ce qui suit, ce sont les pièges que la syntaxe elle-même ne mentionne pas.

  • Cherchez sur des mots entiers. Un mot-clé qui apparaît aussi dans le domaine de messagerie de la personne concernée correspond sinon à cent pour cent du corpus. L’étape de filtrage ne fait alors rien, et cela ne se remarque qu’en relisant les nombres.
  • Utilisez des noms complets, pas des noms de famille. Deux homonymes de part et d’autre d’un litige, ce n’est pas une rareté.
  • Cherchez du côté opposé de la flèche. Chercher le nom d’une entreprise dans la boîte de cette même entreprise ramène tout. Cherchez la partie adverse, le tiers, le numéro de dossier : ce qui se trouve à l’autre bout de la relation.
  • Testez les termes courts avant de les figer. Tout ce qui fait moins de quatre ou cinq caractères produit du bruit à coup sûr. Lancez un tel terme une fois avec et une fois sans espaces autour, et comparez les nombres avant de l’intégrer à votre série de filtres.
  • Attendez-vous à ce que les mots-clés correspondent aussi aux noms de fichiers et de dossiers, et pas seulement au contenu. Tantôt cela aide, tantôt cela pollue. Savoir dans lequel des deux cas vous êtes suppose de regarder les résultats.
  • Définissez explicitement les indications de temps relatives. Plus récent que se lit autrement d’une partie à l’autre. Écrivez dans votre rapport quelles bornes de dates vous avez effectivement appliquées, en chiffres.

Produire au format d’origine

Choisissez le format d’origine, pas le PDF. La conversion détruit des métadonnées qui peuvent se révéler décisives plus tard : moments d’envoi, en-têtes et propriétés incorporées. Au moment de produire, elles ne vous manquent pas, et c’est précisément pour cela que ça tourne mal. Qui a besoin d’une version lisible la fabrique après coup à partir de l’original ; le chemin inverse n’existe pas. Les réglages de production (dont le choix entre « Natives only », « PDF only » et le format load file/base de données) sont décrits dans les productions dans GoldFynch.

Le caviardage, et le piège qui se cache derrière

Si la mission doit ménager un secret d’affaires, deux voies s’offrent à vous : exclure des fichiers entièrement, ou noircir des passages. Pour le noircissement, choisissez le mode définitif (Final), pas le mode d’aperçu (Preview). En mode aperçu, le texte est toujours là dessous et il part avec la production. Voyez le caviardage dans GoldFynch pour la distinction entre les deux modes.

Le vrai piège est plus profond. Un fichier enfant caviardé rend son conteneur inutilisable. Si le fichier caviardé se trouve dans un ZIP, ce ZIP ne peut plus être produit au format d’origine et vous récupérez une feuille intercalaire à la place. Le reste du contenu de cette archive disparaît alors de votre production. Livrez dans ce cas l’arborescence décompressée à côté, en vrac, et expliquez pourquoi dans votre rapport.

Le tour de vérification

Rechargez la production terminée dans un nouveau case vide et cherchez-y exactement ce qui aurait dû en être écarté. Zéro résultat, c’est la preuve que vous tenez avant la livraison au lieu d’après.

Cette étape coûte un quart d’heure et remplace des monceaux de bonnes intentions. C’est aussi le dernier moment où une erreur de caviardage se répare encore sans conséquence.

Clôturer

Supprimez les données de la plateforme de manière irrévocable dès que la production est acceptée, et notez la date et la méthode dans votre rapport. C’est cette mention qui s’oublie. Une suppression consignée nulle part, une partie ne peut pas la contrôler, et pour elle, elle n’a donc tout simplement pas eu lieu.

Formats marginaux

Une base Access ne rentre pas telle quelle. Convertissez d’abord en CSV et indiquez dans votre rapport combien de tables cela a donné et combien d’enregistrements répondaient finalement au critère de recherche. C’est la même logique d’entonnoir que pour le courrier : le lecteur doit pouvoir refaire le calcul depuis la base source jusqu’aux lignes produites.