Traitement de la donnée

Data

Traitement de la donnée

Collecter, nettoyer, fiabiliser. La partie la moins visible du travail, et celle qui conditionne tout le reste.

Un tableau de bord ne vaut que ce que valent les données qui l’alimentent. Or ces données arrivent de partout : exports d’ERP, fichiers plats déposés par un fournisseur, API d’un service en ligne, saisies manuelles avec leurs inévitables coquilles.

Ce que je prends en charge

  • Extraction — bases de données, fichiers CSV et Excel, API REST, boîtes mail, services SaaS.
  • Transformation — normalisation des formats, déduplication, rapprochement entre référentiels, calculs métier.
  • Contrôle qualité — règles de validation, détection des valeurs aberrantes, alertes avant diffusion.
  • Ordonnancement — exécution planifiée, reprise sur erreur, journalisation.

Les outils

Je travaille principalement avec Apache Hop, le successeur libre de Kettle placé sous gouvernance de la fondation Apache, et avec Pentaho Data Integration pour les environnements qui l’utilisent déjà.

Le choix n’est pas dogmatique. Un flux Python bien écrit fait parfois mieux l’affaire qu’un outil graphique — notamment quand l’équipe en place est composée de développeurs. La vraie question est : qui maintiendra ce flux dans deux ans, et avec quelles compétences ?

Un signe qui ne trompe pas

Si quelqu’un chez vous consacre plusieurs heures par semaine à ressaisir ou recopier des données d’un système vers un autre, ce temps est récupérable presque intégralement. Et l’automatisation supprime au passage les erreurs de recopie, qui sont invisibles jusqu’au jour où elles ne le sont plus.

Vos données vous font perdre du temps ?

Décrivez-moi le circuit actuel. Je vous dirai ce qui peut être automatisé et à quel coût.