Développeur Web
chez Techno Import Distribution
Développement d'un outil de scraping automatisé pour enrichir massivement le catalogue e-commerce d'un disquaire.
Contexte
Techno Import Distribution est une entreprise spécialisée dans la vente de disques vinyles (musiques électroniques). Son activité repose entièrement sur son site e-commerce. À mon arrivée, l’entreprise faisait face à un goulot d’étranglement majeur concernant la gestion de son catalogue : les nouveaux produits devaient être ajoutés à la main, un processus extrêmement chronophage pour les équipes de vente.
Ma mission
L’objectif de ma mission était de numériser et d’accélérer l’insertion des nouveaux vinyles dans le catalogue de la boutique en ligne. Il m’a été demandé de concevoir une solution technique capable de récupérer automatiquement les données manquantes sur internet et de les formater pour les injecter directement dans la base de données.
Mes réalisations
Automatisation de l’extraction de données (Scraping)
Le processus initial nécessitait qu’un employé recherche manuellement l’artiste, copie la tracklist, télécharge les pochettes et les extraits audio MP3, ce qui prenait en moyenne 10 minutes par disque. J’ai développé un script automatisé de Web Scraping. Ce bot parse les pages web des distributeurs de musique, identifie la structure HTML, et en extrait les métadonnées de manière structurée. La solution a permis de s’affranchir totalement de la recherche manuelle d’informations.
Intégration dans la base de données e-commerce
Les données brutes devaient ensuite être insérées dans le CMS du magasin. J’ai conçu un pipeline de transformation qui formate les données extraites (nettoyage des chaînes de caractères, formatage des URLs d’images et de MP3) et génère les requêtes d’insertion pour la base de données existante. L’intégration est désormais un processus en un clic, garantissant la cohérence des fiches produits.
Ma contribution personnelle
J’ai travaillé en totale autonomie sur ce projet de développement. J’ai personnellement assuré la conception de l’architecture du script, l’écriture du code de scraping, la gestion des erreurs, et l’intégration finale avec la base de données du magasin.
Technologies utilisées
- Python → Langage principal utilisé pour développer l’architecture du script de scraping (utilisation probable de bibliothèques comme BeautifulSoup ou Selenium).
- Base de données relationnelle → Cible finale pour l’insertion des fiches produits formatées.
- Regex (Expressions Régulières) → Utilisées pour parser et nettoyer les métadonnées textuelles complexes issues du HTML brut.
Défis techniques
L’instabilité des sources HTML
Le défi majeur du Web Scraping est la volatilité des sites cibles : la structure des pages web change fréquemment, et les informations (comme un extrait audio) peuvent parfois être manquantes. Le problème venait des exceptions levées par le script qui bloquaient l’import total d’un lot de disques dès qu’une information manquait. J’ai résolu ce problème en implémentant une gestion d’erreurs robuste (système de try/catch et fallbacks). Si une donnée est manquante, le script consigne l’avertissement dans un log mais continue l’import du reste des informations, rendant le pipeline résilient.
Résultats
- Plus de 500 vinyles ont été importés automatiquement et proprement dans le catalogue au cours de mes 3 mois de mission.
- Gain de temps massif : Plusieurs centaines d’heures de travail manuel ont été économisées, permettant au personnel de se recentrer sur le service client.
Ce que j’ai appris
Compétences techniques : J’ai acquis une solide expérience dans la manipulation de données non structurées (HTML) et dans la création de scripts résilients (gestion des erreurs à grande échelle). Compétences professionnelles : Cette expérience m’a fait prendre conscience de l’impact direct du code sur les processus métiers. J’y ai intégré un principe fort : automatiser au maximum les tâches répétitives pour générer de la valeur commerciale.