04/2026 — Présent

Software Engineer – AI Code Evaluator (Freelance)

chez Alignerr

Évaluation de modèles d'IA avancés (Anthropic) sur des tâches de développement réelles et analyse des hallucinations.

Remote
PythonJavaC++Prompt EngineeringLLM Evaluation

Contexte

Alignerr est une plateforme spécialisée dans l’entraînement et l’évaluation rigoureuse des grands modèles de langage (LLMs) pour les acteurs majeurs de la Tech. À mon arrivée, l’entreprise était en pleine campagne d’évaluation pré-lancement de deux nouveaux modèles avancés d’Anthropic. Le besoin de l’entreprise était de s’assurer de la fiabilité absolue du code généré par ces modèles avant leur mise sur le marché.

Ma mission

L’objectif de ma mission était d’éprouver ces deux modèles d’IA face à des tâches d’ingénierie logicielle complexes. On attendait de moi que je sois la dernière ligne de défense humaine, capable d’identifier les failles, bugs ou erreurs logiques que les scripts de tests automatisés ne pouvaient pas repérer.

Mes réalisations

Revue de code et traque des hallucinations

Les IA génèrent souvent du code plausible mais factuellement faux (hallucinations). J’ai conçu de multiples scénarios et prompts techniques pour forcer les modèles à résoudre des algorithmes dans divers langages. L’approche consistait à extraire systématiquement le code généré, le compiler localement et écrire des tests unitaires pour prouver les défaillances. Cela a permis de remonter des vulnérabilités critiques et d’améliorer la fiabilité des réponses.

Rédaction de rapports d’évaluation (RLHF)

Le simple signalement d’un bug n’était pas suffisant pour ré-entraîner les modèles. J’ai rédigé des rapports techniques argumentés détaillant pourquoi le raisonnement de l’IA était défectueux (par exemple, un mauvais choix de structure de données entraînant une complexité inefficace). Ces retours ont été directement utilisés par les ingénieurs d’Anthropic pour corriger le comportement des IA via le processus de RLHF.

Ma contribution personnelle

S’agissant d’une mission en freelance 100% asynchrone, la totalité des évaluations, de l’écriture des tests et de la rédaction des rapports techniques présentés relèvent de mon travail individuel.

Technologies utilisées

  • Python, Java, C++ → Langages cibles utilisés pour compiler, tester et débugger les réponses des modèles.
  • Prompt Engineering → Techniques de rédaction avancées pour contraindre le contexte des modèles lors de la génération.

Défis techniques

Les erreurs de logique silencieuses

Le problème majeur venait du fait que le code produit par l’IA compilait presque toujours. Il était impossible de se fier à une analyse syntaxique basique. L’approche retenue a été d’ignorer la syntaxe au premier regard pour se concentrer uniquement sur la logique métier et la complexité temporelle/spatiale des algorithmes, ce qui requiert une attention soutenue.

Résultats

  • 14 tâches de développement logiciel complexes ont été intégralement évaluées.
  • De multiples erreurs de logique ont été interceptées et documentées avant la sortie publique des modèles Anthropic.

Ce que j’ai appris

Compétences techniques : Je suis désormais capable de repérer très rapidement des failles de logique invisibles à la première lecture (Code Review de haut niveau). Compétences professionnelles : J’ai développé une grande rigueur dans la rédaction technique, apprenant à justifier de façon incontestable chaque décision d’ingénierie.