Generalist AI Reviewer (Freelance)
chez Outlier
Évaluation et notation de modèles d'intelligence artificielle avant leur diffusion publique.
Contexte
Outlier est une entreprise spécialisée dans l’annotation de données de haute qualité, fournissant la matière première nécessaire à l’entraînement des intelligences artificielles (LLMs). La mission s’inscrivait dans un contexte de forte croissance où de nombreux modèles d’IA devaient être testés à grande échelle avant d’être mis entre les mains du grand public.
Ma mission
L’objectif de ma mission était d’évaluer plus de deux modèles d’IA distincts pour garantir la pertinence, l’innocuité et l’exactitude technique de leurs réponses. Il m’était demandé de fournir des retours humains de haute qualité (Human Feedback) afin de réduire le taux d’hallucination des modèles sur des requêtes complexes et variées.
Mes réalisations
Évaluation technique multidisciplinaire
L’IA était amenée à répondre sur des sujets extrêmement variés. J’ai testé et confronté les modèles dans plusieurs domaines de pointe : la programmation informatique (Java, Python, C++), les mathématiques avancées et le raisonnement logique général. Pour chaque réponse, j’ai vérifié la véracité des faits avancés en croisant les informations avec des documentations officielles, ce qui a permis d’écarter les réponses trompeuses.
Standardisation de la notation
Le processus d’évaluation nécessitait d’être standardisé pour être utile aux équipes de machine learning. J’ai évalué chaque réponse à l’aide d’une grille de notation stricte (évaluant la précision, l’utilité, et la dangerosité du contenu). J’ai systématiquement accompagné mes notes de rapports argumentés expliquant les raisons de l’échec ou de la réussite du modèle.
Ma contribution personnelle
En tant que freelance généraliste, j’étais responsable de bout en bout de mes lots d’évaluation. J’ai personnellement conçu les scénarios de tests transversaux et rédigé l’ensemble des rapports d’annotation associés à mon profil.
Technologies utilisées
- Java, Python, C++ → Langages utilisés pour auditer les snippets de code générés par les IA.
- Plateformes de Data Annotation → Outils internes utilisés pour structurer les retours et alimenter les pipelines de RLHF (Reinforcement Learning from Human Feedback).
Défis techniques
L’illusion de compétence de l’IA (Hallucinations confiantes)
L’IA adopte souvent un ton extrêmement confiant, même lorsqu’elle a tort. Le défi cognitif était de ne pas se laisser tromper par cette assurance, notamment lorsqu’elle passait d’un problème de mathématiques complexe à un algorithme en C++ dans la même session. La solution a été d’adopter une posture de doute systématique : chaque affirmation technique de la machine devait être prouvée mathématiquement ou programmatiquement avant d’être validée.
Résultats
- Plusieurs milliers de points de données générés sur une période de 9 mois.
- Participation active à l’amélioration de la fiabilité de multiples modèles pré-lancement.
Ce que j’ai appris
Compétences professionnelles : Cette mission m’a forgé une forte capacité d’adaptation et de gymnastique intellectuelle (context-switching). Compétences techniques : Évoluer quotidiennement entre différents langages de programmation et concepts mathématiques m’a permis de consolider ma culture générale en informatique.