Une expérience en ligne randomisée publiée le 21 août dans la revue Work a réparti 505 travailleurs allemands issus de secteurs variés dans l’une de trois conditions — absence d’utilisation de LLM, utilisation de LLM imposée ou utilisation de LLM volontaire — puis leur a fait réaliser deux tâches professionnelles. L’étude a ensuite mesuré trois caractéristiques du travail et un indicateur de performance.
Ce que l’étude a montré
L’utilisation de LLM a réduit l’autonomie dans la prise de décision, le traitement de l’information et la performance dans la prise de décision. Elle a aussi réduit la surcharge de rôle — le seul effet que les travailleurs percevraient comme un soulagement. L’usage volontaire a atténué les effets négatifs tout en conservant cet avantage. Le besoin d’autonomie a modéré les résultats, amplifiant l’effet sur l’autonomie décisionnelle ; le besoin de cognition n’a montré aucun effet modérateur.
Ce que le cadrage courant passe à côté
La phrase qui sera reprise est la suivante : « L’IA rend les travailleurs moins performants pour décider. » Le protocole soutient quelque chose de plus étroit et nettement plus utile : les dégâts suivent l’usage imposé. Le même outil, confié à quelqu’un qui l’a choisi, produit des résultats différents. Il s’agit d’un constat sur la manière dont les organisations déploient l’IA, pas sur ce que fait l’IA — et le mode de déploiement est précisément la variable qu’un employeur contrôle lorsqu’il procède à un déploiement par le haut. Si l’on y voit un réquisitoire contre la technologie, cela dit une chose ; si l’on y voit un réquisitoire contre l’injonction, cela dit quelque chose qu’une équipe opérationnelle peut exploiter.
Les limites sont structurelles, pas accidentelles
Il s’agit d’une expérience en ligne portant sur deux tâches courtes, avec des caractéristiques du travail autoévaluées, et non d’une mesure de productivité en situation réelle. Cela achète une clarté causale au prix de la validité externe, et trois des quatre résultats relèvent de perceptions plutôt que d’une production mesurée — la performance décisionnelle fait exception. L’échantillon est auto-sélectionné, en ligne et limité à l’Allemagne. Rien de cela ne rend le résultat faux ; cela en fait un résultat contrôlé qui attend une réplication sur le terrain.
Pourquoi ce design est rare
Presque toutes les données sur le marché du travail concernant les grands modèles de langage sont observationnelles ou produites par des fournisseurs sur leurs propres produits. Une affectation randomisée en trois bras qui isole le caractère volontaire de l’outil est rare, et elle met en évidence le mécanisme plutôt que la corrélation. Si l’effet se confirme lors d’une réplication en entreprise, l’implication pratique serait d’une rare netteté : la manière dont un déploiement est présentée pourrait compter davantage pour le résultat que le modèle effectivement déployé.
